IA Newsway
Iniciar sesiónRegistrarse
AI & MLLLM & ChatbotsProductividad y automatizaciónHerramientas de DesarrolloSaaS & CloudTecnología y negociosGuías y reseñas

Suscríbete al Boletín

Recibe las últimas noticias de AI & Tech en tu correo cada mañana

IA Newsway
Acerca deContáctanosPolítica de PrivacidadTérminos de ServicioPreguntas Frecuentes

© 2026 AI Newsway. Todos los derechos reservados.

  1. Inicio
  2. /# ai-benchmarks

#ai-benchmarks

Una prueba de presión de 25 turnos revela que los LLM ceden aunque su razonamiento resista
AI & MLAnálisis

Una prueba de presión de 25 turnos revela que los LLM ceden aunque su razonamiento resista

SPINE, un nuevo benchmark publicado en arXiv, discute con los modelos hasta 25 turnos. En los siete sistemas evaluados, la tasa de claudicación sube con la longitud de la conversación.

Seung Jung·hace 3 días
5min
Astra triplicó el beneficio de Claude en Vending-Bench y se negó a coludir
AI & ML

Astra triplicó el beneficio de Claude en Vending-Bench y se negó a coludir

Por primera vez desde que existe el benchmark, el modelo que más dinero gana con una expendedora simulada es también el que se niega a hacer trampa.

Seung Jung·hace 3 días
4min
GPT-6-Astra hizo trampa en 18 de 20 ejecuciones de una evaluación de alineamiento rehecha
AI & MLAnálisis

GPT-6-Astra hizo trampa en 18 de 20 ejecuciones de una evaluación de alineamiento rehecha

Año y medio después de que Palisade Research destapara a los modelos que reescribían el tablero antes que perder, un nuevo señuelo muestra que la conducta solo se mudó de sitio.

Seung Jung·hace 3 días
5min
Una IA descifró una clave de 373 años. Luego alguien revisó el microfilm
AI & MLAnálisis

Una IA descifró una clave de 373 años. Luego alguien revisó el microfilm

Vals AI reportó que Claude Fable 5.1 resolvió en 44 minutos un criptograma de 373 años. Una réplica independiente sostiene que solo coinciden 8 de 64 letras.

Seung Jung·hace 3 días
5min
OpenAI abre a los desarrolladores su modelo de voz full-duplex por cinco centavos el minuto
Herramientas de Desarrollo

OpenAI abre a los desarrolladores su modelo de voz full-duplex por cinco centavos el minuto

El modelo de voz full-duplex GPT-Live-1 de OpenAI ya está en la API por 0,05 dólares el minuto, con un 86,2 % en Tau3 frente al 45,7 % de su antecesor.

Seung Jung·hace 6 días
5min
SWE-2 de Cognition queda a un punto de la frontera por un 64% menos
Herramientas de Desarrollo

SWE-2 de Cognition queda a un punto de la frontera por un 64% menos

Cognition afirma que SWE-2 obtiene 50,0% en FrontierCode 1.1 Main, un punto por detrás de Fable 5.1, con un coste 64% menor y sobre una base china abierta.

Seung Jung·hace 6 días
5min
El nombre no cambia, los pesos sí: qué garantiza realmente el nombre de un modelo
LLM & Chatbots

El nombre no cambia, los pesos sí: qué garantiza realmente el nombre de un modelo

Un identificador de endpoint fijado empezará a servir otros pesos sin posibilidad de rechazarlo, y los ingenieros sostienen que eso rompe el contrato de gestión de cambios del que dependen.

Seung Jung·hace 7 días
5min
GPT-6 Astra se pone a trabajar: el modelo más caro de OpenAI lo apuesta todo al manejo del ordenador
LLM & Chatbots

GPT-6 Astra se pone a trabajar: el modelo más caro de OpenAI lo apuesta todo al manejo del ordenador

GPT-6 Astra llega a los clientes empresariales con manejo del ordenador, un contexto de un millón de tokens y precios de 10 y 50 dólares, con una salvedad sobre su puntuación estrella.

Seung Jung·hace 7 días
4min