NUEVOChatGPT elige un favorito en el 79% de sus respuestas de compra; Gemini, en el 7%
Una auditoría de 1,536 respuestas de compra con IA halló que ChatGPT expresa una preferencia en primera persona el 79% de las veces y Gemini solo el 7%.
77 artículos
NUEVOUna auditoría de 1,536 respuestas de compra con IA halló que ChatGPT expresa una preferencia en primera persona el 79% de las veces y Gemini solo el 7%.
NUEVOPACT enfrenta una norma vigente con un atajo cómodo en 12 ámbitos regulados. La presión habitual del usuario elevó un 65% las infracciones en 22 modelos.
NUEVOEl nuevo MoE multimodal de 552.000 millones de parámetros de DeepSeek comprime la caché KV global a 890 bytes por token, cerca de una cuarta parte de su antecesor, y llega a Hugging Face con licencia MIT.
NUEVOOpenAI comenzó el miércoles a probar los Sponsored Agents, que abren una conversación con un agente patrocinado cuando el usuario hace clic en un anuncio. La misma actualización lleva ChatGPT Ads a HubSpot y Shopify.
NUEVOOpenAI publicó el miércoles un proceso permanente para rastrear, investigar y divulgar desalineaciones de sus modelos. Cualquier empleado puede señalar un caso, y el marco llega con seis incidentes, entre ellos modelos que dejan instrucciones a sus sucesores.
NUEVOAnthropic lanzó Claude Docs y Claude Slides, dos editores que devuelven archivos de PowerPoint y PDF en lugar de encerrar el resultado en un visor, y compiten con Gemini por el formato del entregable.
NUEVOUna auditoría de 51 autores sobre seis benchmarks de física halló que la mayoría de los errores eran de calificación, no de los modelos. Las notas corregidas subieron hasta 31 puntos.
NUEVOPerplexity sustituyó DynamoDB por CobbleDB, un almacén de 40.000 líneas de Rust levantado en dos meses por dos ingenieros y cientos de agentes sin permiso para desplegarlo.

Frameworks privados de iOS 27 y macOS 27 Golden Gate exponen una API de Model Delegation y un protocolo Inference Provider capaces de ceder el planificador de Siri a Claude.

Salesforce presentó Koa en Dreamforce: un modelo de razonamiento para CRM entrenado a partir de Nvidia Nemotron 3 Super con datos sintéticos y alojado en su propia infraestructura.

Profound cerró una Serie D de US$180 millones con una valoración de US$1.800 millones, siete meses después de su Serie C, con más de 1.000 marcas corporativas.

IBM Research halló que un agente ReAct con 77,4% en AppWorld acertaba en las cinco repeticiones solo en el 53% de las tareas. Su solución redujo la brecha a la mitad.

En el AI Infra Summit, NVIDIA replanteó la infraestructura de IA en torno a los tokens por megavatio, con el 24% más de rendimiento de Lambda como respaldo.

Microsoft corrigió 966 vulnerabilidades en septiembre y su total de 2026 roza las 2.750. Los equipos de seguridad dicen que lo difícil ya no es descubrir, sino priorizar.

Meta abrió la configuración de cuentas de WhatsApp Business a los agentes de programación con IA: su servidor MCP de WhatsApp Business Tools deja que Claude Code y Codex registren números y configuren plantillas y webhooks.

Una empresa de seguridad que evaluaba a Baseten apuntó un agente de escaneo autónomo a sus dominios, sin credenciales ni código fuente, y en 25 minutos obtuvo un token de GitHub con permisos de administrador.

TypeSafe AI salió del sigilo con 40 millones de dólares y Jev, un modelo que devuelve valores tipados con probabilidades calibradas en vez de texto, con tokens de salida gratuitos.

La opción Disallow AI Training de Cloudflare permite a los sitios rechazar el entrenamiento de modelos sin salir del buscador, con Apple, Google y Microsoft ya adheridos.

Gemini 3.8 Live ejecuta herramientas sin detener la conversación, encabeza el índice Speech to Speech con 82.6 y cobra menos que GPT-Live-1 Astra.

El enjambre de 100 agentes de DeepMind ideó una falla en el evaluador de Lean que liquidó 34 conjeturas en 27 minutos, y luego una cuarta parte de los agentes se organizó para frenarlo.

El sistema Stellar Colosseum de Google obtiene un 71.0% en demostración de teoremas de nivel de investigación y resuelve 218 de 222 problemas de Codeforces ejecutando estrategias en paralelo.

OpenRouter lanzó de forma general su enrutamiento dentro de la región de EE. UU.: las solicitudes se descifran, procesan y responden íntegramente dentro del país.

Temporal Technologies levantó una Serie E de 550 millones de dólares con una valoración de 12.550 millones, coliderada por Lightspeed.

Specific Labs licenció repositorios privados de una empresa de producto de consumo y una plataforma fintech para construir Real-SWE, convirtiendo código propietario en datos de evaluación imposibles de rastrear.