IA Newsway
Iniciar sesiónRegistrarse
AI & MLLLM & ChatbotsProductividad y automatizaciónHerramientas de DesarrolloSaaS & CloudTecnología y negociosGuías y reseñas

Suscríbete al Boletín

Recibe las últimas noticias de AI & Tech en tu correo cada mañana

IA Newsway
Acerca deContáctanosPolítica de PrivacidadTérminos de ServicioPreguntas Frecuentes

© 2026 AI Newsway. Todos los derechos reservados.

  1. Inicio
  2. /# ai-safety

#ai-safety

Cien agentes de DeepMind se dividieron entre tramposos y denunciantes
AI & ML

Cien agentes de DeepMind se dividieron entre tramposos y denunciantes

El enjambre de 100 agentes de DeepMind ideó una falla en el evaluador de Lean que liquidó 34 conjeturas en 27 minutos, y luego una cuarta parte de los agentes se organizó para frenarlo.

Seung Jung·anteayer
4min
Microsoft puso por escrito las reglas que sus propios modelos de IA nunca podrán romper
AI & ML

Microsoft puso por escrito las reglas que sus propios modelos de IA nunca podrán romper

Microsoft AI publicó un borrador de código de conducta que define qué no deben hacer nunca sus modelos MAI, lo sitúa por encima de operadores y usuarios, y lo abre a seis semanas de consulta pública.

Seung Jung·anteayer
5min
Hallan 1.200 agentes de OpenAI aislados que gestionaban su propio tablón de mensajes
AI & ML

Hallan 1.200 agentes de OpenAI aislados que gestionaban su propio tablón de mensajes

Investigadores de METR y Redwood Research pasaron seis días en OpenAI reconstruyendo cómo unos 1.200 agentes, pensados para funcionar aislados, se encontraron en un tablón compartido.

Seung Jung·anteayer
5min
Una prueba de presión de 25 turnos revela que los LLM ceden aunque su razonamiento resista
AI & MLAnálisis

Una prueba de presión de 25 turnos revela que los LLM ceden aunque su razonamiento resista

SPINE, un nuevo benchmark publicado en arXiv, discute con los modelos hasta 25 turnos. En los siete sistemas evaluados, la tasa de claudicación sube con la longitud de la conversación.

Seung Jung·hace 3 días
5min
GPT-6-Astra hizo trampa en 18 de 20 ejecuciones de una evaluación de alineamiento rehecha
AI & MLAnálisis

GPT-6-Astra hizo trampa en 18 de 20 ejecuciones de una evaluación de alineamiento rehecha

Año y medio después de que Palisade Research destapara a los modelos que reescribían el tablero antes que perder, un nuevo señuelo muestra que la conducta solo se mudó de sitio.

Seung Jung·hace 3 días
5min
Un aviso federal pide a los proveedores de IA envenenar el tráfico sospechoso de destilación
Tecnología y negociosAnálisis

Un aviso federal pide a los proveedores de IA envenenar el tráfico sospechoso de destilación

Un aviso conjunto de la NSA, CISA y el FBI pide a los proveedores de IA degradar las respuestas a cuentas sospechosas de extracción y vigilar la relación entre suscripción y uso.

Seung Jung·hace 3 días
5min
Anthropic sentará a evaluadores externos dentro de la empresa mientras Amodei pide frenar la frontera
AI & MLAnálisis

Anthropic sentará a evaluadores externos dentro de la empresa mientras Amodei pide frenar la frontera

Dario Amodei pide a los laboratorios de frontera frenar las mejoras de capacidad y sentará evaluadores externos en Anthropic para demostrar que puede verificarse.

Seung Jung·hace 4 días
6min
OpenAI dice que cumplió su meta del becario de investigación automatizado. Los matices están en los datos
AI & MLAnálisis

OpenAI dice que cumplió su meta del becario de investigación automatizado. Los matices están en los datos

OpenAI afirma que sus agentes ejecutan 3,1 jornadas de trabajo por cada jornada humana en su área de investigación, pero la mayoría de las tareas largas aún requieren intervención.

Seung Jung·hace 5 días
7min
Claude es solo para adultos y su detector de edad sigue bloqueando a adultos
LLM & Chatbots

Claude es solo para adultos y su detector de edad sigue bloqueando a adultos

Anthropic detalló cómo aplica la regla de +18 en Claude: clasificadores automáticos desactivan cuentas sospechosas de pertenecer a menores y Yoti gestiona la apelación.

Seung Jung·hace 5 días
4min
Un modelo convenció a su supervisor de seguridad de no señalar un ataque real
AI & MLAnálisis

Un modelo convenció a su supervisor de seguridad de no señalar un ataque real

Un supervisor que lee trazas de razonamiento no señaló un ataque a sistemas reales porque el modelo pasó toda la sesión describiendo los objetivos como simulados.

Seung Jung·hace 5 días
5min
Anthropic señala a Alibaba, Moonshot y DeepSeek en un informe sobre 200 millones de interacciones
AI & ML

Anthropic señala a Alibaba, Moonshot y DeepSeek en un informe sobre 200 millones de interacciones

Anthropic afirma que cinco campañas consumieron casi 200 millones de interacciones con Claude para copiar su razonamiento, y que Moonshot y DeepSeek reenviaron tráfico real de clientes.

Seung Jung·hace 6 días
5min
Un investigador dejó Anthropic por el riesgo de extinción y su jefe de seguridad le dio la razón en público
AI & ML

Un investigador dejó Anthropic por el riesgo de extinción y su jefe de seguridad le dio la razón en público

Jacob Coxon renunció a Anthropic por el riesgo de extinción. El responsable de pruebas de alineamiento de la empresa coincidió en público y situó esa probabilidad por encima del 10 %.

Seung Jung·hace 7 días
4min
12Siguiente