El mejor modelo en el nuevo test de salud mental de OpenAI saca 57,3%

Más de 80 clínicos redactaron los criterios. Ningún modelo llegó al 60%.

|6 min de lectura0
An open-source AI chat interface of the kind MentalHealthBench evaluates, scoring model replies in mental health conversations against clinician-written rubrics.
An open-source AI chat interface of the kind MentalHealthBench evaluates, scoring model replies in mental health conversations against clinician-written rubrics.

OpenAI publicó MentalHealthBench el 23 de septiembre, un benchmark abierto que puntúa cómo responden los modelos de IA en conversaciones sobre salud mental, desde el estrés cotidiano hasta las emergencias. La nota más alta que alcanzó cualquier modelo fue 57,3%, y correspondió al propio GPT-6 Astra de OpenAI. La metodología completa está en el informe técnico que acompaña al lanzamiento.

Puntos clave

  • MentalHealthBench se creó junto a más de 80 psicólogos y psiquiatras colegiados de 22 países, que hablan 19 idiomas y cubren cerca de 20 subespecialidades de salud mental.
  • GPT-6 Astra encabezó la tabla con 57,3%, seguido por GPT-6 Sol con 53,9%, Claude Opus 5.5 con 52,4%, GPT-6 Luna con 50,2% y Muse Spark 1.3 con 47%; el GPT-4o de marzo de 2025 obtuvo 32,1% y Gemini 2.5 Pro, 29,5%.
  • Algo más de la mitad de los escenarios, el 53,5%, son conversaciones no agudas; el 18,2% son de alta gravedad y el 28,3% involucra emergencias que exigen ayuda inmediata en el mundo real.

Cómo escribieron los criterios los clínicos

Para cada conversación del conjunto de datos, expertos en salud mental redactaron criterios que describen qué debería contener una respuesta adecuada al último mensaje del usuario. Cada criterio lleva un peso de -10 a +10: los valores positivos premian conductas beneficiosas y los negativos penalizan respuestas potencialmente dañinas. Los pesos mayores van a lo que el panel consideró clínicamente más importante en ese intercambio concreto.

El acuerdo funcionó como requisito, no como promedio. Al menos tres expertos revisaron cada conversación, y un criterio solo sobrevivía si dos coincidían y un tercero no lo contradecía. Ese diseño cambia cobertura por solidez: todo aquello en lo que el panel se dividió nunca llegó a la puntuación.

Las conversaciones son datos sintéticos, escritos para reflejar patrones observados de uso de la IA en lugar de extraerse de chats privados. Abarcan adultos, adolescentes de 13 a 17 años, cuidadores y clínicos, y más de la mitad supera los cinco mensajes, de modo que los modelos se califican por cómo sostienen un hilo y no por indicaciones aisladas. Algunos escenarios añaden además datos de contexto sobre el usuario sintético, lo que permite comprobar si el modelo aprovecha esa información cuando la tiene.

Qué miden realmente las notas

Los resultados se desglosan en diez áreas de conducta, entre ellas el contexto y la evaluación, la exactitud clínica, la calibración de la urgencia, la evitación de daños, la empatía y el apoyo, las indicaciones accionables y la preservación de la autonomía del usuario. OpenAI aclara que se trata de puntuaciones de MentalHealthBench y no de medidas de eficacia clínica: la pregunta es si una respuesta muestra las conductas que identificó el panel de expertos.

Leído así, el dato interesante no es el ranking sino el techo. Un máximo de 57,3% en criterios escritos por clínicos en ejercicio indica que la frontera está más cerca del aprobado raspado que de la competencia real, en una tarea para la que millones de personas ya usan chatbots. La distancia entre los líderes también es corta: menos de cinco puntos separan a los tres primeros. La brecha con el GPT-4o de principios de 2025, en cambio, ronda los 25 puntos, la prueba más clara de que la conducta mejora de una generación a otra.

Para quien desarrolla un producto de chat de consumo, lo más útil es el desglose por tramos. Las notas pueden separarse por urgencia, por perfil de usuario y por conducta individual, lo que significa que dos modelos separados por un punto en el total pueden divergir mucho en ese 28,3% de escenarios con una emergencia real. Un porcentaje agregado esconde justamente los casos donde una respuesta equivocada cuesta más caro. Cualquier equipo que evalúe un modelo para una función cercana al acompañamiento debería leer primero el tramo de emergencias y dejar la cifra global para el final.

Donde usuarios y clínicos no coincidieron

OpenAI hizo además un estudio aparte con 44 adultos de 16 países que ya habían recurrido a la IA para temas de salud mental o apoyo emocional, mostrándoles solo conversaciones no agudas. Esos participantes valoraron más los pasos prácticos y el tono. Los clínicos dieron más peso a reunir contexto y a interpretar con cuidado las situaciones ambiguas.

La divergencia quedó sin resolver a propósito: el estudio con usuarios no alteró los criterios finales del benchmark, que siguen anclados en el consenso experto. Eso implica que un modelo podría ajustarse para puntuar bien aquí y aun así resultar poco útil para las personas de las que trata el benchmark, una tensión que el lanzamiento documenta en lugar de zanjar. Arthur Evans, director ejecutivo de la Asociación Estadounidense de Psicología, planteó así el argumento de fondo en declaraciones recogidas por EdTech Innovation Hub:

La salud mental existe en un continuo, desde el bienestar pleno hasta el estrés cotidiano y la crisis aguda. Los sistemas de IA que interactúan con las personas a lo largo de ese rango deben apoyarse tanto en la ciencia clínica como en la experiencia vivida.

Las salvedades que conviene arrastrar

El lanzamiento llega con dos límites estructurales. La corrección la hace de forma automática GPT-5.6 Sol, así que un modelo de OpenAI puntúa a sus competidores con criterios encargados por OpenAI; está declarado, pero es una dependencia que cualquier réplica externa querrá modificar. Y la mezcla de niveles de gravedad se construyó para evaluar: OpenAI señala que no representa con qué frecuencia ocurre cada tipo de conversación en ChatGPT, y repite que ChatGPT no sustituye a la terapia ni a la atención profesional.

Lo que más importa es que el benchmark se publicó de forma abierta, de modo que investigadores externos pueden inspeccionar la metodología y correr sus propias evaluaciones. La corrección independiente es lo que convertiría ese 57,3% en una cifra sobre la que el campo pueda discutir, igual que el trabajo previo sobre la caída de las puntuaciones de toxicidad solo resultó útil cuando otros pudieron reproducirlo. Los detalles están en la página del anuncio de OpenAI.

FAQ — Preguntas frecuentes

¿Pueden usar MentalHealthBench investigadores externos?

Sí. OpenAI lo liberó públicamente para que investigadores y desarrolladores puedan revisar la metodología, ejecutar sus propias evaluaciones y construir sobre el trabajo. La compañía dice que usará el benchmark junto a sus otras investigaciones de salud mental y sus evaluaciones de seguridad de modelos.

¿MentalHealthBench usa conversaciones reales de ChatGPT?

No. Todos los escenarios son sintéticos, escritos para reflejar patrones reales de uso de la IA y no tomados de chats privados. La mezcla de niveles de gravedad se construyó para la evaluación y no representa con qué frecuencia ocurre cada tipo de conversación en ChatGPT.

¿Qué modelo sacó la nota más alta y quién corrige las respuestas?

GPT-6 Astra obtuvo la nota más alta con 57,3%, por delante de GPT-6 Sol con 53,9% y Claude Opus 5.5 con 52,4%. Las respuestas las califica automáticamente GPT-5.6 Sol siguiendo los criterios escritos por los expertos, no los clínicos en persona.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

OpenAI reduce a la mitad el precio de sus modelos intermedios, pero GPT-5.6 sigue ganando en dos pruebas
Developer Tools

OpenAI reduce a la mitad el precio de sus modelos intermedios, pero GPT-5.6 sigue ganando en dos pruebas

OpenAI lanzó el martes dos modelos intermedios y construyó su argumento casi por completo sobre el precio. GPT-6 Sol cuesta 2 dólares por millón de tokens de entrada y 10 por millón de salida.

Seung Junghace 5 días
GPT-6 Astra se pone a trabajar: el modelo más caro de OpenAI lo apuesta todo al manejo del ordenador
LLM & Chatbots

GPT-6 Astra se pone a trabajar: el modelo más caro de OpenAI lo apuesta todo al manejo del ordenador

GPT-6 Astra llega a los clientes empresariales con manejo del ordenador, un contexto de un millón de tokens y precios de 10 y 50 dólares, con una salvedad sobre su puntuación estrella.

Seung Junghace 18 días
ChatGPT Images 2.5 reduce a la mitad la latencia y suma un lienzo de dibujo
LLM & Chatbots

ChatGPT Images 2.5 reduce a la mitad la latencia y suma un lienzo de dibujo

OpenAI lanzó ChatGPT Images 2.5 con hasta un 50% menos de latencia, un lienzo de dibujo Sketch, plantillas, comentarios anclados y dos modelos nuevos en la API.

Seung Junghace 17 días
Astra for Law de OpenAI no es un modelo nuevo: es un índice de búsqueda de 230 millones de URL
LLM & Chatbots

Astra for Law de OpenAI no es un modelo nuevo: es un índice de búsqueda de 230 millones de URL

Astra for Law combina GPT-6 Astra con un índice jurídico de 230 millones de URL y eleva la precisión del Legal Research Bench del 38,7% al 54%.

Seung Junghace 10 días
Claude es solo para adultos y su detector de edad sigue bloqueando a adultos
LLM & Chatbots

Claude es solo para adultos y su detector de edad sigue bloqueando a adultos

Anthropic detalló cómo aplica la regla de +18 en Claude: clasificadores automáticos desactivan cuentas sospechosas de pertenecer a menores y Yoti gestiona la apelación.

Seung Junghace 16 días
OpenAI lanza el mismo día un agente de Datos y un ChatGPT para Wall Street
LLM & Chatbots

OpenAI lanza el mismo día un agente de Datos y un ChatGPT para Wall Street

OpenAI presentó el mismo jueves un agente de Datos para ChatGPT Work y ChatGPT for Financial Services, desarrollado con Morgan Stanley y Evercore.

Seung Junghace 17 días