OpenAI publicó MentalHealthBench el 23 de septiembre, un benchmark abierto que puntúa cómo responden los modelos de IA en conversaciones sobre salud mental, desde el estrés cotidiano hasta las emergencias. La nota más alta que alcanzó cualquier modelo fue 57,3%, y correspondió al propio GPT-6 Astra de OpenAI. La metodología completa está en el informe técnico que acompaña al lanzamiento.
Puntos clave
- MentalHealthBench se creó junto a más de 80 psicólogos y psiquiatras colegiados de 22 países, que hablan 19 idiomas y cubren cerca de 20 subespecialidades de salud mental.
- GPT-6 Astra encabezó la tabla con 57,3%, seguido por GPT-6 Sol con 53,9%, Claude Opus 5.5 con 52,4%, GPT-6 Luna con 50,2% y Muse Spark 1.3 con 47%; el GPT-4o de marzo de 2025 obtuvo 32,1% y Gemini 2.5 Pro, 29,5%.
- Algo más de la mitad de los escenarios, el 53,5%, son conversaciones no agudas; el 18,2% son de alta gravedad y el 28,3% involucra emergencias que exigen ayuda inmediata en el mundo real.
Cómo escribieron los criterios los clínicos
Para cada conversación del conjunto de datos, expertos en salud mental redactaron criterios que describen qué debería contener una respuesta adecuada al último mensaje del usuario. Cada criterio lleva un peso de -10 a +10: los valores positivos premian conductas beneficiosas y los negativos penalizan respuestas potencialmente dañinas. Los pesos mayores van a lo que el panel consideró clínicamente más importante en ese intercambio concreto.
El acuerdo funcionó como requisito, no como promedio. Al menos tres expertos revisaron cada conversación, y un criterio solo sobrevivía si dos coincidían y un tercero no lo contradecía. Ese diseño cambia cobertura por solidez: todo aquello en lo que el panel se dividió nunca llegó a la puntuación.
Las conversaciones son datos sintéticos, escritos para reflejar patrones observados de uso de la IA en lugar de extraerse de chats privados. Abarcan adultos, adolescentes de 13 a 17 años, cuidadores y clínicos, y más de la mitad supera los cinco mensajes, de modo que los modelos se califican por cómo sostienen un hilo y no por indicaciones aisladas. Algunos escenarios añaden además datos de contexto sobre el usuario sintético, lo que permite comprobar si el modelo aprovecha esa información cuando la tiene.
Qué miden realmente las notas
Los resultados se desglosan en diez áreas de conducta, entre ellas el contexto y la evaluación, la exactitud clínica, la calibración de la urgencia, la evitación de daños, la empatía y el apoyo, las indicaciones accionables y la preservación de la autonomía del usuario. OpenAI aclara que se trata de puntuaciones de MentalHealthBench y no de medidas de eficacia clínica: la pregunta es si una respuesta muestra las conductas que identificó el panel de expertos.
Leído así, el dato interesante no es el ranking sino el techo. Un máximo de 57,3% en criterios escritos por clínicos en ejercicio indica que la frontera está más cerca del aprobado raspado que de la competencia real, en una tarea para la que millones de personas ya usan chatbots. La distancia entre los líderes también es corta: menos de cinco puntos separan a los tres primeros. La brecha con el GPT-4o de principios de 2025, en cambio, ronda los 25 puntos, la prueba más clara de que la conducta mejora de una generación a otra.
Para quien desarrolla un producto de chat de consumo, lo más útil es el desglose por tramos. Las notas pueden separarse por urgencia, por perfil de usuario y por conducta individual, lo que significa que dos modelos separados por un punto en el total pueden divergir mucho en ese 28,3% de escenarios con una emergencia real. Un porcentaje agregado esconde justamente los casos donde una respuesta equivocada cuesta más caro. Cualquier equipo que evalúe un modelo para una función cercana al acompañamiento debería leer primero el tramo de emergencias y dejar la cifra global para el final.
Donde usuarios y clínicos no coincidieron
OpenAI hizo además un estudio aparte con 44 adultos de 16 países que ya habían recurrido a la IA para temas de salud mental o apoyo emocional, mostrándoles solo conversaciones no agudas. Esos participantes valoraron más los pasos prácticos y el tono. Los clínicos dieron más peso a reunir contexto y a interpretar con cuidado las situaciones ambiguas.
La divergencia quedó sin resolver a propósito: el estudio con usuarios no alteró los criterios finales del benchmark, que siguen anclados en el consenso experto. Eso implica que un modelo podría ajustarse para puntuar bien aquí y aun así resultar poco útil para las personas de las que trata el benchmark, una tensión que el lanzamiento documenta en lugar de zanjar. Arthur Evans, director ejecutivo de la Asociación Estadounidense de Psicología, planteó así el argumento de fondo en declaraciones recogidas por EdTech Innovation Hub:
La salud mental existe en un continuo, desde el bienestar pleno hasta el estrés cotidiano y la crisis aguda. Los sistemas de IA que interactúan con las personas a lo largo de ese rango deben apoyarse tanto en la ciencia clínica como en la experiencia vivida.
Las salvedades que conviene arrastrar
El lanzamiento llega con dos límites estructurales. La corrección la hace de forma automática GPT-5.6 Sol, así que un modelo de OpenAI puntúa a sus competidores con criterios encargados por OpenAI; está declarado, pero es una dependencia que cualquier réplica externa querrá modificar. Y la mezcla de niveles de gravedad se construyó para evaluar: OpenAI señala que no representa con qué frecuencia ocurre cada tipo de conversación en ChatGPT, y repite que ChatGPT no sustituye a la terapia ni a la atención profesional.
Lo que más importa es que el benchmark se publicó de forma abierta, de modo que investigadores externos pueden inspeccionar la metodología y correr sus propias evaluaciones. La corrección independiente es lo que convertiría ese 57,3% en una cifra sobre la que el campo pueda discutir, igual que el trabajo previo sobre la caída de las puntuaciones de toxicidad solo resultó útil cuando otros pudieron reproducirlo. Los detalles están en la página del anuncio de OpenAI.
FAQ — Preguntas frecuentes
¿Pueden usar MentalHealthBench investigadores externos?
Sí. OpenAI lo liberó públicamente para que investigadores y desarrolladores puedan revisar la metodología, ejecutar sus propias evaluaciones y construir sobre el trabajo. La compañía dice que usará el benchmark junto a sus otras investigaciones de salud mental y sus evaluaciones de seguridad de modelos.
¿MentalHealthBench usa conversaciones reales de ChatGPT?
No. Todos los escenarios son sintéticos, escritos para reflejar patrones reales de uso de la IA y no tomados de chats privados. La mezcla de niveles de gravedad se construyó para la evaluación y no representa con qué frecuencia ocurre cada tipo de conversación en ChatGPT.
¿Qué modelo sacó la nota más alta y quién corrige las respuestas?
GPT-6 Astra obtuvo la nota más alta con 57,3%, por delante de GPT-6 Sol con 53,9% y Claude Opus 5.5 con 52,4%. Las respuestas las califica automáticamente GPT-5.6 Sol siguiendo los criterios escritos por los expertos, no los clínicos en persona.






