OpenAI publica MentalHealthBench, un benchmark abierto de conversaciones de salud mental
El conjunto de evaluación, elaborado con más de 80 profesionales de salud mental de 22 países, mide seguridad, búsqueda de contexto y respeto a la autonomía del usuario en modelos de lenguaje.

OpenAI ha publicado MentalHealthBench, un banco de pruebas abierto para medir cómo responden los modelos de lenguaje en conversaciones realistas sobre salud mental. Lo ha co-creado con más de 80 profesionales licenciados de 22 países, hablantes de 19 idiomas, y evalúa comportamientos concretos: seguridad, si el modelo busca contexto, si respeta la autonomía del usuario y si ofrece orientación práctica cuando corresponde.
No es el primer conjunto de evaluación de la casa. Antes llegaron HealthBench y HealthBench Professional, centrados en salud y práctica clínica; este baja al terreno de la conversación cotidiana y del consejo vital.
Qué hay dentro
Los escenarios son sintéticos, generados con técnicas que preservan la privacidad, y pretenden reflejar patrones de uso reales. Cubren adultos, adolescentes, cuidadores y clínicos, en varios idiomas y regiones, y algunos incluyen contexto del usuario —una pérdida reciente en la familia, por ejemplo— para comprobar si el modelo lo aprovecha. Se reparten en tres niveles: conversaciones no agudas, casos de alta gravedad con malestar serio pero sin emergencia inmediata, y emergencias con señales de riesgo que exigen derivar a ayuda real. OpenAI avisa de que esa mezcla está diseñada para estresar al modelo y no representa la frecuencia con la que esos temas aparecen en ChatGPT.
Las rúbricas las escriben los expertos. Al menos tres leen cada conversación y proponen criterios sobre la última respuesta del modelo, cada uno con un peso entre -10 y +10: lo positivo premia conductas deseables y lo negativo penaliza las dañinas, y el peso sube cuanto mayor es la importancia clínica. Un criterio solo sobrevive si lo aprueban dos expertos y un tercero no lo contradice. El encargado de puntuar automáticamente las respuestas es GPT‑5.6 Sol.
Los resultados, sin cifras
OpenAI asegura que los modelos han mejorado de forma sostenida en estas situaciones y publica una comparativa con intervalos de confianza del 95% y el modelo más reciente de cada proveedor a 23 de septiembre de 2026. En el anuncio no aparece ninguna cifra concreta, así que la afirmación es suya.
Para quien construye producto encima de un modelo, lo aprovechable es el método: las rúbricas y el proceso quedan abiertos, de modo que se pueden replicar, discutir los pesos o usar como base para evaluar un despliegue propio. Lo que no hay es validación externa de que estas métricas se correspondan con resultados reales, y los escenarios son sintéticos. Sirven para comparar modelos entre sí, no para sostener que un chatbot sustituya a un profesional, algo que la propia OpenAI repite y que acompaña de un enlace a su línea de ayuda en crisis.
