OpenAI lanza mentalhealthbench para evaluar la IA en conversaciones sobre salud mental
OpenAI ha presentado MentalHealthBench, un conjunto de datos de referencia abierto desarrollado con más de 80 expertos en salud mental licenciados de 22 países, para evaluar las respuestas de la IA en conversaciones realistas sobre salud mental. El conjunto de datos evalúa los modelos en función de comportamientos clave como la seguridad, la búsqueda de contexto y la agencia del usuario, con criterios ponderados de -10 a +10 en función de la importancia clínica. Incluye escenarios para adultos, adolescentes, cuidadores y profesionales de la salud, que abarcan situaciones no agudas, de alta agudeza y de emergencia. Los expertos revisaron conversaciones sintéticas para crear rúbricas, y las respuestas son evaluadas por GPT-5.6 Sol. El conjunto de datos también destaca las diferencias entre las perspectivas de los expertos y los usuarios sobre el apoyo de la IA, enfatizando los pasos prácticos y el tono sobre la recopilación de contexto. OpenAI también está mejorando las respuestas de ChatGPT en conversaciones delicadas y lanzando ChatGPT para adolescentes con protecciones adicionales.
MentalHealthBench tiene como objetivo establecer un estándar más alto para el apoyo de la IA en salud mental, permitiendo a los investigadores identificar mejoras y lagunas en los modelos. Forma parte de los esfuerzos más amplios para mejorar el papel de la IA en la salud mental, que incluyen subvenciones para la investigación y la colaboración con organizaciones como la Partnership on AI. La publicación del conjunto de datos invita a la comunidad a examinar sus métodos y a contribuir a los futuros avances en el apoyo de la salud mental basado en la IA.