OpenAI 새 정신건강 벤치마크, 최고 점수가 57.3%

임상의 80여 명이 채점 기준을 썼다. 60%를 넘긴 모델은 없었다.

|6분 읽기0
An open-source AI chat interface of the kind MentalHealthBench evaluates, scoring model replies in mental health conversations against clinician-written rubrics.
An open-source AI chat interface of the kind MentalHealthBench evaluates, scoring model replies in mental health conversations against clinician-written rubrics.

OpenAI가 9월 23일 MentalHealthBench를 공개했다. 일상적인 스트레스부터 응급 상황까지, 정신건강 대화에서 AI 모델이 어떻게 응답하는지를 채점하는 공개 벤치마크다. 가장 높은 점수는 57.3%였고, 그 자리를 차지한 모델은 OpenAI 자사의 GPT-6 Astra였다. 방법론 전문은 함께 공개한 기술 보고서에 담겼다.

핵심 요약

  • MentalHealthBench는 22개국의 면허 심리학자·정신과 의사 80여 명과 함께 만들었다. 이들은 19개 언어를 쓰고 정신건강 세부 전공 20개 가까이를 아우른다.
  • GPT-6 Astra가 57.3%로 선두에 섰고 GPT-6 Sol 53.9%, Claude Opus 5.5 52.4%, GPT-6 Luna 50.2%, Muse Spark 1.3 47%가 뒤를 이었다. 2025년 3월 GPT-4o는 32.1%, Gemini 2.5 Pro는 29.5%에 그쳤다.
  • 시나리오의 절반을 조금 넘는 53.5%가 비응급 대화다. 18.2%는 고위험 상황이고, 28.3%는 현실에서 즉각적인 지원이 필요한 응급 상황이다.

임상의들이 채점 기준을 만든 방식

데이터셋의 대화마다 정신건강 전문가들이 마지막 사용자 메시지에 어떤 응답이 적절한지를 서술한 기준을 작성했다. 각 기준에는 -10에서 +10까지 가중치가 붙는다. 양수는 이로운 행동에 점수를 주고, 음수는 해가 될 수 있는 응답에 벌점을 매긴다. 해당 대화에서 임상적으로 가장 중요하다고 판단한 항목일수록 가중치가 커진다.

합의는 평균값이 아니라 통과 요건이었다. 모든 대화를 전문가 최소 3명이 검토했고, 두 명이 동의하고 나머지 한 명이 반대하지 않아야 기준으로 살아남았다. 포괄성을 내주고 방어 가능성을 택한 설계다. 패널의 의견이 갈린 항목은 아예 채점에 들어가지 못했다.

대화 자체는 합성 데이터다. 실제 사용자 대화를 가져오지 않고, 관찰된 AI 사용 패턴을 반영해 새로 썼다. 성인과 13~17세 청소년, 보호자, 임상의를 아우르며 절반 이상이 메시지 5개를 넘는다. 단발 프롬프트가 아니라 대화의 맥락을 얼마나 붙들고 가는지로 채점한다는 뜻이다. 일부 시나리오에는 합성 사용자의 배경 정보가 함께 붙어, 모델이 주어진 맥락을 실제로 활용하는지도 시험할 수 있다.

이 점수가 실제로 재는 것

결과는 행동 영역 10개로 나뉜다. 맥락 파악과 평가, 임상적 정확성, 시급성 판단, 위해 회피, 공감과 지지, 실행 가능한 안내, 사용자의 자기결정권 존중 등이 여기 들어간다. OpenAI는 이 점수가 임상적 효과를 재는 것이 아니라 어디까지나 MentalHealthBench 점수라고 못 박았다. 전문가 패널이 지목한 행동을 응답이 보여주는지가 질문의 전부다.

그렇게 읽으면 눈에 들어오는 숫자는 순위가 아니라 천장이다. 현업 임상의가 쓴 기준에서 최고점이 57.3%라는 것은, 이미 수백만 명이 챗봇에 기대고 있는 과제에서 최전선 모델이 아직 반타작 언저리에 머문다는 말이다. 선두권 격차도 좁다. 상위 3개 모델이 5점 안에 몰려 있다. 반면 2025년 초 GPT-4o와의 차이는 약 25점으로, 세대가 바뀌며 이 행동이 나아지고 있다는 가장 분명한 근거다.

소비자용 챗 제품을 만드는 쪽이라면 구간별 결과가 더 쓸모 있다. 점수는 시급성별, 사용자 유형별, 개별 행동별로 쪼개 볼 수 있다. 총점이 1점 차인 두 모델이 진짜 응급 상황인 28.3% 구간에서는 크게 갈릴 수 있다는 뜻이다. 종합 점수는 오답의 대가가 가장 큰 사례를 정확히 가려버린다. 상담에 조금이라도 닿는 기능에 모델을 고른다면 응급 구간을 먼저 보고 대표 숫자는 맨 나중에 봐야 한다.

사용자와 임상의가 갈린 지점

OpenAI는 정신건강이나 정서적 지지를 위해 AI를 써본 16개국 성인 44명을 대상으로 별도 조사도 진행했다. 이들에게는 비응급 대화만 보여줬다. 참가자들은 구체적인 다음 행동과 말투에 더 무게를 뒀다. 임상의들은 맥락을 모으고 모호한 상황을 신중히 해석하는 쪽을 더 중시했다.

이 차이는 설계상 봉합되지 않았다. 사용자 조사 결과는 벤치마크의 최종 기준을 바꾸지 않았고, 기준은 전문가 합의에 그대로 뿌리를 둔다. 여기서 좋은 점수를 받도록 맞춘 모델이 정작 벤치마크가 겨냥한 사람들에게는 도움이 안 된다고 느껴질 수 있다는 뜻이다. 이번 공개는 그 긴장을 해결하기보다 기록해 뒀다. 미국심리학회 최고경영자 Arthur Evans는 EdTech Innovation Hub에 전한 발언에서 폭넓은 범위가 왜 필요한지를 이렇게 짚었다.

정신건강은 번영에서 일상적 스트레스, 급성 위기까지 이어지는 연속선 위에 있습니다. 그 범위 전반에서 사람을 상대하는 AI 시스템은 임상 과학과 실제 경험 양쪽에 뿌리를 둬야 합니다.

함께 기억해야 할 단서

이번 공개에는 구조적 한계 두 가지가 따라붙는다. 채점은 GPT-5.6 Sol이 자동으로 한다. OpenAI 모델이 OpenAI가 의뢰한 기준으로 경쟁사를 채점하는 구조다. 공개된 사실이긴 해도, 외부에서 재현할 때는 바꿔보고 싶어질 의존성이다. 위험도 구성비 역시 평가를 위해 인위적으로 짰다. OpenAI는 이 비율이 ChatGPT에서 각 유형의 대화가 실제로 얼마나 자주 일어나는지를 나타내지 않는다고 밝혔고, ChatGPT가 치료나 전문 진료를 대신하지 않는다는 점도 다시 강조했다.

벤치마크를 공개한 덕에 외부 연구자가 방법론을 뜯어보고 직접 평가를 돌릴 수 있다는 점이 가장 중요하다. 독립 채점이 붙어야 57.3%가 학계가 놓고 다툴 수 있는 숫자가 된다. 독성 점수 하락을 다룬 앞선 연구도 남들이 재현할 수 있게 된 뒤에야 쓸모를 얻었다. 공개 내용은 OpenAI 발표 페이지에서 확인할 수 있다.

FAQ — 자주 묻는 질문

MentalHealthBench를 외부 연구자도 쓸 수 있나

쓸 수 있다. OpenAI가 공개 배포해 연구자와 개발자가 방법론을 검토하고 자체 평가를 돌리며 후속 작업을 얹을 수 있다. OpenAI는 이 벤치마크를 다른 정신건강 연구, 모델 안전성 평가와 함께 쓰겠다고 밝혔다.

실제 ChatGPT 대화를 쓰나

아니다. 모든 시나리오가 합성 데이터다. 실제 사용자 대화를 가져오지 않고 현실의 AI 사용 패턴을 반영해 작성했다. 위험도 구성비도 평가용으로 짠 것이라 ChatGPT에서 각 유형이 실제로 얼마나 자주 나타나는지와는 무관하다.

어느 모델이 가장 높았고 채점은 누가 하나

GPT-6 Astra가 57.3%로 가장 높았다. GPT-6 Sol 53.9%, Claude Opus 5.5 52.4%가 뒤를 이었다. 응답 채점은 임상의가 직접 하지 않고 GPT-5.6 Sol이 전문가가 쓴 기준에 맞춰 자동으로 처리한다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

OpenAI, 중급 모델 토큰 가격 반토막…벤치마크 두 곳은 여전히 GPT-5.6이 앞선다
Developer Tools

OpenAI, 중급 모델 토큰 가격 반토막…벤치마크 두 곳은 여전히 GPT-5.6이 앞선다

OpenAI가 화요일 중급 모델 두 종을 내놓으면서 설득 논리를 거의 전부 가격에 걸었다. GPT-6 Sol은 100만 입력 토큰당 2달러, 출력 100만 토큰당 10달러다.

Seung Jung5일 전
업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다
LLM & Chatbots

업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다

OpenAI의 GPT-6 Astra가 컴퓨터 사용 기능과 100만 토큰 컨텍스트, 10/50달러 가격으로 기업 사용자에게 풀린다. 대표 점수에는 하네스 단서가 붙는다.

Seung Jung18일 전
ChatGPT Images 2.5, 생성 속도 두 배로… 스케치 캔버스도 붙였다
LLM & Chatbots

ChatGPT Images 2.5, 생성 속도 두 배로… 스케치 캔버스도 붙였다

OpenAI가 ChatGPT Images 2.5를 내놨다. 지연 시간을 최대 50% 줄이고 Sketch 캔버스와 템플릿, 고정 댓글, API 모델 두 종을 함께 공개했다.

Seung Jung17일 전
OpenAI의 Astra for Law는 새 모델이 아니다, 2억 3000만 URL 법률 색인이다
LLM & Chatbots

OpenAI의 Astra for Law는 새 모델이 아니다, 2억 3000만 URL 법률 색인이다

OpenAI가 GPT-6 Astra에 2억 3000만 URL 규모 법률 색인을 결합한 Astra for Law를 공개했다. 리걸 리서치 벤치 정확도는 38.7%에서 54%로 올랐다.

Seung Jung10일 전
Claude는 성인 전용, 그런데 연령 감지기가 성인까지 차단한다
LLM & Chatbots

Claude는 성인 전용, 그런데 연령 감지기가 성인까지 차단한다

Anthropic이 Claude의 18세 이상 정책 집행 방식을 공개했다. 분류기가 미성년자 의심 계정을 비활성화하고, 잘못 걸린 성인은 Yoti 검증으로 계정을 되찾는다.

Seung Jung16일 전
OpenAI, 데이터 에이전트와 월스트리트용 ChatGPT를 하루에 함께 내놨다
LLM & Chatbots

OpenAI, 데이터 에이전트와 월스트리트용 ChatGPT를 하루에 함께 내놨다

OpenAI가 같은 목요일에 ChatGPT Work용 Data 에이전트와 Morgan Stanley·Evercore가 함께 만든 ChatGPT for Financial Services를 공개했다.

Seung Jung17일 전