OpenAIが9月23日、MentalHealthBenchを公開した。日常的なストレスから緊急事態まで、メンタルヘルスの会話でAIモデルがどう応答するかを採点する公開ベンチマークである。最高スコアは57.3%で、その座に就いたのはOpenAI自身のGPT-6 Astraだった。手法の全容は同時公開の技術報告書にまとめられている。
記事の要点
- MentalHealthBenchは22カ国の有資格心理士・精神科医80人超と共同で作られた。19言語を話し、メンタルヘルスの専門分野20近くをカバーする顔ぶれだ。
- GPT-6 Astraが57.3%で首位、続いてGPT-6 Solが53.9%、Claude Opus 5.5が52.4%、GPT-6 Lunaが50.2%、Muse Spark 1.3が47%。2025年3月のGPT-4oは32.1%、Gemini 2.5 Proは29.5%にとどまった。
- シナリオの半分強にあたる53.5%が非緊急の会話で、18.2%が高リスク、28.3%が現実世界での至急の支援を要する緊急事態である。
臨床家はどう採点基準を作ったか
データセットの会話ごとに、メンタルヘルスの専門家が最後のユーザー発言への適切な応答に何が含まれるべきかを記した基準を書いた。各基準には-10から+10までの重みが付く。プラスは有益な振る舞いに加点し、マイナスは害となりうる応答に減点する。その会話で臨床的に最も重要だと判断された項目ほど重みが大きい。
合意は平均ではなく通過条件だった。すべての会話を最低3人の専門家が検討し、2人が同意し残る1人が反対しない場合にのみ基準として残った。網羅性を譲って説明可能性を取った設計である。パネルの意見が割れた項目は、そもそも採点に入っていない。
会話そのものは合成データだ。実際のユーザーのやり取りを持ち込まず、観測されたAI利用のパターンを反映して書き起こしている。成人、13〜17歳の未成年、介護者、臨床家を含み、半数以上がメッセージ5本を超える。単発のプロンプトではなく、会話の流れをどこまで保てるかで採点するということだ。一部のシナリオには合成ユーザーの背景情報も添えられており、モデルが手元の文脈を実際に使うかどうかも試せる。
このスコアが測っているもの
結果は10の行動領域に分かれる。文脈の把握と評価、臨床的な正確さ、緊急度の見極め、危害の回避、共感と支持、実行可能な助言、利用者の自己決定の尊重などが含まれる。OpenAIは、これが臨床的な有効性の測定ではなくあくまでMentalHealthBenchのスコアだと明言している。問われているのは、専門家パネルが挙げた振る舞いを応答が示しているかどうか、その一点だ。
そう読むと、目を引く数字は順位ではなく天井である。現役の臨床家が書いた基準で最高点が57.3%というのは、すでに数百万人がチャットボットに頼っている領域で、最前線のモデルがまだ半分どまりに近いことを意味する。上位の差も小さい。トップ3が5ポイント以内に固まっている。一方で2025年初頭のGPT-4oとの開きは約25ポイントあり、世代交代とともにこの振る舞いが改善していることを示す最も明快な証拠になっている。
消費者向けのチャット製品を作る側には、区分ごとの数字のほうが役に立つ。スコアは緊急度別、利用者の属性別、行動別に切り分けられる。総合で1ポイント差のモデル同士が、本物の緊急事態にあたる28.3%の区分では大きく分かれうるということだ。総合値は、誤答の代償が最も高い場面をちょうど覆い隠す。支援に少しでも関わる機能でモデルを選ぶなら、緊急区分を最初に見て、見出しの数字は最後に見るべきだろう。
利用者と臨床家が食い違った点
OpenAIは、メンタルヘルスや情緒的支えのためにAIを使った経験のある16カ国の成人44人を対象に別の調査も行い、非緊急の会話だけを見せた。参加者は具体的な次の一手と口調をより重く見た。臨床家は文脈を集めることと、曖昧な状況を慎重に読み解くことを重視した。
この食い違いは設計上、埋められていない。利用者調査の結果はベンチマークの最終基準を変えておらず、基準は専門家の合意に根ざしたままである。ここで高得点を取るように調整されたモデルが、当のベンチマークが向き合う人々には役に立たないと感じられる余地が残るということだ。今回の公開は、その緊張を解決するのではなく書き留めている。米国心理学会の最高経営責任者Arthur Evans氏は、EdTech Innovation Hubに寄せたコメントで、広く網をかける理由をこう述べている。
メンタルヘルスは、良好な状態から日常的なストレス、急性の危機まで連続した幅のなかにあります。その全域で人と関わるAIシステムは、臨床科学と当事者の実体験の両方に根ざしている必要があります。
付いて回る留保
今回の公開には構造的な制約が二つある。採点はGPT-5.6 Solによる自動処理だ。OpenAIのモデルが、OpenAIが委託した基準で競合を採点する構図である。開示はされているが、外部が再現するなら差し替えたくなる依存関係だろう。緊急度の構成比も評価のために作られたものだ。OpenAIはこの比率がChatGPTで各種の会話が実際に起きる頻度を表すものではないとし、ChatGPTがセラピーや専門的なケアの代わりにはならないと改めて記している。
最も重要なのは、外部の研究者が手法を精査し独自に評価を回せるよう公開された点である。57.3%が学界で議論に足る数字になるには、独立した採点が要る。毒性スコアの低下を扱った先行研究も、他者が再現できるようになって初めて使える材料になった。公開の詳細はOpenAIの発表ページにある。
FAQ — よくある質問
MentalHealthBenchは外部の研究者も使えるのか
使える。OpenAIが一般公開しており、研究者や開発者が手法を検証し、独自の評価を実行し、その上に成果を積み上げられる。同社はこのベンチマークを他のメンタルヘルス研究やモデルの安全性評価と併せて使うとしている。
実際のChatGPTの会話を使っているのか
使っていない。すべてのシナリオが合成データで、実際のユーザーのやり取りではなく現実のAI利用パターンを反映して書かれている。緊急度の構成比も評価用に組んだもので、ChatGPTで各種の会話が起きる頻度とは対応しない。
最高得点はどのモデルで、採点は誰がするのか
GPT-6 Astraが57.3%で最高、次いでGPT-6 Solが53.9%、Claude Opus 5.5が52.4%だった。応答の採点は臨床家本人ではなく、専門家が書いた基準に沿ってGPT-5.6 Solが自動で行う。






