AI Newsway

OpenAI新心理健康評測,最高分只有57.3%

80多位臨床專業人員寫下評分準則,沒有任何模型跨過60%。

|6分鐘閱讀0
An open-source AI chat interface of the kind MentalHealthBench evaluates, scoring model replies in mental health conversations against clinician-written rubrics.
An open-source AI chat interface of the kind MentalHealthBench evaluates, scoring model replies in mental health conversations against clinician-written rubrics.

OpenAI於9月23日發布MentalHealthBench,這是一套公開評測基準,用來衡量AI模型在心理健康對話中的回應品質,涵蓋從日常壓力到緊急狀況的各種情境。最高分為57.3%,拿下這個分數的是OpenAI自家的GPT-6 Astra。完整方法論收錄在同步發布的技術報告中。

重點摘要

  • MentalHealthBench由22個國家、80多位具執照的心理師與精神科醫師共同建立,這群人使用19種語言,涵蓋將近20個心理健康次專科。
  • GPT-6 Astra以57.3%領先,其後依序為GPT-6 Sol的53.9%、Claude Opus 5.5的52.4%、GPT-6 Luna的50.2%與Muse Spark 1.3的47%;2025年3月的GPT-4o為32.1%,Gemini 2.5 Pro為29.5%。
  • 略超過半數、也就是53.5%的情境屬於非急性對話,18.2%為高風險,另有28.3%涉及需要現實世界立即介入的緊急狀況。

臨床人員如何寫出評分準則

資料集中的每一段對話,都由心理健康專家寫下準則,說明針對使用者最後一則訊息的適當回應應該包含什麼。每條準則帶有-10到+10的權重,正值獎勵有益的行為,負值則對可能造成傷害的回應扣分。在該段對話中被判定臨床重要性最高的項目,權重也最大。

共識是門檻,不是平均值。每段對話至少經過三位專家檢視,只有在兩人同意、第三人未表示反對的情況下,準則才會留下。這個設計以覆蓋範圍換取可辯護性,凡是專家群意見分歧的項目,根本不會進入評分。

對話本身是合成資料,並非取自私人的使用者聊天紀錄,而是依照觀察到的AI使用樣態重新撰寫。內容橫跨成年人、13至17歲青少年、照顧者與臨床人員,超過一半的對話長度在五則訊息以上,意味著評分看的是模型能不能撐住一整段脈絡,而不是單則提示的表現。部分情境還附上合成使用者的背景資訊,讓研究者能測試模型在握有相關脈絡時是否真的會用上。

這些分數實際衡量什麼

結果拆成十個行為面向,包括脈絡掌握與評估、臨床正確性、急迫性判讀、避免傷害、同理與支持、可執行的建議,以及尊重使用者的自主權。OpenAI明講這些是MentalHealthBench的分數,而非臨床成效的衡量,問題只在於回應是否展現出專家群指認出來的那些行為。

這樣讀下來,值得注意的數字不是排名而是天花板。在執業臨床人員撰寫的準則上最高只有57.3%,等於說在已有數百萬人仰賴聊天機器人的任務上,前沿模型離「及格」還很遠。領先群之間的差距也很小,前三名落在五分之內;但與2025年初GPT-4o的差距約25分,這是這次發布中最清楚的證據,顯示這項能力正隨著世代更迭而改善。

對做消費端聊天產品的團隊來說,分區的數據更有用。分數可以按急迫性、使用者輪廓與個別行為拆開來看,也就是說總分只差一分的兩個模型,在真正涉及緊急狀況的那28.3%情境上可能落差極大。總分恰好會蓋掉答錯代價最高的那些情況。任何要為支援性質功能挑模型的團隊,都該先讀緊急區段的分數,最後才看那個頭條數字。

使用者與臨床人員的分歧

OpenAI另外找了16個國家、44位曾用AI處理心理健康或情緒支持需求的成年人做研究,只讓他們看非急性的對話。這些參與者更看重實際的下一步建議與語氣,臨床人員則更重視蒐集脈絡,以及審慎解讀模稜兩可的處境。

這個分歧是刻意不收攏的:使用者研究並未改動評測的最終準則,準則仍以專家共識為基礎。這也代表一個模型有可能被調校得在這裡拿高分,卻仍讓評測所指涉的那群人覺得幫不上忙——這次發布記錄了這股張力,而非化解它。美國心理學會執行長Arthur Evans在給EdTech Innovation Hub的說法中,闡述了為何涵蓋範圍必須夠廣:

心理健康存在於一條連續的光譜上,從狀態良好、日常壓力一路到急性危機。要在這整段範圍內與人互動的AI系統,必須同時扎根於臨床科學與真實生活經驗。

必須一併記住的但書

這次發布帶著兩項結構性限制。評分由GPT-5.6 Sol自動執行,等於是OpenAI的模型依照OpenAI委託撰寫的準則來替競爭對手打分數;這一點有揭露,但任何外部複驗大概都會想換掉這個環節。急迫性的組成比例同樣是為了評測而配置,OpenAI表示這不代表各類對話在ChatGPT中實際發生的頻率,並再次強調ChatGPT不能取代治療或專業照護。

最關鍵的是這套評測公開發布,外部研究者能檢視方法論並自行跑評估。要讓57.3%變成學界可以據以爭論的數字,靠的正是獨立評分。先前探討毒性分數下降的研究,也是在他人能夠重現之後才真正派上用場。發布細節可見OpenAI的公告頁面。

FAQ — 常見問題

外部研究者可以使用MentalHealthBench嗎

可以。OpenAI公開釋出,研究者與開發者能檢視方法論、執行自己的評估並在此基礎上延伸。該公司表示會將這套評測與其他心理健康研究、模型安全性評估一併使用。

MentalHealthBench使用真實的ChatGPT對話嗎

沒有。所有情境都是合成的,依照現實中的AI使用樣態撰寫,而非取自私人聊天紀錄。急迫性層級的組合是為評測而配置,不代表各類對話在ChatGPT中出現的頻率。

哪個模型分數最高,又是誰在評分

GPT-6 Astra以57.3%最高,領先GPT-6 Sol的53.9%與Claude Opus 5.5的52.4%。回應不是由臨床人員親自評分,而是由GPT-5.6 Sol依照專家撰寫的準則自動評定。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

OpenAI 中階模型代幣價格砍半,但兩項基準測試仍由 GPT-5.6 勝出
Developer Tools

OpenAI 中階模型代幣價格砍半,但兩項基準測試仍由 GPT-5.6 勝出

OpenAI 週二推出兩款中階模型,訴求幾乎全押在價格上。GPT-6 Sol 每百萬輸入代幣定價2美元,每百萬輸出代幣10美元。

Seung Jung5 天前
GPT-6 Astra上崗:OpenAI最貴模型把全部籌碼押在電腦操作上
LLM & Chatbots

GPT-6 Astra上崗:OpenAI最貴模型把全部籌碼押在電腦操作上

OpenAI的GPT-6 Astra面向企業使用者開放,具備電腦操作能力、百萬token上下文和10/50美元定價,其頭條成績則附帶測試框架的註腳。

Seung Jung18 天前
ChatGPT Images 2.5生成延遲減半,新增手繪畫布
LLM & Chatbots

ChatGPT Images 2.5生成延遲減半,新增手繪畫布

OpenAI推出ChatGPT Images 2.5,延遲最多降低50%,新增Sketch繪圖畫布、模板、定點批註,並向API釋出兩款新模型。

Seung Jung17 天前
OpenAI 的 Astra for Law 不是新模型,而是一套 2.3 億網址的法律檢索索引
LLM & Chatbots

OpenAI 的 Astra for Law 不是新模型,而是一套 2.3 億網址的法律檢索索引

OpenAI 推出 Astra for Law,替 GPT-6 Astra 接上涵蓋 2.3 億個網址的法律索引,法律研究基準正確率自 38.7% 升至 54%。

Seung Jung10 天前
Claude只對成年人開放,而它的年齡識別正在誤封成年使用者
LLM & Chatbots

Claude只對成年人開放,而它的年齡識別正在誤封成年使用者

Anthropic公開了Claude執行18歲以上政策的具體機制:分類器會停用疑似未成年人的賬號,被誤判的成年使用者可通過Yoti驗證恢復訪問。

Seung Jung16 天前
OpenAI同日推出Data智慧體與華爾街版ChatGPT
LLM & Chatbots

OpenAI同日推出Data智慧體與華爾街版ChatGPT

OpenAI在同一個星期四釋出了面向ChatGPT Work的Data智慧體,以及與Morgan Stanley、Evercore共建的ChatGPT for Financial Services。

Seung Jung17 天前