OpenAI於9月23日發布MentalHealthBench,這是一套公開評測基準,用來衡量AI模型在心理健康對話中的回應品質,涵蓋從日常壓力到緊急狀況的各種情境。最高分為57.3%,拿下這個分數的是OpenAI自家的GPT-6 Astra。完整方法論收錄在同步發布的技術報告中。
重點摘要
- MentalHealthBench由22個國家、80多位具執照的心理師與精神科醫師共同建立,這群人使用19種語言,涵蓋將近20個心理健康次專科。
- GPT-6 Astra以57.3%領先,其後依序為GPT-6 Sol的53.9%、Claude Opus 5.5的52.4%、GPT-6 Luna的50.2%與Muse Spark 1.3的47%;2025年3月的GPT-4o為32.1%,Gemini 2.5 Pro為29.5%。
- 略超過半數、也就是53.5%的情境屬於非急性對話,18.2%為高風險,另有28.3%涉及需要現實世界立即介入的緊急狀況。
臨床人員如何寫出評分準則
資料集中的每一段對話,都由心理健康專家寫下準則,說明針對使用者最後一則訊息的適當回應應該包含什麼。每條準則帶有-10到+10的權重,正值獎勵有益的行為,負值則對可能造成傷害的回應扣分。在該段對話中被判定臨床重要性最高的項目,權重也最大。
共識是門檻,不是平均值。每段對話至少經過三位專家檢視,只有在兩人同意、第三人未表示反對的情況下,準則才會留下。這個設計以覆蓋範圍換取可辯護性,凡是專家群意見分歧的項目,根本不會進入評分。
對話本身是合成資料,並非取自私人的使用者聊天紀錄,而是依照觀察到的AI使用樣態重新撰寫。內容橫跨成年人、13至17歲青少年、照顧者與臨床人員,超過一半的對話長度在五則訊息以上,意味著評分看的是模型能不能撐住一整段脈絡,而不是單則提示的表現。部分情境還附上合成使用者的背景資訊,讓研究者能測試模型在握有相關脈絡時是否真的會用上。
這些分數實際衡量什麼
結果拆成十個行為面向,包括脈絡掌握與評估、臨床正確性、急迫性判讀、避免傷害、同理與支持、可執行的建議,以及尊重使用者的自主權。OpenAI明講這些是MentalHealthBench的分數,而非臨床成效的衡量,問題只在於回應是否展現出專家群指認出來的那些行為。
這樣讀下來,值得注意的數字不是排名而是天花板。在執業臨床人員撰寫的準則上最高只有57.3%,等於說在已有數百萬人仰賴聊天機器人的任務上,前沿模型離「及格」還很遠。領先群之間的差距也很小,前三名落在五分之內;但與2025年初GPT-4o的差距約25分,這是這次發布中最清楚的證據,顯示這項能力正隨著世代更迭而改善。
對做消費端聊天產品的團隊來說,分區的數據更有用。分數可以按急迫性、使用者輪廓與個別行為拆開來看,也就是說總分只差一分的兩個模型,在真正涉及緊急狀況的那28.3%情境上可能落差極大。總分恰好會蓋掉答錯代價最高的那些情況。任何要為支援性質功能挑模型的團隊,都該先讀緊急區段的分數,最後才看那個頭條數字。
使用者與臨床人員的分歧
OpenAI另外找了16個國家、44位曾用AI處理心理健康或情緒支持需求的成年人做研究,只讓他們看非急性的對話。這些參與者更看重實際的下一步建議與語氣,臨床人員則更重視蒐集脈絡,以及審慎解讀模稜兩可的處境。
這個分歧是刻意不收攏的:使用者研究並未改動評測的最終準則,準則仍以專家共識為基礎。這也代表一個模型有可能被調校得在這裡拿高分,卻仍讓評測所指涉的那群人覺得幫不上忙——這次發布記錄了這股張力,而非化解它。美國心理學會執行長Arthur Evans在給EdTech Innovation Hub的說法中,闡述了為何涵蓋範圍必須夠廣:
心理健康存在於一條連續的光譜上,從狀態良好、日常壓力一路到急性危機。要在這整段範圍內與人互動的AI系統,必須同時扎根於臨床科學與真實生活經驗。
必須一併記住的但書
這次發布帶著兩項結構性限制。評分由GPT-5.6 Sol自動執行,等於是OpenAI的模型依照OpenAI委託撰寫的準則來替競爭對手打分數;這一點有揭露,但任何外部複驗大概都會想換掉這個環節。急迫性的組成比例同樣是為了評測而配置,OpenAI表示這不代表各類對話在ChatGPT中實際發生的頻率,並再次強調ChatGPT不能取代治療或專業照護。
最關鍵的是這套評測公開發布,外部研究者能檢視方法論並自行跑評估。要讓57.3%變成學界可以據以爭論的數字,靠的正是獨立評分。先前探討毒性分數下降的研究,也是在他人能夠重現之後才真正派上用場。發布細節可見OpenAI的公告頁面。
FAQ — 常見問題
外部研究者可以使用MentalHealthBench嗎
可以。OpenAI公開釋出,研究者與開發者能檢視方法論、執行自己的評估並在此基礎上延伸。該公司表示會將這套評測與其他心理健康研究、模型安全性評估一併使用。
MentalHealthBench使用真實的ChatGPT對話嗎
沒有。所有情境都是合成的,依照現實中的AI使用樣態撰寫,而非取自私人聊天紀錄。急迫性層級的組合是為評測而配置,不代表各類對話在ChatGPT中出現的頻率。
哪個模型分數最高,又是誰在評分
GPT-6 Astra以57.3%最高,領先GPT-6 Sol的53.9%與Claude Opus 5.5的52.4%。回應不是由臨床人員親自評分,而是由GPT-5.6 Sol依照專家撰寫的準則自動評定。






