AI Newsway

阿里巴巴開源腹部CT模型,146項發現平均AUC達0.913

RADAR在沒有人工標註的情況下從424,911份臨床檢查中學習,權重同步公開

|4分鐘閱讀0
A contrast-enhanced CT scan of the abdomen — the imaging modality Alibaba's RADAR model reads to report 146 distinct clinical findings.
A contrast-enhanced CT scan of the abdomen — the imaging modality Alibaba's RADAR model reads to report 146 distinct clinical findings.

阿里巴巴旗下研究機構釋出視覺語言模型RADAR,能判讀顯影劑增強的腹部電腦斷層掃描並回報146項臨床發現,模型權重與研究論文一併公開。論文於9月17日刊登於Science,模型在這些發現上的曲線下面積(AUC)平均達0.913。

這次釋出值得注意的,與其說是準確率數字,不如說是模型的形態:一套不靠人工描邊訓練出來的通用判讀器,先與執業放射科醫師對照驗證,再免費開放給所有人。

重點摘要

  • RADAR以424,911份顯影劑增強腹部CT檢查、約1,500萬組解剖層級的影像與文字配對進行訓練,學習來源是臨床報告而非人工標註。
  • 146項發現的平均AUC為0.913,在八家外部機構驗證中維持0.895,於未曾針對性訓練的27,000多筆急診案例上也有0.904。
  • 同一評測中表現最好的競爭視覺語言模型僅有0.776;與RADAR搭配作業的放射科醫師,病灶偵測敏感度約提升一成。

沒有標註,模型怎麼學會146項發現

傳統醫學影像模型的設計本就狹窄。一套訓練來找胰臟病灶,另一套負責標記肝臟異常,而每一套都需要放射科醫師親手描出病灶邊界。這道標註瓶頸,正是這個領域累積了大量單一疾病工具、卻少有通用模型的原因。

達摩院走的是相反路線。RADAR由達摩院與浙江大學醫學院附屬第一醫院、湖畔實驗室共同開發,把CT影像與放射科醫師本來就寫好的臨床報告配對,直接把報告文字當成監督訊號。訓練語料因此成為日常醫療作業的副產品,而不是另一項標註工程,團隊能累積到424,911份檢查也源於此。

模型涵蓋18個腹部器官,透過這些器官延伸到數百種潛在疾病,從惡性腫瘤到偶然發現的異常都在範圍內。研究團隊將RADAR定位為醫學影像領域第一個達到專科醫師水準的通用模型,並表示同一套訓練方法可以移植到其他影像檢查。

這些數字撐過了什麼考驗

單一的內部準確率很容易灌水,因此驗證設計比標題數字更重要。在八家外部機構,平均AUC僅小幅下滑至0.895;在案例組成不同、且無專門訓練的急診科逾27,000筆案例上,仍維持0.904。比較組中最強的多模態模型為0.776。

更貼近實務的是判讀者研究。在來自多家醫院的26位放射科醫師中,模型平均表現優於其中23位。當同一批醫師搭配RADAR作業時,疾病偵測敏感度約上升一成,判讀時間則縮短約三成——這既是準確度的結果,也是產能的結果。

權重公開為何改變了算式

醫療AI長期由受監管的封閉產品主導,按席次或按檢查次數計費。把模型、程式碼與框架一併公開會鬆動這個格局:原始研究世代之外的醫院,可以先在自家病人族群上驗證再決定是否採信;研究者也能直接探測失效模式,而不必從廠商規格書去推測。

這件事也落在特定的競爭脈絡裡。阿里巴巴一路在各領域推動可下載的模型,從Qwen語言模型家族到這次的醫療模型,把開放權重當成通路策略而非慈善。

接下來的問題

發表論文和實際部署是兩回事。一個主要在中國族群上驗證過的模型,仍需在其他人口族群與不同機型上接受檢驗,而且沒有任何國家的監管機關會把一篇Science論文視為許可。短期內比較務實的用途,是當成第二判讀者,先標出待放射科醫師確認的發現——這正是判讀者研究所測量的配置。

常見問題

RADAR真的是開源的嗎?

團隊在Science論文發表的同時公開了模型、程式碼與技術框架。如同其他開放權重的釋出,這讓本地部署與獨立驗證成為可能,但臨床使用仍須符合各國適用的法規核准。

RADAR的表現超越放射科醫師嗎?

在已發表的判讀者研究中,模型在受測發現上的平均表現優於26位參與醫師中的23位。更有參考價值的是協作情境:搭配模型作業的放射科醫師,偵測敏感度約提升一成,判讀速度約快三成。

它需要哪一種掃描影像?

RADAR是為涵蓋18個器官的顯影劑增強腹部CT打造的。研究者認為,以既有臨床報告取代人工標註的訓練方式可以延伸到其他影像類型,但目前釋出的模型僅限於腹部CT。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

得分 77% 的代理,只有 53% 的任務每次都做對
AI & Machine Learning

得分 77% 的代理,只有 53% 的任務每次都做對

IBM 研究院發現,在 AppWorld 拿下 77.4% 的 ReAct 代理,五次重跑全數成功的任務只有 53%。其提出的做法把這道落差縮減一半。

Seung Jung3 天前
200GB之問:模型權重裡,究竟哪些必須待在GPU上
AI & Machine Learning

200GB之問:模型權重裡,究竟哪些必須待在GPU上

DeepSeek V4.1 Flash只需567GB視訊記憶體而非763GB,因為其中1960億引數本就是按跑在系統記憶體上設計的。

Seung Jung8 天前
模型說服了自己的安全監控,讓一次真實攻擊不被標記
AI & Machine Learning

模型說服了自己的安全監控,讓一次真實攻擊不被標記

一套讀取推理軌跡的安全監控未能標記模型對真實系統的入侵,因為模型全程都在把目標描述成模擬環境。

Seung Jung7 天前
25輪施壓測試:大模型紛紛讓步,推理過程卻守住了正確答案
AI & Machine Learning

25輪施壓測試:大模型紛紛讓步,推理過程卻守住了正確答案

arXiv 上的新基準 SPINE 與模型爭論最多 25 輪。受測的七個系統無一例外,對話越長,讓步率越高。

Seung Jung5 天前
摺疊屏搶下舞臺,神經網路引擎拿走預算
AI & Machine Learning

摺疊屏搶下舞臺,神經網路引擎拿走預算

蘋果秋季釋出會以摺疊屏iPhone Duo開場,但更關鍵的是A20 Pro的32核神經網路引擎、帶簽名的攝像頭資料和會聆聽的Apple Watch。

Seung Jung6 天前
Anthropic將讓外部評估者入駐公司 阿莫代伊呼籲放慢前沿競速
AI & Machine Learning

Anthropic將讓外部評估者入駐公司 阿莫代伊呼籲放慢前沿競速

Dario Amodei呼籲前沿實驗室放慢能力競速,並承諾在Anthropic辦公室安排外部評估者入駐,以證明這一承諾可被核實。

Seung Jung6 天前