阿里巴巴旗下研究機構釋出視覺語言模型RADAR,能判讀顯影劑增強的腹部電腦斷層掃描並回報146項臨床發現,模型權重與研究論文一併公開。論文於9月17日刊登於Science,模型在這些發現上的曲線下面積(AUC)平均達0.913。
這次釋出值得注意的,與其說是準確率數字,不如說是模型的形態:一套不靠人工描邊訓練出來的通用判讀器,先與執業放射科醫師對照驗證,再免費開放給所有人。
重點摘要
- RADAR以424,911份顯影劑增強腹部CT檢查、約1,500萬組解剖層級的影像與文字配對進行訓練,學習來源是臨床報告而非人工標註。
- 146項發現的平均AUC為0.913,在八家外部機構驗證中維持0.895,於未曾針對性訓練的27,000多筆急診案例上也有0.904。
- 同一評測中表現最好的競爭視覺語言模型僅有0.776;與RADAR搭配作業的放射科醫師,病灶偵測敏感度約提升一成。
沒有標註,模型怎麼學會146項發現
傳統醫學影像模型的設計本就狹窄。一套訓練來找胰臟病灶,另一套負責標記肝臟異常,而每一套都需要放射科醫師親手描出病灶邊界。這道標註瓶頸,正是這個領域累積了大量單一疾病工具、卻少有通用模型的原因。
達摩院走的是相反路線。RADAR由達摩院與浙江大學醫學院附屬第一醫院、湖畔實驗室共同開發,把CT影像與放射科醫師本來就寫好的臨床報告配對,直接把報告文字當成監督訊號。訓練語料因此成為日常醫療作業的副產品,而不是另一項標註工程,團隊能累積到424,911份檢查也源於此。
模型涵蓋18個腹部器官,透過這些器官延伸到數百種潛在疾病,從惡性腫瘤到偶然發現的異常都在範圍內。研究團隊將RADAR定位為醫學影像領域第一個達到專科醫師水準的通用模型,並表示同一套訓練方法可以移植到其他影像檢查。
這些數字撐過了什麼考驗
單一的內部準確率很容易灌水,因此驗證設計比標題數字更重要。在八家外部機構,平均AUC僅小幅下滑至0.895;在案例組成不同、且無專門訓練的急診科逾27,000筆案例上,仍維持0.904。比較組中最強的多模態模型為0.776。
更貼近實務的是判讀者研究。在來自多家醫院的26位放射科醫師中,模型平均表現優於其中23位。當同一批醫師搭配RADAR作業時,疾病偵測敏感度約上升一成,判讀時間則縮短約三成——這既是準確度的結果,也是產能的結果。
權重公開為何改變了算式
醫療AI長期由受監管的封閉產品主導,按席次或按檢查次數計費。把模型、程式碼與框架一併公開會鬆動這個格局:原始研究世代之外的醫院,可以先在自家病人族群上驗證再決定是否採信;研究者也能直接探測失效模式,而不必從廠商規格書去推測。
這件事也落在特定的競爭脈絡裡。阿里巴巴一路在各領域推動可下載的模型,從Qwen語言模型家族到這次的醫療模型,把開放權重當成通路策略而非慈善。
接下來的問題
發表論文和實際部署是兩回事。一個主要在中國族群上驗證過的模型,仍需在其他人口族群與不同機型上接受檢驗,而且沒有任何國家的監管機關會把一篇Science論文視為許可。短期內比較務實的用途,是當成第二判讀者,先標出待放射科醫師確認的發現——這正是判讀者研究所測量的配置。
常見問題
RADAR真的是開源的嗎?
團隊在Science論文發表的同時公開了模型、程式碼與技術框架。如同其他開放權重的釋出,這讓本地部署與獨立驗證成為可能,但臨床使用仍須符合各國適用的法規核准。
RADAR的表現超越放射科醫師嗎?
在已發表的判讀者研究中,模型在受測發現上的平均表現優於26位參與醫師中的23位。更有參考價值的是協作情境:搭配模型作業的放射科醫師,偵測敏感度約提升一成,判讀速度約快三成。
它需要哪一種掃描影像?
RADAR是為涵蓋18個器官的顯影劑增強腹部CT打造的。研究者認為,以既有臨床報告取代人工標註的訓練方式可以延伸到其他影像類型,但目前釋出的模型僅限於腹部CT。






