Problem
現行醫療多模態大語言模型(MLLMs)在處理臨床任務時,難以有效整合異質性的 2D 與原生 3D 醫學影像。此外,目前的評量協定缺乏與放射科醫師臨床實務的對齊,導致模型生成的報告在事實準確性與精細度上難以被臨床驗證。
Method
開發 ClinFusion 系統,核心技術為「級聯空間感知局部融合(Cascade Spatial-Aware Locality Fusion)」算子,能將不同維度的影像資訊統一於單一編碼器中。研發團隊同步推出 MedIF-Bench 指令遵循評測集,以及基於感興趣區域(RoI)的臨床事實導向報告評估框架。
Results
ClinFusion 在 24 項醫學基準測試中,有 20 項優於 Hulu-Med 等頂尖開源模型,並在多項多模態任務上超越 GPT-5.2 與 Gemini-3-Flash。放射科醫師的盲測結果顯示其產出的報告排名最高,且 RoI 評核指標與專家判斷展現出最高度的相關性。
Significance
這項研究為醫療 AI 建立了全方位的影像理解與評估體系。透過支援代理工具(Agentic Tool)的擴充能力,ClinFusion 能進一步整合檢索增強與臨床工作流,對提升診斷精準度與自動化醫療報告生成具有深遠影響。