Problem
侵入性冠狀動脈攝影(CAG)目前仍存在判讀主觀性高的挑戰,不同觀察者間的診斷結果常有顯著差異。雖然現有的 AI 系統可協助提升一致性,但多數模型缺乏透明的決策過程(黑箱問題),且難以提供全面的開放式評估與說明,導致臨床醫師難以建立信任,阻礙了 AI 技術在臨床環境的落地應用。
Method
研究團隊開發了名為 CARDEA 的大型視覺語言模型,作為 CAG 分析流程的核心。該模型僅採用公開資料集訓練,開發過程分為三個階段:視覺特徵對齊、自我蒸餾的「框選鏈」(Chain-of-Box, CoB)冷啟動,以及具備可驗證獎勵的強化學習(RLVR)。特別的是,RLVR 階段透過 CoB 獎勵機制,強制模型在推理軌跡中標註出邊界框(Bounding-box),以提供具備空間根據的解釋。
Results
實驗顯示,CARDEA 在血管優勢分型任務中表現優異,且在複雜度評估上達到 0.90 的準確度,與介入性心臟科醫師的判讀水準相當。在零樣本(zero-shot)醫療報告生成的測試中,強化學習後的模型顯著優於未經微調的基礎模型,其血管病變嚴重度 macro-F1 分數從 0.513 提升至 0.686,證明了透過封閉式任務的強化學習能有效激發模型生成高品質開放式報告的能力。
Significance
CARDEA 實現了從原始多視角影像到自動化診斷的端到端流程,並能主動揭示結論背後的空間證據。這種具備稽核能力的推理路徑,大幅提升了 AI 輔助診斷的透明度。這項研究不僅展示了視覺語言模型在複雜醫療影像判讀上的潛力,也為未來開發具備臨床解釋性的 AI 診斷工具提供了一個可行的技術框架。