Problem
現有的自駕視覺語言模型(VLM)在訓練與標註過程中,常讓教師模型預先接觸到真實的未來軌跡(GT trajectory)。這會導致模型產生「軌跡錨定偏誤」(Trajectory Anchoring Bias),使其僅是為已知結果強行找理由,而非根據現場環境證據進行推論,進而在因果關係複雜的場景中引發嚴重的幻覺與邏輯錯誤。
Method
研究團隊提出「自駕多選題」(AD-MCQ)機制,將路徑規劃轉化為從多個候選軌跡中進行選擇,以避免開放式生成帶來的幾何合成難度。在此基礎上,進一步開發 DEFT-RLVR 框架,將未來軌跡從「決策前的提示」轉變為「決策後的驗證目標」,迫使模型必須先進行決策判斷,再進行結果驗證。
Results
實驗數據證明,DEFT-RLVR 能顯著提升模型在自駕場景下的推理品質,並大幅減少幻覺現象,同時還能維持甚至增強模型的通用視覺能力。透過 AD-MCQ 的架構,研究者能靈活調整問題難度,為自駕推理的可驗證性提供了一個具備擴展性的研究基礎。
Significance
此研究解決了視覺語言動作(VLA)模型在訓練中的誠信問題。透過將決策過程與未來軌跡解耦,不僅提升了自駕決策的因果忠實度,更為未來開發具備高度邏輯一致性、安全且可解釋的自動駕駛系統開闢了新路徑。