Problem
大型語言模型作為行動助理時,必須跨應用程式整合分散的個人資訊以完成指令。然而,目前缺乏專門的基準測試來衡量模型在處理這類複雜且零散資料時的認知、檢索與多輪對話能力,導致其效能限制尚不明確。
Method
研究團隊建立人工策劃的基準測試 SPIEval,針對推理、消歧義、整合、偏好推斷及多意圖分解五大認知能力進行設計。該測試包含 250 個任務,橫跨 10 個應用程式中的 4,335 筆個人記錄,並支援 21 種工具的多輪互動環境,確保測試過程可控且結果可驗證。
Results
評測 9 款代表性模型後發現進步空間極大。最強模型僅達到 57.3% 的準確率,最弱者僅 16.4%。分析顯示 79% 的失敗源於「資訊定位錯誤」,模型往往過早採信看似合理但錯誤的資訊,而非持續檢索驗證;此外,僅不到 2% 的檢索行為使用了進階搜尋方法。
Significance
此研究揭示了當前 LLM 行動助理在處理散亂資訊時的根本侷限性,特別是在資訊定位與檢索策略上的不足。公開的資料集與程式碼為未來開發具備高效驗證能力與精準檢索功能的個人助理提供了重要的研究基礎。