Problem

目前的視訊記憶系統多半僅支援被動式的問答檢索,且主動式助理通常將記憶與控制機制分開處理。這使得穿戴式裝置難以在理解視覺歷史的同時,自動判斷當前情境是否需要調用過去的記憶來輔助現狀。

Method

開發免訓練的 GROVE 框架,能從連續視訊串流中逐步建構因果記憶。系統將細粒度的感知證據整合為具時間戳記的時刻、連貫的事件片段及跨日重複模式,並為不同層級配備專屬的檢索技能,同時支援使用者提問(被動)與當前情境觸發(主動)的記憶存取。

Results

在 MM-lifelong 與 EgoServe 等多項挑戰性基準測試中,GROVE 的表現均優於現有方法。消融實驗證實,時間分層結構與其檢索技能具備高度互補性,特別是「跨日模式」在處理跨越多天的觀察證據時,能提供最顯著的效能增益。

Significance

此研究展示了如何透過統一的記憶與存取介面,讓人工智慧助理同時具備反應式問答與主動式協助的能力。這為穿戴式裝置在複雜、長時段的人類生活場景中,實現更直覺且智慧化的互動奠定了重要基礎。