Problem

線性注意力模型雖具備高效的長文本推論能力,但其採用的 Delta-rule 記憶更新機制缺乏對資訊可信度(不確定性)的追蹤。這導致模型在處理輸入時,難以根據已累積的證據動態調整寫入強度,無法在不知道未來查詢需求的情況下,做出最優的記憶覆寫決策。

Method

提出 Kalman Delta Networks (KDNs) 架構,將關聯記憶視為卡爾曼濾波器的遞迴估計過程。為了克服傳統瑞卡提遞迴(Riccati recursion)難以在 GPU 上進行並行運算的困境,研究團隊開發了對角型(Diagonal)與等向型(Isotropic)兩種近似方案。這些方案利用 Möbius 映射(Möbius maps)技術,實現了具備對數級並行深度的關聯掃描(Associative Scans)。

Results

在 7.5 億與 13 億參數規模的受控預訓練實驗中,KDN 變體在困惑度(Perplexity)與多項下游任務的平均準確率上,皆穩定優於目前最先進的線性注意力模型(如 Delta-rule 變體)。這證明了明確追蹤記憶不確定性能有效提升狀態空間模型的表徵能力。

Significance

此研究為開發具備恆定記憶空間且效能媲美 Transformer 的模型架構提供了新路徑。透過結合經典控制理論與現代深度學習,KDN 不僅解決了線性注意力機制的寫入瓶頸,也為次世代長 context 語言模型提供了一個兼具理論支撐與運算效率的記憶更新方案。