Problem

傳統上類神經網路的訓練、學習與推論被視為互不連貫的過程或黑盒,缺乏統一的物理描述來解釋參數更新如何轉化為持續的運算能力,以及推論過程如何繼承並展現訓練階段的動力學特徵。

Method

研究者開發了「生成事實圖譜」(GFG)作為科學事實的底層架構,記錄模型演進的原子事實。透過 nanoGPT 觀察參數優化器的狀態演化,將其定義為受特定幾何條件調節的非線性功能響應,並建構二階預測器。隨後在 ResNet 與擴散模型上驗證此動態框架的普適性。

Results

實驗證明訓練是受接收狀態調節的響應過程,而學習則是這些響應所導致的功能支持持續重組。二階預測器在預測模型效能轉折時達到 91.43% 的準確率。研究進一步證實推論本質上是訓練動態的「凍結投影」,揭示了注意力機制在組織資訊時的因果招募邏輯。

Significance

本研究為 AI 模型提供了原生且可編譯的科學事實基礎,使原本難以觀測的學習與退化過程變得可量化。透過統一訓練與推論的動力學觀點,不僅深化了對模型決策機制(如注意力與回饋)的理解,更為未來自動化科學發現與模型控制奠定基礎。