Problem
自迴歸 Transformer 在解碼過程中,垂直向的回饋通道極其狹窄。每一解碼步驟僅能將選定的 Token 傳回底層,而頂層所產生包含豐富資訊的隱藏狀態則會被直接捨棄,這限制了模型在後續步驟中重複利用運算資源與深化邏輯推理的能力。
Method
研究團隊開發了「全頻寬 Transformer」(Full-bandwidth Transformer),核心在於引入「潛在回饋」(Latent Feedback)機制。透過門控線性單元(GLU)將前一步驟的頂層隱藏狀態與當前 Token 嵌入進行融合,重新作為輸入傳回模型底層。為了克服平行訓練的挑戰,採用了排程多階段訓練目標,在預訓練後期逐步引入回饋機制以確保穩定性。
Results
實驗結果顯示,具有 10 億參數的全頻寬模型在 4000 億個 Token 的訓練下,其語言建模、數學及程式碼生成表現顯著優於標準模型。該模型僅需極少的解碼額外開銷,就能達到標準 Transformer 使用 1.5 倍訓練量時的效能,並在推理任務中產生更簡潔且準確的邏輯路徑。
Significance
此項研究突破了現有 Transformer 垂直資訊流的瓶頸,在不改變 KV 快取架構與語言建模目標的情況下,有效提升了訓練資料的利用效率。這為開發高推理能力且低運算成本的大型語言模型提供了極具潛力的技術路徑,證明了強化模型內部資訊循環的巨大價值。