Problem

目前的位元組級(Byte-level)階層式語言模型雖然比傳統子詞標記模型更具強健性,但每次僅能生成單一位元組的特性,導致推論速度極慢,成為限制其實際應用的主要效能瓶頸。

Method

研究團隊開發了「多位元組預測」(MBP)架構,其核心包含兩大創新:首先是引入「可變長度預測視窗」,使其能與階層式模型的潛在片段(segments)精確對齊;其次是實作新型注意力遮罩機制,在不違反因果律的前提下實現位元組的平行預測,且完全不需額外增加模型參數。

Results

實驗結果顯示,MBP 在指令遵循、問答、摘要及機器翻譯等多種生成任務中,均達到了帕累托最優(Pareto-optimal)的平衡狀態。該技術在提升推論吞吐量的同時,僅對模型效能產生極微小的影響,成功兼顧了速度與品質。

Significance

這項研究為位元組級語言模型的推論效率問題提供了關鍵解方。透過 MBP 技術,開發者能在維持模型強健性的基礎上,大幅降低運算成本並提升生成速度,證明了階層式架構在現代大規模語言模型開發中的高度實用性。