Problem

大型語言模型在處理長文本預處理(Prefill)階段時,由於自注意力機制的計算量隨序列長度呈二次方成長,導致極大的運算負擔與記憶體頻寬壓力。現有的混合精度方案多採用統一的低精度路徑或選取特定的標記(Token)互動,難以在融合注意力算子中實現硬體對齊的空間精度動態分配,限制了推理加速的潛力。

Method

研究團隊開發了名為 TileMix 的區塊核心精度路由核心,將精度決策轉化為注意力矩陣內空間區塊組的可執行決策。該技術將矩陣劃分為硬體感知的評分區塊,利用精簡的位元遮罩(Bitmasks)決定各區塊組應透過 FP16 或 INT8 路徑運算,並讓兩者共享線上 Softmax 狀態。TileMix 支援分組查詢注意力(GQA)、可變長度批次以及 INT8 的鍵值快取(KV Cache),且完全不需要額外的模型訓練。

Results

在 A100 平台上針對 LLaMA、Qwen 及 Vicuna 等模型進行的測試顯示,TileMix 在 LongEval 與 LV-Eval 基準測試中,成功挽回了統一 INT8 量化所損失的長文本理解品質。同時,其預處理吞吐量優於標準 FP16 實作,為不同模型家族提供了一個可控的精度與效率權衡曲線,實現了更高效的推理表現。

Significance

這項研究為長文本 LLM 推理優化開拓了新路徑,透過硬體感知的空間調度解決了計算密集與精度損失之間的矛盾。TileMix 不僅確保了稠密標記的連接完整性,其無需訓練的特性更使其能直接應用於現有的開源模型,對於提升生成式 AI 在長上下文場景下的服務效率具有高度實用價值。