ChatGPT 自發布以來,其成長速度創下了軟體史上的紀錄。然而,在大眾關注模型生成能力之際,背後的資料處理難題往往被忽略。OpenAI 近期分享了其儲存架構 Habitat 的演進史。這項技術起初只是為了方便研究員讀取訓練資料的 Python 函式庫,但在使用者突破 10 億大關、請求量達到每秒 2,200 萬次(RPS)的極端情況下,傳統的儲存方案已完全無法支撐,迫使團隊進行根本性的架構轉型。
Habitat 的發展路徑反映了 AI 應用從「實驗室」走向「大規模商用」的縮影。早期,Habitat 僅是提供簡單 API 供訓練任務使用。但隨著 ChatGPT 用戶激增,OpenAI 發現如果僅依賴標準的雲端儲存或現成的資料庫,延遲與成本將變得不可控。因此,他們將 Habitat 重新定義為一個全球分散式的儲存平台。這個過程並非一蹴可幾,而是涉及了對系統底層的深度優化,包含極高效的資料快取策略、緩衝區管理,以及如何在不影響效能的前提下,橫向擴展到全球各地的資料中心。
這項發展對整個技術產業具有多重指標意義。首先,它證明了當 AI 模型進入兆級參數與億級用戶的時代,軟體工程的重要性並不亞於模型研發。許多公司致力於調校參數,卻常在基礎設施上摔跤。OpenAI 的經驗顯示,優質的儲存層不僅能降低運算成本,更能直接影響使用者的互動體驗(如回覆速度)。其次,Habitat 展現了「針對工作負載設計(Workload-specific)」的重要性,通用型儲存系統在極端流量下往往會失效,必須根據模型存取資料的特性量身打造解決方案。
對於台灣的科技業與大型網路服務開發者來說,這是一個極佳的案例研究。在開發生成式 AI 應用時,開發者不應只看模型表現,更應提早思考如何建構可擴展的資料管線。Habitat 的成功在於它能彈性適應從幾萬到十億用戶的增長壓力,這不僅是工程上的勝利,更是產品長久穩定運行的基石。隨著 AI 競爭進入白熱化,未來的關鍵戰場或許不在於誰的模型參數更多,而在於誰的基礎設施能更有效率地支撐這些龐然大物在全天候運作下不致崩潰。