在生成式 AI 與語音技術蓬勃發展的當下,開發者面臨的最大挑戰往往不是模型準確度,而是居高不下的運算成本。以 AI 醫療平台 Heidi Health 為例,該公司每週需處理全球超過 240 萬場臨床諮詢,其核心的自動語音辨識(ASR)系統對延遲要求極其苛刻。然而,在傳統的運算環境中,單個 ASR 推論請求通常僅佔用 GPU 約 15% 至 20% 的運算能力,由於 NVIDIA CUDA 預設的時間片切換(Time-slicing)機制,其餘 80% 的硬體資源在推論期間往往處於閒置狀態,導致企業必須租用過多的雲端實例來滿足高峰期的需求。
為了解決資源浪費的問題,AWS 與 NVIDIA 提出了一套整合 NVIDIA MPS(Multi-Process Service,多程序服務)與 Triton 推論伺服器的技術方案。MPS 技術的核心在於打破傳統 CUDA 任務排隊執行的限制,允許來自多個程序的核函數(Kernels)同時在同一張 GPU 上併發執行。這意味著原本因循序執行而造成的硬體空檔,現在可以被其他請求填滿。對於像 Heidi Health 這樣需要處理大量短語音片段的場景,這種併發處理能力是提升吞吐量的關鍵。
這項技術優化帶來的經濟效益非常顯著。Heidi Health 原本需要租用 16 個 GPU 實例才能應付的高負載工作,在導入 MPS 後,僅需 4 個實例便能處理相同的運算量,節省了高達 75% 的硬體開支。更重要的是,這種效率提升並非以犧牲性能為代價;在每張 GPU 每秒處理 92.1 次請求(RPS)的情況下,系統依然能將轉錄延遲維持在「次秒級」(Sub-second),這對於需要即時反饋的醫療環境至關重要。
此案例對台灣蓬勃發展的 AI 新創與數位轉型企業具有高度參考價值。許多企業在導入 AI 應用時,常卡在「擴大規模即代表成本失控」的困境中。透過這類系統層級的技術優化,開發者不再只能依賴昂貴的硬體升級,而是能透過更精確的硬體調配,實現高效能、低成本的推論架構。這不僅證明了軟體定義硬體效率的可能性,也為 ASR 技術在更多高頻率應用場景的普及,鋪平了經濟可行的道路。