在企業推動 AI 落地時,檢索增強生成(RAG)已成為優化大型語言模型(LLM)準確性的標準配置。然而,多數開發者在開發階段使用的是結構清晰、乾淨的測試資料,一旦進入真實的商業實戰環境,系統往往會被「雜訊文本」(Noisy Text)給絆倒。這些雜訊並非單純的打錯字,而是來自於使用者輸入習慣、快速輸入下的語音轉錄,以及最棘手的光學字元辨識(OCR)錯誤。
傳統觀點認為,只要在前端加上一個拼字檢查工具(Spell-check),就能解決大部分的問題。但在企業文件處理的脈絡下,這個想法顯然過於樂觀。拼字檢查工具通常依賴靜態字典與固定的編輯距離演算法,面對專業領域的縮寫、產品代號,或是 OCR 誤判導致的字元變形(例如將字母 o 誤認為數字 0),傳統工具往往顯得力不從心。甚至在某些情況下,過度的自動修正反而會將原本具有特定意義的專有名詞導向錯誤的方向。
這正是現代 RAG 系統需要重新思考檢索機制的地方。除了前端的基礎過濾,語意向量(Embeddings)在處理雜訊文本中扮演了更為關鍵的角色。向量模型不再僅僅看字面上的完全匹配,而是將文字轉化為高維度空間中的座標。這意味著,即便輸入的字元存在些微誤差,只要這些誤差在向量空間中仍然靠近原始概念的聚類,系統依然有極高機率能檢索到正確的參考來源。這對於處理 OCR 辨識誤差這種具有規律性、但非標準拼字錯誤的狀況特別有效。
這項技術觀察對產業的重要性在於,它將 AI 的技術討論從「模型參數多大」拉回到「資料韌性(Data Resilience)」的實務面。對於銀行、法律或醫療等擁有大量歷史掃描文件的產業來說,解決 OCR 雜訊是讓 RAG 真正具備商業價值的門檻。如果系統只能讀懂完美的數位原生檔案,而無法處理現實中帶有瑕疵的實體文件數位化資料,那麼 AI 的應用場景將會受到極大限制。
因此,開發者在設計系統架構時,需要意識到「乾淨的資料」在企業端其實是種奢侈品。未來的 RAG 最佳實踐,必須將雜訊容忍度納入核心考量,不僅要強化向量檢索對錯誤字元的韌性,更要評估如何透過語意層面的自動修復,來彌補傳統規則式拼字檢查的短板。這不只是技術參數的微調,更是對真實世界數據複雜性的深度體認。