Problem

多語言檢索增強生成(RAG)系統中,現有的重排序器在處理語義相近但語言不同的文件時,往往無法優先推薦與查詢語系相同的文件。這種語言不一致的現象會直接干擾後續模型的答案生成品質,但在現有的多語言重排序研究中卻常被忽略。

Method

研究團隊開發了名為 LAMAR 的語言感知多語言交叉編碼器。該模型首先採用「以英文為錨點的相關性蒸餾」技術,建立跨語系的統一評分標準,隨後導入「語言一致性偏好對齊」機制,訓練模型在確保語義相關性的前提下,給予與查詢語系相同的文件更高排名。

Results

在針對語言一致性設計的受控實驗中,LAMAR 在所有測試語系中均取得最佳表現。此外,在標準多語言重排序基準測試中,LAMAR 不僅保持強大的競爭力,更在實際檢索場景的兩階段評測中,於所有回報指標上皆達到領先地位。

Significance

此研究強調了多語言檢索中「語言相干性」的重要性,並證實了透過偏好對齊能有效提升排序精確度。LAMAR 的開源提供了一個強而有力的工具,有助於開發更符合使用者語言習慣且具備高效能的多語言資訊檢索系統。