Problem

雖然大型語言模型在多國語言任務中表現日益精進,但英語與韓語之間仍存在難以解釋的效能差距。現有評估工具難以釐清效能低落究竟是源於翻譯不對等、韓文字母(Jamo)處理障礙,還是對韓國文化邏輯的理解缺失。

Method

研究團隊開發了 NOLLI 基準,包含 15 種謎題類型共 7,500 個自動生成的項目。其創新之處在於採用「行為校準難度」,透過參考模型的準確率來調整生成器。測試架構分為三層:對等翻譯、涉及韓文字母操作的任務,以及根植於韓國文化與拼寫規律的專屬任務。

Results

在 15 款受測模型中,對等翻譯任務的英韓表現差異在統計上極小。但在涉及書寫系統的「韓文密碼」任務中,韓語表現大幅落後英語達 68.7 個百分點,且字母組成能力可預測密碼任務的成敗。此外,研究發現任務的結構規模並非難度的可靠指標,且模型在韓國親屬關係推理上普遍存在顯著效能落差。

Significance

本研究建立了一個精密的診斷架構,證實韓語效能差距主因在於多步驟的子音字母執行力,而非單純的語言轉換。這為開發者在提升非拉丁語系模型效能時,提供了關於書寫系統與文化邏輯處理的關鍵指引。