Problem

傳統大型語言模型在測試階段(test-time)進行推理時,通常依賴對完整推論軌跡的評估。然而,長篇軌跡中充斥著常規標記,容易稀釋關鍵錯誤訊號,使得模型難以識別隱蔽的邏輯漏洞,導致在高信心度下仍產出錯誤解法。

Method

提出「聲明級可靠性評估」(CLR)框架,將推論過程壓縮為數個關鍵聲明,藉此隔離邏輯錨點。該方法利用「語義證偽」的不對稱性:建立完整正確解答極其困難,但推翻錯誤解答僅需找到一個關鍵反證。透過針對性的負面證據搜索,配合非線性可靠性評分,系統性地壓制錯誤解答的生存空間。

Results

在四項推理基準測試中,CLR 均顯著提升了 pass@1 與自我一致性表現。以 GPT-OSS-20B 在 CMIMC25 上的表現為例,CLR 不僅將 pass@1 提高了 27.15 個百分點,更在節省 37.0% 標記數(tokens)的情況下,將準確度從 77.50% 提升至 82.19%。

Significance

此研究重新定義了測試時運算的分配邏輯,證明將算力從「盲目增加取樣」轉向「精確聲明驗證」更具效率。這為提升 LLM 在複雜邏輯任務中的可靠性提供了全新的技術路徑,能在更低的成本下達到更高的推論品質。