Problem

隨著開源權重模型在第三方平台廣泛部署,如何審計這些託管 API 的推論品質成為嚴峻挑戰。現有方法往往依賴 logprob 等內部機率資訊,但在完全黑箱的環境下,難以驗證供應商提供的服務是否與原始模型一致,或是推論過程是否存在人為偏誤或精度損失。

Method

研究團隊提出 Ventor-QTest 黑箱審計架構,包含兩大核心指標:「平均忠實度損失 (AFL)」透過對相同上下文進行重複請求,從回傳文字頻率中重建類別分布,並計算修正後的 KL 散度;「極端忠實度損失 (EFL)」則利用長序列探針偵測推論過程中的異常資訊量(surprisal)分布,這套方法完全無需目標 API 提供機率數據。

Results

實驗證實 AFL 與基於機率計算的指標具有高度線性一致性,能精準反映推論偏差。研究亦發現,極端忠實度損失 (EFL) 與長時程任務(如 Terminal-Bench)的成功率下降有顯著關聯,而一般的學術測驗(如 GPQA)則較難偵測到此類細微的推論品質惡化,這說明長序列任務對模型忠實度更為敏感。

Significance

本研究為日益增長的雲端模型生態系提供了關鍵的透明化工具。藉由開源 Ventor-QTest,企業與開發者得以在不接觸權重的前提下監測供應商的服務品質。特別是在執行具備長期規劃性質的代理人(Agentic)任務時,同時採用 AFL 與 EFL 指標對於維護系統可靠性至關重要。