Problem

使用者在對話中要求修改 LLM 生成的成品(如程式碼或文件)時,往往僅指定局部變動。然而,成品內部常存在複雜的相依關係,LLM 若無法準確識別這些依賴項並將修改傳播至所有受影響的部分,將導致成品內容不一致或功能失效,且相關脈絡往往隱藏在冗長的對話歷史中。

Method

研究團隊開發了一套全新的基準測試,用於評估模型在對話情境下的修改傳播能力。實驗涵蓋了 gpt-oss、gpt-5.4-mini 及 qwen3.5 等多種模型,並比較了九種修改方法,包括序列式反思與平行取樣變體。研究重點在於探索如何在「測試時計算」(Test-time Compute)中找到效能與成本的最佳平衡點。

Results

基準測試顯示模型初始準確度落在 68.3% 至 93% 之間。研究發現最具成本效益的優化方式是從三個平行樣本中進行篩選,不論是透過 LLM 評選或中心點(Medoid)選取法,皆能在低運算負擔下讓準確度提升 2.2% 至 9.7%。

Significance

這項研究為提升 LLM 在實務編輯任務中的可靠性提供了重要指引。透過量化不同推論策略的成本與產出品質,開發者能更有效地配置運算資源,打造出更精確且具備自動化相依性處理能力的對話式 AI 輔助工具。