Problem

目前的 AI 代理工具使用基準測試大多仰賴靜態環境與明確的語義說明(如工具名稱或功能描述),這導致代理能藉由預訓練知識來猜測工具用途,而非真正透過互動理解陌生系統。這種模式無法有效評估代理在面對未曾見過、無說明的開放式環境時,是否具備真正的自主發現與適應能力。

Method

研究團隊開發了名為 ScrambleToolBench 的互動式終端測試平台,其核心特性在於徹底移除工具名稱的語義線索。該框架強迫代理必須透過純粹的試錯互動來理解隱藏行為,並引入「映射偏移」(Mapping Drift)、隨機動作失敗以及執行時窗等動態挑戰,用以評估模型在環境結構發生改變時,是否能即時修正其推論假設。

Results

實驗顯示,即便是最強大的大型語言模型,在初始發現成功後也難以應對結構性變動。當面臨映射偏移時,代理往往會展現出「信念慣性」,或者退化回效率極低的暴力搜索,而非採用循環追蹤等演繹策略。此外,增加測試時的推理量(Test-time reasoning)僅會放大這種昂貴的窮舉行為,無法引導模型進行有效的邏輯復原。

Significance

本研究揭示了當前自主代理在邏輯推理上的重大斷層:即使具備長期記憶,模型仍無法高效推斷出環境結構的變動。這項基準測試為未來開發更具韌性、能在未知動態系統中穩定運作的 AI 代理提供了關鍵的評估標準,也強調了從「依賴知識」轉向「依賴演繹」的重要性。