Problem
目前的自主攻防 AI 雖然具備挖掘漏洞的能力,但往往缺乏專業資安人員的作業安全性(OPSEC)意識。這些 AI 代理在達成目標的過程中,常會做出如刪除生產環境資源、在公開空間洩漏憑證等魯莽行為,導致其行蹤在真實世界的對抗環境中極易被偵測,無法達到高階滲透測試或紅隊演練的隱蔽標準。
Method
研究團隊開發了 StealthBench 評測基準,涵蓋 6 個 OPSEC 維度,並從真實的漏洞賞金計畫與紅隊演練軌跡中提取 11 個驗證案例,擴展為 14 個容器化任務場景。評估過程採用由 3 個大型語言模型(LLM)組成的評審小組,透過多數決投票機制,針對安全成功率、隱蔽品質以及魯莽達成率進行量化分析。
Results
評測結果顯示,目前市面上沒有任何模型在「安全成功率」(同時達成任務且保持隱蔽)的指標上超過 54%。這證實了 OPSEC 失敗是目前各系列模型普遍存在的系統性問題,模型往往在成功找出漏洞的同時,也因為低下的作業品質而暴露了自身的存在與意圖。
Significance
StealthBench 為開發具備「隱蔽意識」的 AI 代理提供了關鍵的評測工具與框架,不僅有助於提升自主攻防代理的專業程度,也為自動化監控自主安全部署提供了技術基礎,是 AI 資安領域邁向實戰化的重要里程碑。