Problem
當前尖端大語言模型(LLM)極易受到提示注入(Prompt Injection)攻擊的威脅,然而傳統的人工紅隊測試效率低下且難以窮舉所有潛在風險,急需一種可大規模擴展的自動化漏洞發現機制,以確保生產系統的穩健性。
Method
研究團隊開發了 GPT-Red 代理,採用可擴展的自我博弈(Self-Play)演算法。該模型在模擬現實的紅隊環境中,與多樣化的防禦者代理進行對抗訓練。此過程投入了與大型強化學習(RL)後訓練相當的運算資源,是目前文獻中規模最大的 AI 安全訓練專案。
Results
GPT-Red 展現出卓越的攻擊能力,能穩定破解包含 GPT-5.5 在內的既有模型,且發現的成功攻擊案例數量超越了人類專家。研究團隊利用其產生的對抗樣本進行訓練,打造出迄今對提示注入防護最強大的 GPT-5.6 模型。
Significance
此研究證實了自動化紅隊測試在提升模型安全性方面的巨大潛力。隨著防禦模型更趨強健,將能提供更高品質的學習訊號來訓練更強大的紅隊代理,進而形成「安全性自我進化」的正向循環,為未來 AI 安全防護立下新典範。