Problem
現有的技能獲取方法多將經驗視為簡單的摘要或記憶,導致效能較弱的模型在缺乏任務知識或策略時,難以從教師模型的隱含行為中有效學習。當學生代理人執行失敗時,其軌跡往往不足以推論出缺失的行為模式,造成不同能力等級模型間的知識傳遞斷層。
Method
本研究提出 SKILL-KD 框架,將技能視為異質模型間的明確蒸餾媒介。該框架會分析學生失敗與教師成功軌跡間的差異,提取出「技能補丁」並透過重新執行來驗證與迭代修正。此外,利用「漂移感知技能鞏固」技術管理編輯歷史,自動決定應新增、修改或跳過補丁,以防止重複更新導致技能漂移。
Results
在五項代理人基準測試與兩種學生模型設定中,SKILL-KD 均展現出優於現有固定模型適應方法的表現。實驗證明,透過結構化的文字技能補丁,即便是在凍結參數的情況下,學生模型也能有效內化教師的策略邏輯,顯著提升在動態環境下的決策精確度。
Significance
這項研究為模型間的知識轉移開闢了新路徑,使輕量化模型無需經過昂貴的微調程序,即可藉由顯性技能蒸餾獲得大型模型的作業能力。這對於在資源受限環境中部署高效能、具備自我進化能力的智慧代理人具有重大的實務價值。