Problem
目前學界對於大型語言模型(LLM)交易代理的理解多停留在模擬階段,缺乏在真實、高壓的生產環境中,針對大規模、長時段且具備資金壓力的實戰表現記錄與決策邏輯分析。
Method
研究團隊追蹤 DX Terminal Pro 與 DXAP 兩大系統在 2026 年間約六個月的運行數據,涵蓋逾 3,500 個由使用者出資的代理。分析對象包含 750 萬次模型調用與 30 萬次鏈上動作,並透過配對回放技術,在 416 個實戰場景中比較不同前沿模型的決策品質。
Results
操作層級(如風險滑桿)對行為的影響力遠超策略描述,代理展現出對波動性的盲目,導致少數高槓桿配置承擔了絕大多數爆倉。儘管 43.2% 的部位曾有大幅獲利,卻有近半數以虧損收場;DXAP 艦隊勝率僅 41%,遜於 50% 的散戶基準,且不同模型家族在決策品質上並無顯著統計差異。
Significance
這項研究為自主 AI 代理在去中心化金融(DeFi)領域的應用建立了第一套大規模實證基準。研究揭示了當前 LLM 代理在捕捉收益與風險識別上的局限性,並歸納出 17 條基於實戰教訓的研究規範,為未來自動化交易系統的設計提供重要指引。