HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution
自我演化代理透過「依環境回饋優化自己的 harness——提示、技能、工具、執行邏輯」邁向自主。然而這個範式受三個挑戰所阻:信用分配失效 (credit assignment failure),末端成功/失敗回饋讓「哪一步造成錯誤」變得模糊;捷徑學習 (shortcut learning),代理死記任務特定模式而非取得可泛化能力;災難性遺忘 (catastrophic forgetting),未把關的更新退化先前已取得的能力。在本文中,我們引入 HarnessEvolve,一個從參考軌跡學習以達成可靠代理自我演化的框架。HarnessEvolve 把執行代理與演化流程解耦,把執行、評估、優化、把關分派給獨立的代理模組,實現可泛化且穩定的 harness 改善。具體而言,HarnessEvolve 藉由生成參考軌跡(給定標準答案時產生的執行路徑)並把失敗執行對齊到它們以萃取錯誤訊號、再把訊號聚類以揭露系統性失效模式,來克服信用分配失效。為防止捷徑學習與災難性遺忘,候選 harness 更新必須通過兩道閘:一道品質閘 (quality gate) 過濾資料洩漏 (data leakage) 與提示膨脹 (prompt bloat),一道效能閘 (performance gate) 只在「更新改善當前批次、且不退化近期批次」時接受,並在 epoch 結束時用保留集選出表現最佳的已接受代理快照。我們在橫跨開放領域與企業情境的多個基準上、用不同模型與代理框架做了廣泛實驗。結果證明 HarnessEvolve 在所有基準與設定上都一貫勝過 state-of-the-art 基準線,確認其跨任務領域的可靠性。
原文連結:arXiv