Reinforcing Agents with Collective Skills
我們introduce Skill2Env,一個為現代代理式 RL 打造的、與人類對齊 (human-aligned) 且可擴展的資料配方。通往安全超智慧的道路,需要與集體人類價值與專業行為對齊。公開的 Agent Skills 提供了這種監督的一個有希望的來源——它們代表「最貼近人類社會」的任務分布、連結到真實世界的產物、封裝領域專業與可重用工作流,且常常自帶成功指標。我們發展一條管線,把 3.4k 個「網路爬取並過濾」的 Agent Skills 轉成 8k 個可執行的終端環境,每個都帶程式化測試 (Programmatic Tests) 與行為評分準則 (Behavioral Rubrics)。透過大量 RL 實驗,我們觀察到通用代理能力的可觀改善:僅用 300 步、以 DPPO 變體做 RL 訓練,Qwen-3.8 27B 在 Terminal-Bench 2.1 上提升 4.7 個百分點、在 S2EBench(我們手工驗證的私有基準,含真實世界代理用例)上提升 4.3 個百分點。進一步分析顯示,在相似問題上,模型的行為與原始 Agent Skills 的對齊度增加。 圖 1:主要結果。Skill2Env 在代理式終端使用的公開與私有基準上都改善了基礎模型(Qwen3.8-27B → S2E-27B-step300),進一步在「貼近公眾興趣的任務分布」上縮小本地與雲端/前沿 LLM 的差距。Terminal-Bench 2.1:49.4 → 54.1(RL +4.7);S2EBench:33.4 → 37.7(RL +4.3)。
原文連結:arXiv