讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: Credit Assignment 2 篇 × 清除
2609.00829v1 arXiv License

HarnessEvolve:從參考軌跡學習,實現可靠的代理自我演化

HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution

Wen Jiang、Mingmin Chu、Yimeng Tian、Qianxin Zhang、Haofei Yang、Rui Yang、Yang Liu、Tao Lv、Fangming Li(華為技...

AI AgentSelf-EvolutionHarness OptimizationCredit AssignmentMulti-AgentLLM Agent
Liang-Hsun Huang 許願
2604.03128v2 CC BY 4.0 Alibaba / Qwen Team

Self-Distilled RLVR:以自我蒸餾改進可驗證獎勵的強化學習

Self-Distilled RLVR

Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao, Zheng Lin, Weiping Wang, J...

LLMRLVRSelf-DistillationReasoningRLMultimodalCredit Assignment
Teds Lin 許願