2604.18131v1
CC BY 4.0
訓練 LLM 智能體透過世界知識探索實現自發、無獎勵的自我演化
Training LLM Agents for Spontaneous Reward-Free Self-Evolution via World Knowledge Exploration
Qifan Zhang, Dongyang Ma, Tianqing Fang, Jia Li, Jing Tang, Nuo Chen, Haitao Mi, Yan Wang
LLMAgentSelf-EvolutionReinforcement LearningWeb Agent世界知識
Teds Lin 許願