讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: Reinforcement Learning 5 篇 × 清除
hf-XiaomiMiMo-MiMo-V2.6-Flash-RL MIT License MIT

MiMo-V2.6:將強化學習擴展至自我改進

MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement

LLM-Core Xiaomi

Reinforcement LearningSelf-ImprovementMoELong ContextMixed-Task Agentic RLReward Hacking Defense
Liang-Hsun Huang 許願
2506.13585v1 arXiv License Alibaba / Qwen Team

MiniMax-M1:以閃電注意力高效地擴展測試時運算

MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention

MiniMax(通訊:[email protected];共 128 位貢獻者,完整名單見原論文附錄 A)

Reasoning ModelLightning AttentionReinforcement LearningCISPOMoELong Context開源模型
Liang-Hsun Huang 許願
2512.07783v1 arXiv License Carnegie Mellon University

論預訓練、中期訓練與強化學習在推理語言模型上的交互作用

On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models

Charlie Zhang、Graham Neubig、Xiang Yue(Carnegie Mellon University, Language Technologies Institute)

LLMReinforcement LearningReasoningPre-trainingMid-trainingGRPOProcess Reward
kerg kerg 許願
2604.18131v1 CC BY 4.0

訓練 LLM 智能體透過世界知識探索實現自發、無獎勵的自我演化

Training LLM Agents for Spontaneous Reward-Free Self-Evolution via World Knowledge Exploration

Qifan Zhang, Dongyang Ma, Tianqing Fang, Jia Li, Jing Tang, Nuo Chen, Haitao Mi, Yan Wang

LLMAgentSelf-EvolutionReinforcement LearningWeb Agent世界知識
Teds Lin 許願
2604.14922v1 CC BY 4.0 Alibaba / Qwen Team

LongAct:利用內在激活模式實現長上下文強化學習

LongAct Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning

Bowen Ping, Zijun Chen, Tingfeng Hui, Qize Yu, Chenxuan Li, Junchi Yan, Baobao Chang

LLMLong ContextReinforcement LearningActivationSparse UpdateGRPO
Teds Lin 許願