讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: RL 3 篇 × 清除
gh-MoonshotAI-Kimi-K3 Kimi K3 License Moonshot AI

Kimi K3:開放的前沿智慧

Kimi K3: Open Frontier Intelligence

Kimi Team

LLMMoEKimiAgentLinear AttentionRL開源模型
Liang-Hsun Huang 許願
2604.03128v2 CC BY 4.0 Alibaba / Qwen Team

Self-Distilled RLVR:以自我蒸餾改進可驗證獎勵的強化學習

Self-Distilled RLVR

Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao, Zheng Lin, Weiping Wang, J...

LLMRLVRSelf-DistillationReasoningRLMultimodalCredit Assignment
Teds Lin 許願
2604.20244v1 CC BY 4.0

大型語言模型的混合策略蒸餾

Hybrid Policy Distillation for LLMs

Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu

LLMDistillationRLPolicy DistillationReasoningKL DivergenceOn-policy
Teds Lin 許願