讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: On-policy 2 篇 × 清除
2604.20244v1 CC BY 4.0

大型語言模型的混合策略蒸餾

Hybrid Policy Distillation for LLMs

Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu

LLMDistillationRLPolicy DistillationReasoningKL DivergenceOn-policy
Teds Lin 許願
2604.13010v1 CC BY 4.0 Alibaba / Qwen Team

Lightning OPD:利用離線同策略蒸餾實現大型推理模型的高效後訓練

Lightning OPD Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation

Yecheng Wu, Song Han, Han Cai

LLMKnowledge DistillationPost-TrainingOn-PolicyReasoning訓練效率
Teds Lin 許願