由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇
Hybrid Policy Distillation for LLMs
Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu
Lightning OPD Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation
Yecheng Wu, Song Han, Han Cai