由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇
Co-Evolving Policy Distillation
Naibin Gu, Chenxu Yang, Qingyi Si, Chuanyu Qin, Dingyu Yao, Peng Fu, Zheng Lin, Weiping Wang, Nan Du...
OpenThoughts Data Recipes for Reasoning Models
Etash Guha, et al.
Hybrid Policy Distillation for LLMs
Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu
Large Language Model Post-Training A Unified View of Off-Policy and On-Policy Learning
Shiwan Zhao, Zhihu Wang, Xuyang Zhao, Jiaming Zhou, Caiyue Xu, Chenfei Liu, Liting Zhang, Yuhang Jia...