讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: Distillation 4 篇 × 清除
2604.27083v1 CC BY 4.0

共同演化策略蒸餾

Co-Evolving Policy Distillation

Naibin Gu, Chenxu Yang, Qingyi Si, Chuanyu Qin, Dingyu Yao, Peng Fu, Zheng Lin, Weiping Wang, Nan Du...

LLMRLVRDistillationOn-Policy DistillationMulti-CapabilityReasoningMultimodal
Teds Lin 許願
2506.04178v2 CC BY 4.0 Alibaba / Qwen Team

OpenThoughts:推理模型的資料配方

OpenThoughts Data Recipes for Reasoning Models

Etash Guha, et al.

LLMReasoningData RecipeSFTOpen DatasetDistillationBenchmark
Thomas Liang 許願
2604.20244v1 CC BY 4.0

大型語言模型的混合策略蒸餾

Hybrid Policy Distillation for LLMs

Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu

LLMDistillationRLPolicy DistillationReasoningKL DivergenceOn-policy
Teds Lin 許願
2604.07941v1 arXiv License

大型語言模型後訓練:離策略與在策略學習的統一視角

Large Language Model Post-Training A Unified View of Off-Policy and On-Policy Learning

Shiwan Zhao, Zhihu Wang, Xuyang Zhao, Jiaming Zhou, Caiyue Xu, Chenfei Liu, Liting Zhang, Yuhang Jia...

LLMPost-TrainingRLHFSFTPreference OptimizationDistillation綜述
Teds Lin 許願