2604.07941v1
arXiv License
大型語言模型後訓練:離策略與在策略學習的統一視角
Large Language Model Post-Training A Unified View of Off-Policy and On-Policy Learning
Shiwan Zhao, Zhihu Wang, Xuyang Zhao, Jiaming Zhou, Caiyue Xu, Chenfei Liu, Liting Zhang, Yuhang Jia...
LLMPost-TrainingRLHFSFTPreference OptimizationDistillation綜述
Teds Lin 許願