讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: Preference Optimization 1 篇 × 清除
2604.07941v1 arXiv License

大型語言模型後訓練:離策略與在策略學習的統一視角

Large Language Model Post-Training A Unified View of Off-Policy and On-Policy Learning

Shiwan Zhao, Zhihu Wang, Xuyang Zhao, Jiaming Zhou, Caiyue Xu, Chenfei Liu, Liting Zhang, Yuhang Jia...

LLMPost-TrainingRLHFSFTPreference OptimizationDistillation綜述
Teds Lin 許願