大型語言模型後訓練:離策略與在策略學習的統一視角

Large Language Model Post-Training A Unified View of Off-Policy and On-Policy Learning

摘要

後訓練 (post-training) 已成為將廣泛預訓練的大型語言模型轉變為對齊的、具任務能力的、可部署系統的核心階段。近期的進展涵蓋了監督式微調 (SFT)、偏好最佳化 (preference optimization)、強化學習 (RL)、過程監督 (process supervision)、驗證器引導方法 (verifier-guided methods)、蒸餾 (distillation) 以及越來越複雜的多階段管線。然而,這些方法通常以碎片化的方式討論,按歷史標籤或目標函數家族分類,而非按它們所處理的底層行為瓶頸來組織。 本綜述主張,LLM 後訓練最好被理解為對模型行為的結構化干預。我們首先以軌跡來源 (trajectory provenance) 組織整個領域,定義兩種主要學習體制:離策略學習 (off-policy learning)(在外部供給的軌跡上改善模型)和在策略學習 (on-policy learning)(在學習者自生的展開上改善模型)。然後透過兩個循環的分布層級角色來詮釋主要方法:有效支撐擴展 (effective support expansion)(使有用行為可靠地可達)和策略重塑 (policy reshaping)(改善已可達區域內的行為),加上系統層級的行為鞏固 (behavioral consolidation)(保存、遷移和攤銷跨階段的有用行為)。

此論文授權為 arXiv License

非 Creative Commons 授權的論文需登入後方可閱讀翻譯全文

Google 登入後閱讀

原文連結:arXiv