自我改進式預訓練:利用後訓練模型來預訓練更好的模型

Self-Improving Pretraining using post-trained models to pretrain better models

摘要

大型語言模型傳統上分階段訓練:先在原始文本上進行預訓練 (Pretraining),然後進行後訓練 (Post-training) 以實現指令遵循和推理能力。然而,這種分離產生了一個根本性的限制:許多理想行為,如安全性 (Safety)、事實性 (Factuality)、整體生成品質 (Generation Quality) 和推理能力 (Reasoning),都是在很晚的階段才被加入,儘管在早期學到的模式已經強烈塑造了模型的能力。為了解決這個問題,我們引入一種新的預訓練和中期訓練 (Mid-training) 方法,將這些行為更早地納入訓練過程。我們利用一個已有的強大後訓練模型來重寫預訓練資料並判斷策略模型的生成結果 (Rollouts),從而在訓練早期就使用強化學習 (Reinforcement Learning)。在實驗中,我們展示這可以在品質、安全性、事實性和推理方面帶來顯著提升。

此論文授權為 arXiv License

非 Creative Commons 授權的論文需登入後方可閱讀翻譯全文

Google 登入後閱讀

原文連結:arXiv