On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
近期的強化學習 (Reinforcement Learning, RL) 技術在語言模型中帶來了令人印象深刻的推理提升,然而後訓練 (post-training) 是否真的能將模型的推理能力擴展至超越其在預訓練 (pre-training) 期間所習得的範圍,仍然不清楚。一個核心挑戰在於現代訓練流程缺乏控制:大規模預訓練語料庫是不透明的、中期訓練 (mid-training) 常常未被充分檢視,而 RL 目標又以複雜的方式與未知的先驗知識交互作用。為了解決這種模糊性,我們開發了一個完全受控的實驗框架,用以隔離預訓練、中期訓練與基於 RL 的後訓練各自的因果貢獻。我們的方法採用具有明確原子運算 (atomic operations)、可解析的逐步推理軌跡 (step-by-step reasoning traces)、以及對訓練分布進行系統性操控的合成推理任務。我們沿著兩個軸線評估模型:對更複雜組合的外推泛化 (Extrapolative Generalization),以及跨表層情境的情境泛化 (Contextual Generalization)。運用此框架,我們調和了對 RL 有效性的相互競爭觀點。我們證明:1) 只有當預訓練留有足夠餘裕 (headroom)、且 RL 資料針對模型的「能力邊界 (edge of competence)」——即位於邊界上、困難但尚未遙不可及的任務——時,RL 才會產生真正的能力增益(pass@128)。2) 情境泛化需要最低限度但足夠的預訓練曝光,之後 RL 便能可靠地遷移。3) 相較於僅使用 RL,中期訓練在固定運算量下顯著提升效能,顯示其在訓練流程中扮演著核心但被低估的角色。4) 過程級獎勵 (Process-level Rewards) 能減少獎勵駭客 (Reward Hacking) 並改善推理保真度。這些結果共同釐清了預訓練、中期訓練與 RL 之間的交互作用,為理解與改進推理 LM 的訓練策略奠定了基礎。
原文連結:arXiv