2512.07783v1
arXiv License
Carnegie Mellon University
論預訓練、中期訓練與強化學習在推理語言模型上的交互作用
On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
Charlie Zhang、Graham Neubig、Xiang Yue(Carnegie Mellon University, Language Technologies Institute)
LLMReinforcement LearningReasoningPre-trainingMid-trainingGRPOProcess Reward
kerg kerg 許願