讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: Mid-training 3 篇 × 清除
2512.07783v1 arXiv License Carnegie Mellon University

論預訓練、中期訓練與強化學習在推理語言模型上的交互作用

On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models

Charlie Zhang、Graham Neubig、Xiang Yue(Carnegie Mellon University, Language Technologies Institute)

LLMReinforcement LearningReasoningPre-trainingMid-trainingGRPOProcess Reward
kerg kerg 許願
2509.20186v4 CC BY 4.0

思考增強預訓練 (Thinking Augmented Pre-training)

Thinking Augmented Pre-training

Liang Wang, Nan Yang, Shaohan Huang, Li Dong, Furu Wei

LLMPre-trainingReasoningSynthetic DataData AugmentationMid-training
Teds Lin 許願
2501.00656v3 CC BY 4.0 MIT

2 OLMo 2 Furious:完全開放的下一代語言模型家族

2 OLMo 2 Furious

OLMo Team(Pete Walsh, Luca Soldaini, Dirk Groeneveld, Kyle Lo, Shane Arora, Akshita Bhagia, ... Ali ...

LLMOLMo開源模型預訓練Mid-trainingRLVRTüluAllen AI
林伯燊 許願