OpenThoughts:推理模型的資料配方

原始論文:OpenThoughts: Data Recipes for Reasoning Models 作者:Etash Guha, et al. arXiv ID:2506.04178v2 日期:2025-06-05 標籤:LLM Reasoning Data Recipe SFT Open Dataset Distillation Benchmark

目錄

摘要

OpenThoughts 專案旨在為訓練推理模型 (Reasoning Models) 建立開源資料集 (Open-Source Datasets)。研究團隊在資料生成管線 (Data Generation Pipeline) 的各個步驟上進行了超過 1,000 次受控實驗,最終得到 OpenThoughts3 資料配方 (Data Recipe)。將此管線擴展到 1.2M 筆樣本,並使用 QwQ-32B 作為教師模型 (Teacher Model),產生了 OpenThinker3-7B 模型,在 AIME 2025 取得 53%、LiveCodeBench 06/24-01/25 取得 51%,以及 GPQA Diamond 取得 54% 的最先進 (State-of-the-art, SOTA) 開放資料推理結果。

Figure 1: OpenThoughts3 在不同資料規模下表現皆優於現有的 SFT 推理資料集。所有模型皆從 Qwen-2.5-7B-Instruct 微調而來。與大型 SFT 資料集 (AM、Nemotron Nano) 以及小型精選資料集 (s1.1、LIMO) 在 AIME 2025 (左)、LiveCodeBench 06/24-01/25 (中) 和 GPQA Diamond (右) 上的比較。


1. 引言

近期的前沿模型 (Frontier Models) 例如 DeepSeek-R1 與 o3 在數學、程式碼與科學等推理密集領域展現出強大效能。這些模型通常從具備能力的基礎模型 (Base Models) 出發,再透過後訓練 (Post-training) 技巧,例如監督式微調 (Supervised Fine-tuning, SFT) 或強化學習 (Reinforcement Learning, RL),以發展出推理能力。

然而,前沿推理模型的完整訓練配方並未公開,這使得研究社群在自行打造推理模型時面臨困難。OpenThoughts 專案的目標就是要彌合此一缺口:透過建立開源、可重現的資料配方與資料集,讓任何人都能訓練具備推理能力的模型。

OpenThoughts 專案歷經多個迭代。早期工作 (OpenThoughts-114K) 探討了將 Sky-T1 管線結合自動化驗證的擴展方法。OpenThoughts2-1M 則透過增強問題多樣性與合成生成策略,將規模擴展到 100 萬筆樣本。本文最終呈現 OpenThoughts3-1.2M —— 這是一份 120 萬筆推理資料集,搭配 OpenThinker3-7B 模型,是在開放資料條件下 7B 規模的 SOTA。

研究團隊從超過 1,000 次消融研究 (Ablation Studies) 中歸納出五個關鍵發現:

  1. 多答案取樣 (Multiple Answer Sampling):對每個問題從教師模型取樣多個答案,是有效將資料來源規模擴展至少 16 倍 (16×) 的方法。
  2. 教師模型強弱不等於蒸餾效果:表現較佳的模型不一定是更好的教師;QwQ-32B 雖然在基準上分數較低,作為教師卻優於 DeepSeek-R1。
  3. 驗證與過濾收益有限:各種驗證 (Verification) 與過濾方法對於最終效能的提升微乎其微。
  4. 品質高於多樣性:使用前 1-2 個高品質來源優於混用 8-16 個來源。
  5. LLM 過濾優於傳統方法:以 LLM 標註的難度 (Difficulty) 或 LLM 回應長度 (Response Length) 來過濾問題,比起預訓練資料常用的 embedding 或 fastText 過濾器效果更佳。

2. 相關工作

Gemini、QwQ 與 DeepSeek-R1 等模型的發布,使得長推理軌跡 (Long Reasoning Traces) 變得可見,讓小模型透過從大型教師模型蒸餾 (Distillation) 進行訓練成為可能。DeepSeek 已釋出強大的蒸餾變體,展現了此一策略的潛力。

許多資料集鎖定數學、程式碼與科學領域,以發展推理能力。例如 OpenR1、OpenMathReasoning、OpenCodeReasoning 等資料集從 CodeForces、AoPS、StackOverflow 等公共論壇與競賽網站收集問題。

其他工作則著重於小型資料集 (約 1K 樣本) 的人工精選 (Manual Curation),篩選出具挑戰性、高品質的提示詞。DeepMath-103K、OpenR1、Nvidia Nemotron 等專案在資料來源、過濾與擴展等多個階段引入創新。除了 SFT 之外,AceReason 與 Skywork-OR1 等工作則為強化學習方法構建推理資料集。


3. OpenThoughts 專案

OpenThoughts 計畫的目標是透過系統化探索資料策展 (Data Curation) 設計空間,建立 SOTA 的開放推理資料集。專案經由多個迭代演進,從 BespokeStratos-17K 開始,最終以 OpenThoughts3-1.2M 搭配 OpenThinker3-7B 作為集大成之作。

  • OpenThoughts-114K:展示了將 Sky-T1 管線結合 DeepSeek-R1 作為標註者 (Annotator),並加上 LLM 驗證的有效性,涵蓋 89K 數學、20K 程式碼、4K 科學與 1K 益智題目。
  • OpenThoughts2-1M:透過引入新的問題來源 —— 包括 AutoMathText、OpenR1 與 CodeFeedback —— 將規模擴展至 100 萬筆。此資料集表現匹敵或超越 DeepSeek-R1-Distill-32B,在 AIME25 上甚至超越其 6%。
  • OpenThoughts3-1.2M:本文的核心,是 1,000 多次受控實驗的成果,包含 850,000 筆數學、250,000 筆程式碼以及 100,000 筆科學資料。

4. OpenThoughts3 資料管線

Figure 2: OpenThoughts 實驗管線目標是建立最強的推理資料集配方。研究內容包括:(1) 從現有與新生成的資料集取得問題;(2) 從表現最佳的來源中混合問題;(3) 使用 fastText 或 LLM 過濾出高品質問題;(4) 對問題去重並對每題取樣多個答案;(5) 使用 LLM 驗證或多數共識 (Majority Consensus) 過濾低品質答案;(6) 選擇最佳教師模型。

訓練與評估框架

研究團隊以每次實驗 31,600 筆樣本進行系統化消融,這是在 10K 與 100K 之間幾何平均的計算上平衡規模。所有模型皆從 Qwen2.5-7B-Instruct 微調,採用一致的超參數 (Hyperparameters)。

評估基準 (Evaluation Benchmarks) 包括:

  • 數學 (Math):AIME24、AMC23、MATH500
  • 程式碼 (Code):CodeElo、CodeForces、LiveCodeBench
  • 科學 (Science):GPQA Diamond、JEEBench

另外保留評估集 (Held-out Evaluation Set) 用以衡量在管線優化期間未使用的基準上的泛化能力,包括 AIME 2025、HMMT 02/25 等。

4.1 問題來源

研究團隊評估了 27 個程式碼來源、21 個數學來源以及 14 個科學來源,並依據完全合成 (Fully Synthetic)、半合成 (Semi-synthetic)、人工撰寫 (Human-written) 進行分類。結果顯示沒有單一方法明顯佔優 —— 合成與精選方法表現相近。

各領域表現最佳來源:

  • 程式碼:StackExchange-CodeGolf (平均分 25.3)、OpenCodeReasoning (27.5)
  • 數學:OpenMath-2-Math (58.8)、NuminaMath-1.5 (58.5)
  • 科學:OrganicChemistry-PDF (45.3)、StackExchange-Physics (43.2)

問題品質會大幅影響最終效能,最強與最弱程式碼資料集之間在表現上有 17.2 個百分點的差距。

4.2 混合問題

一個關鍵發現是:「在所有資料領域中,混合至多兩個來源產生最佳結果。」 在測試 N∈{1,2,4,8,16} 個來源後發現,混合愈多來源實際上反而會降低效能 —— 使用兩個高品質來源相對於 16 個來源帶來了平均約 5% 的準確度提升。

最終選定來源:

  • 數學:OpenMath-2-Math
  • 程式碼:CodeGolf 與 OpenCodeReasoning
  • 科學:StackExchange-Physics 與 OrganicChemistry-PDFs

4.3 問題過濾

LLM 為基底的過濾方法明顯優於傳統 embedding 或 fastText 方法。兩個策略表現出色:

  • 基於難度的篩選 (Difficulty-based Selection):由 LLM 對問題難度評分,保留較難的問題對程式碼領域最佳。
  • 基於回應長度的篩選 (Response Length Selection):選擇能引發較長模型回應的問題,對數學與科學領域最佳。

當應用 LLM 過濾方法時,相較於隨機過濾基線,平均提升 4-6%。

4.4 去重與多答案取樣

實驗對三種去重水準 (無、模糊 (Fuzzy)、精確 (Exact)) 與三種答案取樣率 (1×、4×、16×) 的組合進行了掃描。一個反直覺的發現浮現:「對每個問題從教師模型取樣多個答案,是有效將資料來源規模擴展至少 16 倍的方法。」

  • 數學與科學:精確去重搭配每題 16× 答案表現最佳。
  • 程式碼:不去重搭配每題 16× 答案表現最佳。

更重要的是,結果顯示當答案多樣性 (Answer Diversity) 顯著提升時,問題多樣性 (Question Diversity) 提供的好處有限。

4.5 答案過濾

對驗證方法進行的廣泛實驗 —— 包括多數共識過濾、LLM 驗證、基於回應長度的篩選 —— 得到一個令人意外的結論:「沒有任何過濾策略能超越使用所有答案的基線。」

隨機過濾微幅優於驗證方法,而以 GPT 為基底的驗證實際上反而降低了效能。因此,研究團隊在最終管線中省略了答案過濾這一步驟。

4.6 教師模型

一個顛覆傳統假設的驚人發現是:「QwQ-32B 是最強的教師模型,儘管它本身是個比 DeepSeek-R1 更弱的模型。」

在所有領域中,QwQ-32B 都產生了更優異的訓練資料 —— 即使它在 CodeElo 上比 DeepSeek-R1 低 9%,在 GPQA Diamond 上低 8%,在 JEEBench 上低 23%。在下游任務上反而帶來 1.9-2.6% 的提升。

這項結果挑戰了「直接以最強的模型作為教師」的常見假設,意味著訓練資料的某些特性 —— 例如推理軌跡的風格、長度或結構 —— 比教師本身的基準分數更為重要。


5. 將管線擴展至 OpenThoughts3-1.2M

Figure 3: 對管線各步驟的最佳策略進行擴展。在不同資料規模下,由連續管線階段所建立的資料集都將擴展曲線 (Scaling Curve) 向上推移。最大收益來自問題來源選擇、問題過濾策略以及教師模型選擇。數學與程式碼的平均效能比科學顯示出更清晰的擴展趨勢。

研究團隊展示,「當我們連續堆疊管線各階段的最佳選擇時,擴展行為 (Scaling Behavior) 也會持續改善。」 從 316 到 31,600 筆樣本之間,效能持續擴展,而最強的提升歸因於問題來源選擇、過濾策略與教師模型的選擇。

為了達到 1.2M 規模,研究團隊從目標領域組成 (850K 數學、250K 程式碼、100K 科學) 反推每個管線階段所需的輸入量。例如,要產生 850K 筆數學樣本,需要先取得 3M 筆原始問題作為起點,再逐步過濾。

Figure 4: OpenThoughts3-1.2M 完整資料管線。資料集起始於從數學、程式碼與科學領域大量取得問題。下一步是過濾這些問題、對數學與科學問題去重、隨機抽樣,並對每題生成多個答案。最終資料集包含 120 萬筆資料。

OpenThinker3-7B 結果 (在 OpenThoughts3-1.2M 上訓練):

基準 (Benchmark) OpenThinker3-7B DeepSeek-R1-Distill-7B 提升
AIME 2025 53.3 38.0 +15.3
LiveCodeBench 06/24-01/25 51.7 34.5 +17.2
GPQA Diamond 53.7 33.2 +20.5

模型在 7B 規模於開放資料條件下,跨多個領域達到 SOTA,並對保留基準展現出強大的泛化能力。

Figure 5: OpenThoughts2-1M 資料配方。OpenThoughts2-1M 在 OpenThoughts-114K 基礎上加入新的問題生成策略而獲得改進。包含現有資料集 (例如 OpenR1 和 CodeFeedback) 以及自製生成資料集 (例如 AutoMathText)。結合去重後產生 100 萬規模的資料集。

5.1 補充分析

汙染去除 (Decontamination) 結果:在 6,092 筆樣本上的去汙染流程混淆矩陣顯示分類器召回率 99.6%(3080/3092 真汙染樣本被正確識別),假陽性率僅 1.4%(42/3000)。這表示去汙染流程在保留真實乾淨資料的同時,能可靠地過濾掉與評估基準重疊的問題。

Figure 6: 去汙染分類器於 6,092 筆樣本上的混淆矩陣。「真汙染」中 3080 個被正確識別、12 個漏掉;「真乾淨」中 2958 個被保留、42 個誤判

跨基準的擴展曲線:OpenThoughts3 在 12 個推理基準(AIME24/AIME25/AMC23/MATH500/HMMT、LCB 兩個窗口、CodeElo/CodeForces、GPQA Diamond、JEEBench、HLE MCQ)的擴展曲線一致優於 AM、Nemotron Nano、s1.1、LIMO 與 Qwen-2.5-7B-Instruct 基線。除了 HLE MCQ(人類最後考試 MCQ 子集,所有方法都接近 0)以外,OpenThoughts3 在所有基準上於 1M 規模都領先。

Figure 7: OpenThoughts3 在 12 個推理基準上的擴展曲線,全面優於同規模的 AM、Nemotron Nano、s1.1、LIMO 等資料集

領域聚合分析:將 12 個基準聚合為 Math、Code、Science 三個領域平均,OpenThoughts3 在所有領域都一致超越基線。Math 領域差距最大;Code 與 Science 也有顯著但較小的提升。

Figure 8: 三個領域聚合(Math/Code/Science)下 OpenThoughts3 對其他資料集的擴展曲線比較

Thinking Token 預算的影響:在 AIME 24/25 上以不同思考長度評估 OpenThinker3-7B。增加思考 token 從 1,024 到 ~63K,準確率從 ~17% 上升至 ~51%,呈現強烈的測試時運算(test-time compute)擴展曲線。

Figure 9: Thinking token 數量對 AIME 24/25 準確率的影響:從 1,024 token 到 ~63K token,準確率從 ~17% 線性上升至 ~51%


6. 結論

透過 1,000 多次消融實驗的系統化研究,研究團隊得到五個重塑資料策展實踐的關鍵見解:

  1. 對每個問題取樣多個答案能讓資料集擴展 16×,並帶來效能提升。
  2. 較強的基準效能並不保證更佳的教學能力 (Teaching Capability)。
  3. 答案過濾雖然直觀上看似合理,但實際提供的收益微乎其微。
  4. 1-2 個來源的品質集中性,優於 8-16 個來源的多樣性。
  5. 基於 LLM 難度與回應長度的過濾方法,超越了 embedding/fastText 方法。

承認的限制 (Acknowledged Limitations):本工作專注於監督式微調,未探索強化學習、課程學習 (Curriculum Learning) 或階段式訓練 (Staged Training)。團隊選擇能最大化整體平均效能的策略,而非針對特定領域最佳化,這假設了跨領域遷移 (Cross-domain Transfer) 的存在 —— 此假設值得進一步驗證。

開放研究方向 (Open Research Directions) 包括:

  • 跨領域遷移的動態
  • 學生模型 (Student Model) 效能是否最終會超越教師模型 (Surpassing the Teacher)
  • 問題與答案多樣性的交互作用如何隨領域、規模、模型大小而變

所有模型、資料集、程式碼與補充資料皆透過 Hugging Face 與 GitHub 在 openthoughts.ai 上釋出。


參考文獻

References preserved in original English. For the complete bibliography, please refer to the original paper at https://arxiv.org/abs/2506.04178v2.

Key works referenced include:

  • DeepSeek-R1 and DeepSeek-R1-Distill series
  • QwQ-32B (Qwen team)
  • Sky-T1
  • s1, s1.1, LIMO
  • OpenR1, OpenMathReasoning, OpenCodeReasoning
  • AutoMathText, NuminaMath-1.5, OpenMath-2-Math
  • DeepMath-103K, Nvidia Nemotron Nano, AM
  • AceReason, Skywork-OR1
  • Benchmarks: AIME 2024/2025, AMC23, MATH500, GPQA Diamond, JEEBench, HMMT, LiveCodeBench, CodeElo, CodeForces

術語對照表

English 繁體中文
Reasoning Model 推理模型
Data Recipe 資料配方
Data Curation 資料策展
Data Generation Pipeline 資料生成管線
Supervised Fine-tuning (SFT) 監督式微調
Reinforcement Learning (RL) 強化學習
Post-training 後訓練
Base Model 基礎模型
Frontier Model 前沿模型
Teacher Model 教師模型
Student Model 學生模型
Distillation 蒸餾
Annotator 標註者
Long Reasoning Trace 長推理軌跡
Question Sourcing 問題來源
Synthetic 合成的
Semi-synthetic 半合成的
Human-written 人工撰寫
Mixing Questions 混合問題
Question Filtering 問題過濾
Difficulty-based Selection 基於難度的篩選
Response Length Selection 基於回應長度的篩選
Embedding 嵌入向量
Deduplication 去重
Fuzzy Deduplication 模糊去重
Exact Deduplication 精確去重
Multiple Answer Sampling 多答案取樣
Answer Filtering 答案過濾
Verification 驗證
Majority Consensus 多數共識
Hyperparameters 超參數
Ablation Study 消融研究
Held-out Evaluation Set 保留評估集
Evaluation Benchmark 評估基準
State-of-the-art (SOTA) 最先進
Cross-domain Transfer 跨領域遷移
Curriculum Learning 課程學習
Staged Training 階段式訓練
Scaling Curve 擴展曲線
Scaling Behavior 擴展行為
Open-Source Dataset 開源資料集
Manual Curation 人工精選
Teaching Capability 教學能力
Question Diversity 問題多樣性
Answer Diversity 答案多樣性
Surpassing the Teacher 超越教師
← 回到列表
已複製連結