DataComp-LM:探索下一代語言模型訓練集

原始論文:DataComp-LM: In search of the next generation of training sets for language models 作者:Jeffrey Li, Alex Fang, et al. arXiv ID:2406.11794v4 日期:2025-04-21 標籤:LLM Pretraining Data Benchmark Open Dataset Data Curation Common Crawl

目錄

摘要

我們提出 DataComp for Language Models (DCLM),這是一個用於受控資料集實驗 (Controlled Dataset Experiments) 的測試平臺,旨在改進語言模型 (Language Models)。作為 DCLM 的一部分,我們提供了一個從 Common Crawl 抽取出來、規模達 240 兆 (trillion) tokens 的標準化語料庫,基於 OpenLM 的有效預訓練 (Pretraining) 配方,以及 53 個下游評估任務 (Downstream Evaluations) 的完整套件。參與 DCLM 基準測試的研究者可以在從 412M 到 7B 參數的多種模型規模下,實驗各種資料策展 (Data Curation) 策略,例如去重 (Deduplication)、過濾 (Filtering) 與資料混合 (Data Mixing)。

我們以 DCLM 為基礎進行的實驗顯示,基於模型的過濾 (Model-Based Filtering) 是組成高品質訓練集的關鍵。所得到的資料集 DCLM-baseline 使我們能夠從零開始訓練一個 7B 參數的語言模型,僅用 2.6T 訓練 tokens 就達到 64% 5-shot MMLU 準確度。相較於 MAP-Neo(先前公開資料訓練語言模型的最先進水準),DCLM-baseline 在 MMLU 上取得了 6.6 個百分點的改進,且訓練使用的計算資源減少 40%。我們的基線模型在 MMLU 上的表現也與 Mistral-7B-v0.3 和 Llama 3 8B 相當(分別為 63%、66%),並在 53 個自然語言理解任務的平均上取得類似表現,但所需訓練計算量為 Llama 3 8B 的 1/6.6。我們的結果突顯了資料集設計對於訓練語言模型的重要性,並為進一步的資料策展研究提供了起點。

Figure 1: DCLM-baseline 與其他公開/封閉模型的效能比較。左圖:Core 任務準確度 vs. 計算量。右圖:MMLU 5-shot 準確度 vs. 計算量。DCLM-baseline 在計算效率上明顯領先其他開放資料訓練的模型,並逼近 Llama 3 8B 與 Mistral 等封閉資料模型。


1. 引言

過去數年中,語言模型的訓練資料集 (Training Datasets) 規模快速擴張,從早期的 C4 (160B tokens)、The Pile (300B tokens) 一路成長到 RefinedWeb (600B)、Dolma (3T)、FineWeb (15T) 和 RedPajama-v2 (30T)。然而,社群在「什麼樣的資料策展策略最有效」這個問題上仍然缺乏共識。我們識別出兩個阻礙進展的核心挑戰:

(1) 缺乏受控比較。 不同的訓練集提案經常使用不同的模型架構、計算預算與超參數 (Hyperparameter) 設定,使得效能差異是來自資料品質還是其他因素變得難以判斷。這種混淆讓「哪些資料策展策略最佳」變得撲朔迷離。

(2) 訓練資料的透明度不足。 Llama、Mistral、Gemma 等主流模型的訓練集細節仍是專有的 (proprietary),公開文件僅提供「粗略描述」。整個領域對於什麼構成最先進 (state-of-the-art) 的資料集仍處於不確定狀態。

DCLM 解決這些問題的方式是建立一個基準測試 (Benchmark):參與者提出資料集,並使用固定的訓練配方訓練模型。圖 2 顯示工作流程:參與者選擇規模 (scale)、過濾/混合資料、用標準化程式碼訓練模型,並在 53 個下游任務上評估結果。

Figure 2: DCLM 工作流程示意圖。(A) 選擇計算規模;(B) 透過過濾或混合策展資料;(C) 使用標準化程式碼訓練模型;(D) 在 53 個下游任務上評估資料集品質。

主要貢獻

  • DCLM-Pool:目前最大的公開語料庫,從 Common Crawl (200B 文件、壓縮後 370TB) 抽取出 240 兆 GPT-NeoX tokens。我們使用 resiliparse 重新抽取文字,而非直接使用 Common Crawl 預先抽取的 WET 檔案。
  • 多規模設計:五個競賽規模 (competition scales),計算量範圍跨越約 600×(從 400M 到 7B 參數,搭配 Chinchilla 倍數)。圖 3 顯示小規模與大規模的排名相關性 (rank correlation) 很高,意味著實驗結論可在不同計算預算間轉移。
  • 完整基線:透過 416 次實驗,我們確認模型基於過濾是資料品質的關鍵。DCLM-baseline 將多種技術組合成單一的高效資料集。

Figure 3: 不同規模間的排名相關性。橫軸為小規模 (400M、1B、3B) 之分數,縱軸為 7B-1x 規模分數,呈現高度相關 (Pearson r = 0.838、0.956、0.982),驗證多規模設計的可轉移性。


2. 相關工作

語言模型的資料策展

過往工作涵蓋語言過濾、啟發式規則 (Heuristic Rules)、去重以及資料混合等多種策略。然而,先前研究只比較了「有限的過濾子集」,我們的工作則進行了「公開規模最大的資料策展調查」。後續工作如 WebOrganizer、Nemotron-CC 和 Olmo-2 也以本基準測試或我們的策展策略為基礎。

開源資料集

公開資料集隨著模型成長而擴張:早期的 C4 (160B tokens)、The Pile (300B);近期的 RefinedWeb (600B)、Dolma (3T)、FineWeb (15T)、RedPajama-v2 (30T)。我們將 DCLM-Pool 定位為「目前最大的原始文字資料池,包含 240T 網路爬取 tokens」,且 DCLM-baseline 「比先前資料集產出更佳的模型」。

以資料為中心的基準測試

先前以資料為中心的基準測試 (Data-Centric Benchmark) 包括:視覺領域的 DataComp 與 DataPerf、用於微調 (fine-tuning) 資料清理與混合的 Data-Juicer、以及聚焦於 125M-220M 參數模型的 BabyLM 挑戰賽。我們強調,DCLM 以 240T tokens 與 7B 模型,是「目前語言模型上規模最大的以資料為中心的基準測試」。


3. DCLM 基準測試

3.1 DCLM-Pool

DCLM-Pool 是 240 兆 GPT-NeoX tokens 的語料庫,從 2023 年以前的 Common Crawl 資料抽取而來,包含 200B 文件 (壓縮後 370TB)。我們不直接使用 Common Crawl 預先抽取的 WET 檔案,而是用 resiliparse 重新從 HTML 抽取文字以提升品質。

3.2 競賽規模 (Competition Scales)

我們提供五個競賽規模,跨越約 600× 的計算量。這允許不同預算的研究者進行有意義的實驗。

Table 1: DCLM 競賽規模

規模 模型參數 訓練 tokens 訓練 FLOPs 訓練 H100 時數 Pool 大小
400M-1x 412M 8.2B 2.0e19 26 469B
1B-1x 1.4B 28.8B 2.4e20 240 1.64T
3B-1x 2.8B 55.9B 9.4e20 740 3.18T
7B-1x 6.9B 138B 5.7e21 3,700 7.85T
7B-2x 6.9B 276B 1.1e22 7,300 15.7T

3.3 跨規模可轉移性

一個關鍵的設計考量是:在小規模上表現較佳的策展方法是否能轉移到大模型?我們的分析顯示跨規模有強烈的排名相關性 (Pearson r = 0.838、0.956、0.982,分別為 400M、1B、3B 對 7B-1x 的比較)。這驗證了多規模設計的有效性,使計算資源有限的研究者能在小規模上迭代,並合理預期結果可轉移至更大部署。

3.4 兩個賽道

  • 過濾賽道 (Filtering Track):參與者從規模對應的 DCLM-Pool 子集挑選最佳資料。
  • 混合賽道 (Mixing Track):參與者可納入 Common Crawl 以外的外部來源。

3.5 評估任務

DCLM 包含 53 個下游評估任務,分為三個指標:

  • Core 中心化準確度 (Core Centered Accuracy):22 個任務的子集 (例如 HellaSwag、ARC-E),在小規模即有低變異訊號。
  • MMLU 5-shot 準確度:廣泛使用的基準。
  • Extended 中心化準確度 (Extended Centered Accuracy):所有 53 個任務的中心化效能平均。

評估框架基於 LLM-Foundry,涵蓋從問答到開放式生成的多種格式,跨越數學、教科書知識和常識推理等多元領域。


4. 訓練與評估設定

4.1 OpenLM 訓練框架

我們使用 OpenLM 框架,採用解碼器專用 Transformer (Decoder-Only Transformer) 架構 (類似 GPT-2、Llama),並以 GPT-NeoX 作為主要 tokenizer。訓練 token 數依 Chinchilla 倍數配置 (典型為 20× 模型參數 × Chinchilla 倍數)。

4.2 文字抽取方法比較

我們在 1B-1x 規模上系統性地比較了三種對 Common Crawl HTML 的文字抽取方法:

抽取方法 Core 分數 Extended 分數
resiliparse 24.1 13.4
trafilatura 24.5 12.5
WET 檔 20.7 12.2

雖然 trafilatura 略勝一籌,但 resiliparse 速度快 8×,更適合大規模處理。因此 DCLM-Pool 採用 resiliparse。

4.3 去重 (Deduplication)

我們評估兩種主要去重策略:MinHash 結合 suffix array 的管線,以及為近似重複偵測 (Near-Duplicate Detection) 修改的 Bloom 過濾。結果顯示「兩者下游效能可比較:在 7B-2x 規模上 Core 差距在 0.2 個百分點以內」。然而 Bloom 過濾在處理超過 10TB 資料集時擴展性較佳,因此被選為 DCLM-baseline 的方法。

Figure 4: 不同資料策展策略在 1B-1x 規模上的比較,包括啟發式過濾、模型基於過濾、語意去重等。模型基於過濾 (尤其 fastText 分類器) 在 Core 與 Extended 上明顯領先。


5. 建構高品質訓練集

5.1 啟發式過濾 (Heuristic Filtering)

我們以 RefinedWeb 的管線作為基線,包含 Common Crawl 文字抽取、啟發式選擇規則 (例如移除垃圾內容)、以及重複內容的去重。

5.2 模型基於過濾的比較

廣泛實驗確認模型基於過濾是資料集品質的關鍵。我們在 1B-1x 規模上比較七種過濾方法:

過濾方法 Core Extended
RefinedWeb baseline 27.5 14.6
PageRank 過濾 26.1 12.9
語意去重 (Semantic Deduplication) 27.1 13.8
BGE 特徵分類器 27.2 14.0
AskLLM 28.6 14.3
Perplexity 過濾 29.0 15.0
Top-k 平均 logits 29.2 14.7
fastText (OH-2.5+ELI5) 30.2 15.4

以 OpenHermes 2.5 與 ELI5 subreddit 資料訓練的 fastText 分類器明顯勝出。

5.3 fastText 分類器消融研究

我們進一步在 7B-1x 規模研究訓練資料組成與閾值對分類器效能的影響:

訓練資料 閾值 Core MMLU
OH-2.5+ELI5 10% 41.0 29.2
Wikipedia 10% 35.7 27.0
OpenWebText2 10% 34.7 25.0
GPT-3 近似 10% 37.5 24.4
OH-2.5+ELI5 15% 39.8 27.2
OH-2.5+ELI5 20% 38.7 24.2

指令格式 (Instruction-Formatted) 訓練資料相較於 Wikipedia 等更傳統的選擇,在 Core 上提升 3.5 個百分點。嚴格的 top-10% 過濾閾值最佳。

Figure 5: fastText 分類器在不同訓練資料源與閾值下的效能。OH-2.5+ELI5 + 10% 閾值組合勝出。

5.4 資料混合分析

當把過濾後的 Common Crawl 與外部高品質來源 (Wikipedia、StackExchange、arXiv、GitHub,按 33% 比例混合) 結合時,得到了一個值得注意的發現:雖然混合可改善低品質的 Common Crawl 子集,但對 DCLM-baseline 而言「平均反而傷害效能」。這暗示在基底過濾品質已經夠高時,來源多樣化的邊際效益遞減 (Diminishing Returns)。

Figure 6: 不同基線資料集加入混合來源後的效能變化。對品質較差的基線 (如 C4) 混合有助於效能;對 DCLM-baseline 而言混合反而下降。

5.5 去汙染驗證 (Decontamination)

我們評估訓練資料與評估基準間的重疊。針對 MMLU 與 HellaSwag,移除偵測到的測試樣本後重新訓練模型,結果「效能並未下降」,反而略有提升:

  • MMLU 移除汙染後:52.7%(vs. 基線 51.8%)
  • HellaSwag 移除汙染後:78.4%(vs. 基線 77.9%)

這證實基準測試上的提升並非資料洩漏 (Data Leakage) 的偽影 (artifact)。


6. DCLM-baseline 的擴展

成功策展的 DCLM-baseline (3.8 兆 tokens) 透過結合領域特定資源 (Domain-Specific Resources) 擴展至更大模型。我們訓練了一個 7B 參數模型,使用 2.6 兆 tokens 並結合 StarCoder 與 ProofPile2,達到競爭力結果:

模型 參數 tokens Core MMLU Extended
DCLM-baseline (僅 baseline) 7B 0.28T – 50.8 –
DCLM-baseline + StarCoder + ProofPile2 7B 2.6T 57.1 63.7 45.4
Llama 3 8B 8B 15T 57.6 66.2 46.3
Mistral-0.3 7B 未知 57.0 62.7 45.1

DCLM 模型在公開訓練集訓練的 7B 模型中表現最佳,且使用的計算量比封閉源競爭者大幅減少,證明系統性的資料策展可部分補償計算資源。

Figure 7: DCLM-baseline 在 7B 規模上的擴展曲線,比較 Core 與 MMLU 隨 token 預算的變化。

指令微調 (Instruction Tuning)

DCLM-baseline 7B 在指令微調後達成 AlpacaEval2.0 LC Win-rate 16.6,超越 Gemma-Instruct (10.4),逼近 Mistral-v0.2-7B (17.1) 與 Llama3-Instruct (22.9)。


7. 與其他資料集和模型的比較

7.1 7-8B 模型總比較

DCLM-baseline 在公開資料訓練的同等規模模型中達到最先進水準:

  • MMLU 5-shot:DCLM-baseline 7B (63.7%) vs. MAP-Neo 7B (57.1%) — 提升 6.6pp,計算量減 40%
  • 與封閉資料模型對比:Llama 3 8B (66.2%, 15T tokens)、Gemma 8B (64.3%, 6T)、Mistral-0.3 (62.7%)
  • DCLM-baseline 7B 使用的計算量為 Llama 3 8B 的 1/6.6

Figure 8: 7B 規模下 DCLM-baseline 與 OLMo、MPT、Falcon、Mistral、Llama、Gemma 等模型在 Core、MMLU、Extended 三軸上的全面對比。

Figure 9: 跨多個下游任務 (HellaSwag、ARC-C、Winogrande、MMLU 等) 的逐項比較矩陣。

7.2 與其他開源資料集的比較

在相同的 OpenLM + 7B-1x 控制設定下,DCLM-baseline 顯著優於 RefinedWeb、Dolma、FineWeb、RedPajama-v2 等:

  • 同樣的 138B token 預算下,DCLM-baseline Core 與 MMLU 均勝過上述資料集 4-8 個百分點。
  • 結果表明資料策展的差異而非規模本身才是 DCLM 領先的主因。

Figure 10: DCLM-baseline 與其他開源資料集 (RefinedWeb, Dolma, FineWeb, RedPajama-v2 等) 在控制設定下的 Core/MMLU 比較。

Figure 11: DCLM-Pool 處理管線的資料量縮減視覺化,從 240T 原始 tokens 經過抽取、去重、模型過濾後得到 3.8T DCLM-baseline。


8. 限制與更廣泛的影響

限制

  • 由於計算資源限制,多數設計維度只能個別消融 (ablate individually),缺乏 run-to-run 變異 (run-to-run variation) 的充分探索。
  • 在 DCLM-baseline 上訓練的模型「在程式碼 (code) 與數學 (math) 上表現不如語言理解任務」,這視為對語言理解的聚焦選擇而非方法本身的限制。
  • DCLM-Pool 僅源自 Common Crawl 與英文資料;其他來源 (例如 PDF、書籍) 與多語言情境留待未來工作。

更廣泛的影響 (Broader Impacts)

  • 公開大型資料集可能引入偏見 (bias) 與有害內容 (toxic content)。我們釋出 DCLM-baseline 時提供有毒內容過濾結果與個人資訊偵測,並建議下游使用者考慮應用情境的合適性。
  • 標準化基準測試可能讓研究者過度針對特定指標進行最佳化 (Overfitting to Metrics)。我們鼓勵社群提案新評估,並在 53 個任務外進一步擴張評測。

9. 結論

DCLM 提供了第一個大規模、受控的語言模型資料策展基準測試。透過 240T 原始 tokens 池、五個競賽規模與 53 個評估任務,我們執行了 416 次受控實驗,並萃取出 DCLM-baseline——一個 3.8T token 的高品質資料集。基於 DCLM-baseline 訓練的 7B 模型僅用 2.6T tokens 即達到 64% MMLU,與 Llama 3 8B 相當,但計算量減少 6.6×。這些結果突顯資料品質對於現代 LLM 訓練的關鍵地位,並為下一代訓練集的探索奠定基礎。我們公開所有資料、訓練程式碼與評估管線,邀請社群在 DCLM 上提出新的策展策略。


參考文獻

References are kept in the original English. Please refer to the original paper at https://arxiv.org/abs/2406.11794v4 for the full list of citations including but not limited to:

  • Brown et al., "Language Models are Few-Shot Learners," NeurIPS 2020.
  • Touvron et al., "Llama 2: Open Foundation and Fine-Tuned Chat Models," 2023.
  • Penedo et al., "The RefinedWeb Dataset for Falcon LLM," 2023.
  • Soldaini et al., "Dolma: An Open Corpus of Three Trillion Tokens for Language Model Pretraining Research," 2024.
  • Computer (Together), "RedPajama: An Open Dataset for Training Large Language Models," 2023.
  • Penedo et al., "FineWeb: decanting the web for the finest text data at scale," 2024.
  • Hoffmann et al., "Training Compute-Optimal Large Language Models" (Chinchilla), 2022.
  • Raffel et al., "Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer" (T5/C4), JMLR 2020.
  • Gao et al., "The Pile: An 800GB Dataset of Diverse Text for Language Modeling," 2020.
  • Hendrycks et al., "Measuring Massive Multitask Language Understanding" (MMLU), ICLR 2021.
  • Zellers et al., "HellaSwag: Can a Machine Really Finish Your Sentence?" ACL 2019.
  • Joulin et al., "Bag of Tricks for Efficient Text Classification" (fastText), 2016.
  • Lee et al., "Deduplicating Training Data Makes Language Models Better," 2022.
  • Gadre et al., "DataComp: In search of the next generation of multimodal datasets," NeurIPS 2023.

術語對照表

英文 中文
Language Model 語言模型
Pretraining 預訓練
Training Set / Dataset 訓練集/資料集
Data Curation 資料策展
Controlled Dataset Experiments 受控資料集實驗
Benchmark 基準測試
Common Crawl Common Crawl (網路爬取資料來源,保留原名)
Token token (保留原文)
Deduplication 去重
Filtering 過濾
Data Mixing 資料混合
Model-Based Filtering 基於模型的過濾
Heuristic Rules 啟發式規則
Heuristic Filtering 啟發式過濾
Near-Duplicate Detection 近似重複偵測
Bloom Filter Bloom 過濾器
MinHash MinHash (保留原文)
Suffix Array 後綴陣列
Decoder-Only Transformer 解碼器專用 Transformer
Hyperparameter 超參數
Downstream Evaluations 下游評估
Downstream Task 下游任務
Few-shot / 5-shot 少樣本/5 樣本
Centered Accuracy 中心化準確度
Rank Correlation 排名相關性
Pearson's r Pearson 相關係數
Chinchilla Multiplier Chinchilla 倍數
FLOPs 浮點運算次數
State-of-the-Art 最先進
Proprietary 專有的
Open-Source 開源
Decontamination 去汙染
Data Leakage 資料洩漏
Artifact 偽影/人為偽差
Diminishing Returns 邊際效益遞減
Instruction Tuning 指令微調
Instruction-Formatted 指令格式
Fine-tuning 微調
Data-Centric Benchmark 以資料為中心的基準測試
Domain-Specific Resources 領域特定資源
Bias 偏見
Toxic Content 有害內容
Overfitting to Metrics 對特定指標過度最佳化
Run-to-Run Variation 多次執行間變異
Ablate 消融
Competition Scale 競賽規模
Filtering Track 過濾賽道
Mixing Track 混合賽道
← 回到列表
已複製連結