Olmo 3

Olmo 3:完全開放的語言模型家族

原始論文:Olmo 3 作者:Olmo 團隊(Allen Institute for AI 與多個合作機構,包含 University of Washington、Carnegie Mellon University、Stanford、Mila、Princeton、MIT、UMD 等;通訊作者 Hannaneh Hajishirzi) arXiv ID:2512.13961v1 日期:2025-12

目錄

摘要

我們推出 Olmo 3,這是一個在 7B 與 32B 參數規模上、達到最先進 (State-of-the-Art, SOTA) 水準的完全開放 (fully-open) 語言模型 (Language Model, LM) 家族。它建構了所謂的「模型流程 (model flow)」:一條可由社群檢視、修改與分支的端到端訓練軌跡,涵蓋資料、檢查點 (checkpoints)、訓練程式碼,以及將原始文本變為 Olmo 3 Base、Olmo 3 Instruct、Olmo 3 Think 與 Olmo 3 RL-Zero 等四種變體所需的全部後訓練 (post-training) 元件。

  • Olmo 3 Base 是目前最強的完全開放基礎模型 (fully-open base model):它超越了 Marin、Apertus 與 SmolLM 3,並可與 Qwen 2.5 與 Gemma 3 匹敵;同時在程式碼、數學、長上下文 (long-context) 推理與閱讀理解等領域具備強大表現。
  • Olmo 3 Think (32B) 是目前最強的完全開放思考模型 (fully-open thinking model):它與該規模下最頂尖的開放權重 (open-weights) 模型差距很小,並以遠少於對手的訓練 token 數達到此成果。
  • Olmo 3 Instruct 在指令遵循 (instruction following)、聊天 (chat) 與工具使用 (tool use) 上超越了 Qwen 2.5、Gemma 3 與 Llama 3.1 等同等規模的開放權重模型。
  • Olmo 3 RL-Zero 提供了完整且完全開放的純 RL 後訓練流程,可從任意基礎模型出發開展研究,並提供四套針對數學、程式碼、指令遵循與一般聊天的領域專屬 RL 套件。

我們釋出了包含預訓練 (pretraining)、中段訓練 (midtraining)、長上下文擴充以及全部後訓練的所有資料集、程式碼與檢查點,使研究者能夠在訓練流程的任何階段檢視、改寫或分支模型。Olmo 3 不只是一組強大的模型,更是一條可以被世界改寫的軌跡。


一、引言

過去兩年間,語言模型 (Language Models, LMs) 的能力與規模都飛速提升。然而,這些進展大多被封閉在無法被外界檢視的訓練流程之後:開放權重 (open-weights) 模型只發布最終權重,閉源模型甚至連權重也沒有。對研究者、學生與獨立開發者而言,這意味著「為什麼模型會這樣表現?哪一個訓練選擇造成了哪一個結果?」這類核心問題無從回答。

Olmo 3 正是為了打破這個壁壘而存在。我們不只發布最終權重,而是發布一條完整、可分支的模型流程 (model flow):

  1. 資料:5.9 兆 (Trillion) token 的預訓練語料庫 Dolma 3 Mix;100B 的中段訓練 Dolmino Mix;以及 50B/100B 的長上下文 Longmino Mix。後訓練則由 Dolci 資料家族(Dolci Think SFT/DPO/RL、Dolci Instruct、Dolci RL-Zero)構成。
  2. 檢查點 (Checkpoints):模型在每個訓練階段(預訓練、中段訓練、長上下文、SFT、DPO、RL)的中間檢查點都會釋出,可供任何人從中接續分支訓練。
  3. 程式碼:包含預訓練框架 OLMo-core、後訓練框架 Open Instruct、資料處理工具 datamap-rs 與 duplodocus、評估套件 OLMES,以及去汙染 (decontamination) 工具 decon。
  4. 全部後訓練元件:將任何 Olmo 3 Base 變成 Instruct、Think 或 RL-Zero 的所有指令、回應、偏好對 (preference pairs) 與獎勵設計。

Figure 1:Olmo 3 的模型流程示意圖

圖 1(說明): Olmo 3 模型流程示意圖。從 Dolma 3 Mix 預訓練語料出發,依序經過中段訓練 (Midtraining) 與長上下文擴充 (Long-context Extension),產生 Olmo 3 Base;接著透過 SFT、DPO 與 RLVR 三階段的後訓練,分別衍生出 Olmo 3 Think、Olmo 3 Instruct 與 Olmo 3 RL-Zero 變體。每一個圓圈都是一個釋出的檢查點 (checkpoint),每一條箭頭都是一段被釋出的程式碼與資料。

我們的核心訊息是:Olmo 3 不只是一組權重,而是一條軌跡。 你可以從預訓練後接續長上下文訓練;可以從中段訓練檢查點分叉做你的領域特化;也可以從 Olmo 3 Base 直接開始你自己的後訓練流程。每一個檢查點都是可分支的起點。

在這份報告中,Olmo 3.1 Think 32B 是當前最強的完全開放思考模型;它在 MATH、AIME、HumanEvalPlus、IFEval 等多項基準上接近 Qwen 3 32B 與 DeepSeek-R1-Distill-Qwen-32B,而我們僅使用了對手約一半的訓練 token 數。


二、模型流程概覽

Olmo 3 是一條端到端的訓練軌跡。本節依序描述基礎模型訓練、後訓練流程,以及最終結果與訓練成本。

2.1 基礎模型訓練

基礎模型訓練 (Base Model Training) 由三個階段組成:

  1. 預訓練 (Pretraining):使用 5.9T token 的 Dolma 3 Mix,於 8192 token 序列上進行訓練。資料來源以 Common Crawl 為主(76.1%),加上我們新建的 olmOCR 科學 PDF 資料集 (13.6%)、StarCoder 程式碼、StackExchange 問答、維基百科等。
  2. 中段訓練 (Midtraining):100B token 的 Dolma 3 Dolmino Mix,重點補強數學、程式碼、問答 (QA)、推理 (thinking) 與指令合成資料。在這個階段我們導入了雙階段 (microanneal + integration test) 的方法論,可以分別測試單一資料子集以及它們在完整混合中的相互作用。
  3. 長上下文擴充 (Long-context Extension):50B–100B token 的 Dolma 3 Longmino Mix,將上下文窗從 8192 擴展到 65536;技術上使用 YaRN (Yet another RoPE extensioN) 對 Rotary Position Embedding (RoPE) 進行外推,並僅對全注意力 (full attention) 層套用、避免影響滑動視窗注意力 (Sliding Window Attention, SWA) 層。

2.2 後訓練流程

後訓練 (Post-training) 將 Olmo 3 Base 轉換為三類變體:Think(具備「思考」軌跡的推理模型)、Instruct(指令與工具使用模型)、RL-Zero(純 RL 後訓練流程示範)。流程主軸為:

  • 監督式微調 (Supervised Fine-Tuning, SFT):使用 Dolci Think SFT 或 Dolci Instruct SFT 等資料集對基礎模型進行第一階段微調。我們將 SFT 程式碼從 Open Instruct 移植到 OLMo-core,獲得約 8 倍的吞吐量加速。
  • 偏好調校 (Preference Tuning):使用 Direct Preference Optimization (DPO) 並導入 Delta Learning 策略——同一個提示用一個強模型 (Qwen3 32B) 與一個弱模型 (Qwen3 0.6B) 各產生一個回應作為偏好對 (preference pair)。
  • 強化學習 (Reinforcement Learning, RL):以我們自研的 OlmoRL 框架進行可驗證獎勵 (verifiable rewards) 的 RL,基礎演算法為 GRPO,並融入 DAPO 的多項改進,包括零梯度過濾、主動取樣 (active sampling)、token 級 loss、移除 KL 懲罰、不對稱裁切 (clip-higher)、截斷重要度取樣 (truncated importance sampling),以及取消 std 正規化。

2.3 結果

表 1(說明): Olmo 3.1 Think 32B 與其他主要開放/半開放推理模型(Qwen 3 32B、DeepSeek-R1-Distill-Qwen-32B、QwQ-32B、s1.1-32B 等)在數學 (MATH、AIME)、程式碼 (HumanEvalPlus、MBPPPlus、LiveCodeBench)、推理 (BBH、GPQA、ZebraLogic) 與指令遵循 (IFEval) 上的對照。Olmo 3.1 Think 32B 在多數基準上與封閉開源模型差距控制在數個百分點之內,並在部分推理任務上超越同級對手。

關鍵觀察:

  • Olmo 3.1 Think 32B 是當前最強的完全開放思考模型;
  • Olmo 3 Base 32B 是當前最強的完全開放基礎模型,並可與 Qwen 2.5 32B、Gemma 3 27B 等開放權重模型匹敵;
  • Olmo 3 Instruct 7B/32B 在指令遵循、聊天、工具使用上超越同規模 Qwen 2.5、Gemma 3、Llama 3.1。

2.4 訓練成本

訓練 Olmo 3.1 Think 32B 的整段流程在 1024 張 NVIDIA H100 GPU 上耗時約 56 天,依市場價約 2.75M 美元。我們相信這個成本與封閉模型相比具有極佳的性價比,特別是考量到我們同時釋出了所有資料、程式碼與中間檢查點。


三、Olmo 3 Base

3.1 主要結果

表 2(說明): 32B 規模對照表。Olmo 3 Base 32B 與 Marin 32B、Apertus 70B、Qwen 2.5 32B、Gemma 3 27B 在 OlmoBaseEval 的 43 項任務上的對照結果。Olmo 3 Base 32B 是當前最強的完全開放基礎模型,並在多項程式碼與長上下文任務上達到或超越 Qwen 2.5 32B。

表 3(說明): 7B 規模對照表。Olmo 3 Base 7B 與 SmolLM 3、Llama 3.1 8B、Mistral 7B、Qwen 2.5 7B、Gemma 3 7B 對照。Olmo 3 Base 7B 全面超越 SmolLM 3,並可與 Qwen 2.5 7B、Gemma 3 7B 等開放權重模型匹敵。

3.2 模型架構

Olmo 3 Base 是僅解碼器 (decoder-only) Transformer,採用下列關鍵設計:

  • 滑動視窗注意力 (SWA):4096 token 視窗,4 層中有 3 層為 SWA、1 層為全注意力。這在不犧牲長上下文能力的前提下大幅降低 KV 快取與計算量。
  • 預訓練上下文:8192 token;後續透過 YaRN 擴充至 65536 token。
  • 位置編碼:Rotary Position Embedding (RoPE),base frequency 500000。
  • 訓練框架:自研的 OLMo-core,在 H100 上對 7B 模型可達 7700 token/sec/GPU,對 32B 模型可達 1960 token/sec/GPU 的吞吐量。

3.3 實驗設計

我們建立了 OlmoBaseEval——一套涵蓋 43 項基準的基礎模型評估套件。設計上強調:

  • 聚類分析 (clustering analysis):將任務分為知識、推理、程式碼、數學、長上下文等群組,避免單一任務主導排名;
  • 縮放分析 (scaling analysis):在多個模型尺寸(150M、530M、1.4B、7B)上觀察分數隨 token 數的單調性;
  • 訊噪比 (Signal-to-Noise Ratio, SNR) 分析:剔除噪音過大的基準項目,只保留可靠地反映模型差異的任務。

3.4 預訓練

預訓練資料 Dolma 3 Mix 共 5.9T token。組成大致如下:

  • Common Crawl 網頁資料:76.1%(經過 datamap-rs 的多階段品質過濾);
  • olmOCR 科學 PDF:13.6%(由我們新訓練的 OCR 模型 olmOCR 從 arxiv、open access 期刊與 PMC 抽取);
  • StarCoder 程式碼語料、StackExchange 問答、Wikipedia、BookCorpus 等補充資料。

去重 (Deduplication) 是資料品質的關鍵:我們採用三層去重——精確雜湊 (exact hash) 移除 67% 的重複、MinHash 移除 23%、子字串 (substring) 去重移除 14%。所有去重工具被打包進 duplodocus 套件。

個資 (PII) 過濾:我們使用 Gemma 3 12B 對網頁段落進行高敏感度的 PII 偵測並予以移除。

3.5 中段訓練 (Midtraining)

Dolma 3 Dolmino Mix 共 100B token,著重在數學、程式碼、QA、思考與指令合成資料上補強基礎模型的弱點。

表 5(說明): Dolmino Mix 的組成。包含 Dolmino-1 數學資料、TinyMATH、CraneMath、MegaMatt(合計約 30B 數學 token),Stack-Edu FIM (Fill-in-the-Middle)、CraneCode(合計約 25B 程式碼 token),以及 Reddit-to-Flashcards、Wiki-to-RCQA、Nemotron QA(合計約 20B QA token)。

方法論:微觀退火 + 整合測試 (Microanneal + Integration Tests)

中段訓練的關鍵挑戰是:「新加入的某個資料子集,單獨看起來有益,但放進完整 mix 時可能拖累其他能力」。為此我們設計了兩階段的測試方法:

  1. 微觀退火 (Microanneal):用一個很小的退火預算(例如 5B token)獨立測試單一資料子集對該子集對應的下游能力的提升幅度。
  2. 整合測試 (Integration Test):在完整 mix 中加入或抽出一個子集,觀察對所有下游能力的整體影響,捕捉資料間的相互作用。

我們前後跑了五輪這種測試循環。

表 6 / 表 7(說明): 第一輪到第五輪 mix 的結果,以及不同領域的此消彼長 (tradeoff) 模式。例如:加入更多數學資料會輕微拉低人文知識任務的分數;加入程式碼 FIM 會提升 HumanEval 但降低 BBH。

3.5.3 去汙染 (Decontamination)

我們使用自研的 decon 套件對 Dolmino Mix 與所有評估基準進行去汙染:採用 8-gram 重疊比對 (8-gram overlap matching) 與精確子字串比對,移除任何與評估集存在重疊的訓練文件。

3.6 長上下文擴充 (Long-context Extension)

我們將 Olmo 3 Base 從 8192 token 擴展到 65536 token 上下文。Dolma 3 Longmino Mix 包含 50B(7B 模型)或 100B(32B 模型)token,由長文件、程式碼倉庫、科學論文構成。

技術細節:

  • YaRN 套用於 RoPE,但只應用於全注意力層——SWA 層不需要外推(因為它本來就只看 4096 token);
  • 文件內遮罩 (intra-document masking):避免不同文件間的注意力洩漏;
  • 上下文平行 (Context Parallelism, CP):將長序列切到多張 GPU 上以降低單張 GPU 的記憶體壓力。

3.7 基礎模型結果

表 13(說明): Olmo 3 Base 在 OlmoBaseEval 完整 43 項任務上的最終分數,以及與 Marin 32B、Qwen 2.5 32B、Gemma 3 27B 等基線模型的全面對照。Olmo 3 Base 32B 在「完全開放模型」範疇中拿下首位,並在多項任務上接近或超越同規模開放權重模型。


四、Olmo 3 Think

4.1 主要結果

表 14 / 表 15(說明): Olmo 3 Think 32B / 7B 與 Qwen 3 32B / 7B、DeepSeek-R1-Distill-Qwen-32B、QwQ-32B、s1.1-32B 等推理導向模型的對照。Olmo 3.1 Think 32B 在 AIME 24/25、MATH-500、HumanEvalPlus、LiveCodeBench、GPQA Diamond、ZebraLogic 與 IFEval 上達到完全開放模型中的最先進水準。

4.2 監督式微調 (SFT)

4.2.1 Dolci Think SFT 資料

Dolci Think SFT 由以下幾類資料構成:

  • 數學推理軌跡:來自 OpenR1、NuminaMath 等開源推理資料,並由 Qwen3 32B 重寫成完整的「思考 + 答案」格式;
  • 程式碼推理軌跡:包含演算法解題、Codeforces 問題、LeetCode 解題的完整推理;
  • 科學推理:包含物理、化學、生物的多步驟推理;
  • 一般任務 + 思考軌跡:將通用指令任務改寫為帶有 thinking 區段的格式。

4.2.2 SFT 訓練

我們將 SFT 訓練程式碼從 Open Instruct 移植到 OLMo-core,獲得 約 8 倍的吞吐量加速。

4.3 偏好調校 (Preference Tuning)

我們在 SFT 之後執行 Direct Preference Optimization (DPO),並導入 Delta Learning 策略:

核心想法:對同一個提示,使用一個「強模型 (Qwen3 32B)」生成 chosen 回應,使用一個「弱模型 (Qwen3 0.6B)」生成 rejected 回應。這樣偏好對的差距 (delta) 顯著且穩定,可以加速收斂並減少噪音。

表 19(說明): Dolci Think DPO 的提示來源組成(包含 wildchat、open-thoughts、tulu-3-mix 等)。

表 21(說明): Delta Learning 對下游推理基準的提升幅度。對比沒有 delta learning 的標準 DPO,delta learning 在 MATH 上提升約 +3.2 點、AIME 上提升 +2.8 點。

4.4 OlmoRL:強化學習框架

我們的 RL 框架 OlmoRL 以 GRPO (Group Relative Policy Optimization) 為基礎,並融入 DAPO 的多項改進:

  1. 零梯度過濾 (zero gradient filtering):丟棄整批正確或整批錯誤的樣本(沒有學習訊號);
  2. 主動取樣 (active sampling):優先取樣模型當前正錯參半的提示;
  3. token 級 loss:取代序列級 loss,避免長序列被稀釋;
  4. 取消 KL 懲罰:發現對推理 RL 而言反而有害;
  5. 不對稱裁切 (clip-higher):放寬對正向更新的裁切上界;
  6. 截斷重要度取樣 (truncated importance sampling):針對 actor 與 rollout 模型不同步的情況做修正;
  7. 取消 std 正規化:對長度分歧的 group 更穩定。

4.4.1 驗證器 (Verifiers)

  • 數學:精確答案比對 + sympy 等價判定;
  • 程式碼:執行單元測試 (unit tests) 並回傳通過率;
  • 指令遵循 (IF):規則式驗證(句長、格式、關鍵字限制);
  • 聊天 (chat):兩種模式——reference-based(與參考答案比對)與 open-ended(由評審模型評分)。

4.4.2 Dolci Think RL 資料

表 20(說明): Dolci Think RL 約 100K 樣本,跨數學、程式碼、IF、chat 四個領域。

4.4.3 基礎設施 (Infrastructure)

我們的 RL 基礎設施採用以下三大關鍵技術:

  • 連續批次處理 (continuous batching):允許不同長度的序列在同一個 batch 中接續執行,避免空閒 GPU;
  • 飛行中權重更新 (inflight weight updates):在 rollout 期間就更新權重,無需等到整個 epoch 結束;
  • 完全非同步 RL (fully asynchronous RL):actor、rollout、reward 三個元件解耦並行。

表 23(說明): 基礎設施消融實驗。從 baseline 的 5.34 Mtok 與 MFU 0.25%,逐步加上連續批次 (8.21 Mtok)、inflight 更新 (12.45 Mtok)、主動取樣 (16.78 Mtok),最終達到 21.23 Mtok 與 MFU 1.01%——相當於約 4 倍的訓練速度提升。

4.5 關鍵發現

  • DPO 是比 SFT 更好的 RL 起點:從 DPO 後接續 RL,比直接從 SFT 後接續 RL 收斂更快、最終分數更高。
  • 思考軌跡品質比數量更重要:少量高品質的 thinking 軌跡優於大量低品質軌跡。
  • Delta Learning 是穩定 DPO 的關鍵:使用強/弱模型 contrast 的偏好對可顯著穩定訓練。

五、Olmo 3 Instruct

Olmo 3 Instruct 是專為指令遵循、聊天與工具使用 (tool use) 設計的變體,不包含顯式的思考軌跡。

5.1 主要結果

在 IFEval、AlpacaEval、MT-Bench、ToolBench、BFCL 等基準上,Olmo 3 Instruct 7B / 32B 全面超越 Qwen 2.5、Gemma 3、Llama 3.1 等同規模開放權重模型。

5.2 函數呼叫 (function-calling) SFT 資料

我們專門為函數呼叫構建了一套 SFT 資料,內容涵蓋:

  • 單一工具呼叫;
  • 多工具串接 (tool chaining);
  • 工具錯誤處理 (error recovery);
  • 工具不適用場景 (graceful refusal)。

5.3 資料規模效應與長度偏差 (length bias)

我們發現:在 SFT 階段資料量超過某個閾值之後(約 400K 樣本),繼續加資料的回報快速遞減;同時若不對長度進行控制,模型會學到「更長的回應 = 更好」的虛假關聯。我們透過長度懲罰 (length penalty) 緩解此問題。

表 31(說明): 工具使用對照表。Olmo 3 Instruct 32B 在 BFCL v3 上超越 Qwen 2.5 32B Instruct 與 Gemma 3 27B Instruct。


六、Olmo 3 RL-Zero

Olmo 3 RL-Zero 是專為 RL 研究而設計的變體:它直接從 Olmo 3 Base 出發,不經過 SFT 或 DPO,僅以純 RL 進行後訓練。我們釋出四套領域專屬的 RL 資料:

  • Dolci RL-Zero Math:可驗證數學題;
  • Dolci RL-Zero Code:含單元測試的程式題;
  • Dolci RL-Zero IF:規則式指令遵循題;
  • Dolci RL-Zero Chat:兩階段 chat(reference-based + open-ended)。

6.2 關鍵發現

  • 主動取樣穩定訓練:在純 RL 環境下,主動取樣顯著降低了訓練的方差;
  • 偽獎勵 (spurious rewards):我們以人工注入錯誤標籤的方式驗證 RL 訓練是否被基準污染;結果顯示去汙染流程是有效的;
  • 純 RL 也可達到具競爭力的推理能力,雖然仍弱於 SFT + DPO + RL 的完整流程。

七、結論

Olmo 3 不只是一組模型,而是一條軌跡 (trajectory):

  • 任何人都可以從預訓練檢查點分支開始;
  • 任何人都可以從中段訓練檢查點分叉,加入自己的領域資料;
  • 任何人都可以從 Olmo 3 Base 出發,跑自己的 SFT、DPO 或 RL;
  • 任何人都可以複製、檢視、批評、改進這條軌跡上的每一步。

我們相信:對於 LM 研究、教育與下游應用而言,完全開放的模型流程是封閉模型無可取代的。Olmo 3 Base 32B 是當前最強的完全開放基礎模型;Olmo 3.1 Think 32B 是當前最強的完全開放思考模型;Olmo 3 Instruct 是同規模下最強的工具使用模型;而 Olmo 3 RL-Zero 為 RL 後訓練研究提供了完整的起點。

我們將持續更新與擴充 Dolma、Dolci 與 Olmo 系列。歡迎社群檢視、分支與貢獻。


附錄概覽

完整論文包含八個附錄 (A.1–A.8),篇幅約 35 頁。為避免本翻譯文件過長,我們僅列出附錄結構供讀者參考;如需深入細節請參閱原文:

  • A.1 模型卡 (Model Cards):所有發布變體的權重、tokenizer、上下文長度與授權細節。
  • A.2 資料卡 (Data Cards):Dolma 3 Mix、Dolmino Mix、Longmino Mix、Dolci 系列的完整來源、授權與處理流程。
  • A.3 預訓練細節 (Pretraining Details):超參數 (hyperparameters)、學習率排程 (learning rate schedule)、batch size、optimizer 細節。
  • A.4 中段訓練實驗紀錄 (Midtraining Experiments):5 輪 microanneal + integration test 的完整數據。
  • A.5 長上下文擴充細節:YaRN 參數、CP 設定、ablation study。
  • A.6 後訓練細節 (Post-training Details):SFT、DPO、RL 各階段的完整超參數與資料混合比例。
  • A.7 評估細節 (Evaluation Details):OlmoBaseEval 與後訓練評估的提示模板、scoring rubric、few-shot 範例。
  • A.8 安全與可重現性 (Safety & Reproducibility):安全評估結果、紅隊 (red teaming) 結果、環境設定與版本資訊。

參考文獻

完整參考文獻請見原始論文 PDF 第 70–82 頁。為節省篇幅,本翻譯文件不重複列出。下列為文中重點引用的工作(保留英文原文):

  • DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. 2025.
  • Yang, A. et al. Qwen3 Technical Report. 2025.
  • Gemma Team. Gemma 3 Technical Report. 2025.
  • Soldaini, L. et al. Dolma: An Open Corpus of Three Trillion Tokens for Language Model Pretraining Research. 2024.
  • Lambert, N. et al. Tulu 3: Pushing Frontiers in Open Language Model Post-Training. 2024.
  • Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023.
  • Shao, Z. et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models (GRPO). 2024.
  • Yu, H. et al. DAPO: An Open-Source LLM Reinforcement Learning System at Scale. 2025.
  • Peng, B. et al. YaRN: Efficient Context Window Extension of Large Language Models. 2023.
  • Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. 2021.
  • Beltagy, I. et al. Longformer: The Long-Document Transformer (sliding window attention). 2020.

術語對照表

English 繁體中文
Language Model (LM) 語言模型
Large Language Model (LLM) 大型語言模型
State-of-the-Art (SOTA) 最先進
Pretraining 預訓練
Midtraining 中段訓練
Long-context Extension 長上下文擴充
Post-training 後訓練
Supervised Fine-Tuning (SFT) 監督式微調
Direct Preference Optimization (DPO) 直接偏好最佳化
Reinforcement Learning (RL) 強化學習
Reinforcement Learning from Verifiable Rewards (RLVR) 可驗證獎勵的強化學習
Group Relative Policy Optimization (GRPO) 群組相對策略最佳化
Reward Model 獎勵模型
Preference Pair 偏好對
Delta Learning 差距學習
Active Sampling 主動取樣
Continuous Batching 連續批次處理
Inflight Weight Update 飛行中權重更新
Asynchronous RL 非同步強化學習
Token-level Loss token 級損失
Importance Sampling 重要度取樣
Truncated Importance Sampling 截斷重要度取樣
Decoder-only Transformer 僅解碼器 Transformer
Sliding Window Attention (SWA) 滑動視窗注意力
Full Attention 全注意力
Rotary Position Embedding (RoPE) 旋轉位置編碼
YaRN (Yet another RoPE extensioN) YaRN 位置編碼外推法
Context Parallelism (CP) 上下文平行
KV Cache KV 快取
Fill-in-the-Middle (FIM) 中間填空
Tokenizer 分詞器
Checkpoint 檢查點
Open-weights Model 開放權重模型
Fully-open Model 完全開放模型
Model Flow 模型流程
Common Crawl Common Crawl 網頁爬取資料
Deduplication 去重
MinHash MinHash 雜湊去重
Substring Deduplication 子字串去重
Personally Identifiable Information (PII) 個人可識別資訊
Decontamination 去汙染
n-gram Overlap n-gram 重疊
Microanneal 微觀退火
Integration Test 整合測試
Instruction Following 指令遵循
Tool Use / Function Calling 工具使用 / 函數呼叫
Chain-of-Thought (CoT) 思維鏈
Thinking Trace 思考軌跡
Reasoning Model 推理模型
Verifier 驗證器
Unit Test 單元測試
Reward Hacking 獎勵駭客
KL Divergence KL 散度
Clip-higher 不對稱裁切
Spurious Rewards 偽獎勵
Length Bias 長度偏差
Red Teaming 紅隊測試
Hyperparameter 超參數
Throughput 吞吐量
Model FLOPs Utilization (MFU) 模型 FLOPs 利用率
Benchmark 基準測試
Signal-to-Noise Ratio (SNR) 訊噪比
Scaling Analysis 縮放分析
← 回到列表
已複製連結