Olmo 3
Olmo 3:完全開放的語言模型家族
原始論文:Olmo 3 作者:Olmo 團隊(Allen Institute for AI 與多個合作機構,包含 University of Washington、Carnegie Mellon University、Stanford、Mila、Princeton、MIT、UMD 等;通訊作者 Hannaneh Hajishirzi) arXiv ID:2512.13961v1 日期:2025-12
目錄
- 摘要
- 一、引言
- 二、模型流程概覽
- 三、Olmo 3 Base
- 四、Olmo 3 Think
- 五、Olmo 3 Instruct
- 六、Olmo 3 RL-Zero
- 七、結論
- 附錄概覽
- 參考文獻
- 術語對照表
摘要
我們推出 Olmo 3,這是一個在 7B 與 32B 參數規模上、達到最先進 (State-of-the-Art, SOTA) 水準的完全開放 (fully-open) 語言模型 (Language Model, LM) 家族。它建構了所謂的「模型流程 (model flow)」:一條可由社群檢視、修改與分支的端到端訓練軌跡,涵蓋資料、檢查點 (checkpoints)、訓練程式碼,以及將原始文本變為 Olmo 3 Base、Olmo 3 Instruct、Olmo 3 Think 與 Olmo 3 RL-Zero 等四種變體所需的全部後訓練 (post-training) 元件。
- Olmo 3 Base 是目前最強的完全開放基礎模型 (fully-open base model):它超越了 Marin、Apertus 與 SmolLM 3,並可與 Qwen 2.5 與 Gemma 3 匹敵;同時在程式碼、數學、長上下文 (long-context) 推理與閱讀理解等領域具備強大表現。
- Olmo 3 Think (32B) 是目前最強的完全開放思考模型 (fully-open thinking model):它與該規模下最頂尖的開放權重 (open-weights) 模型差距很小,並以遠少於對手的訓練 token 數達到此成果。
- Olmo 3 Instruct 在指令遵循 (instruction following)、聊天 (chat) 與工具使用 (tool use) 上超越了 Qwen 2.5、Gemma 3 與 Llama 3.1 等同等規模的開放權重模型。
- Olmo 3 RL-Zero 提供了完整且完全開放的純 RL 後訓練流程,可從任意基礎模型出發開展研究,並提供四套針對數學、程式碼、指令遵循與一般聊天的領域專屬 RL 套件。
我們釋出了包含預訓練 (pretraining)、中段訓練 (midtraining)、長上下文擴充以及全部後訓練的所有資料集、程式碼與檢查點,使研究者能夠在訓練流程的任何階段檢視、改寫或分支模型。Olmo 3 不只是一組強大的模型,更是一條可以被世界改寫的軌跡。
一、引言
過去兩年間,語言模型 (Language Models, LMs) 的能力與規模都飛速提升。然而,這些進展大多被封閉在無法被外界檢視的訓練流程之後:開放權重 (open-weights) 模型只發布最終權重,閉源模型甚至連權重也沒有。對研究者、學生與獨立開發者而言,這意味著「為什麼模型會這樣表現?哪一個訓練選擇造成了哪一個結果?」這類核心問題無從回答。
Olmo 3 正是為了打破這個壁壘而存在。我們不只發布最終權重,而是發布一條完整、可分支的模型流程 (model flow):
- 資料:5.9 兆 (Trillion) token 的預訓練語料庫 Dolma 3 Mix;100B 的中段訓練 Dolmino Mix;以及 50B/100B 的長上下文 Longmino Mix。後訓練則由 Dolci 資料家族(Dolci Think SFT/DPO/RL、Dolci Instruct、Dolci RL-Zero)構成。
- 檢查點 (Checkpoints):模型在每個訓練階段(預訓練、中段訓練、長上下文、SFT、DPO、RL)的中間檢查點都會釋出,可供任何人從中接續分支訓練。
- 程式碼:包含預訓練框架 OLMo-core、後訓練框架 Open Instruct、資料處理工具 datamap-rs 與 duplodocus、評估套件 OLMES,以及去汙染 (decontamination) 工具 decon。
- 全部後訓練元件:將任何 Olmo 3 Base 變成 Instruct、Think 或 RL-Zero 的所有指令、回應、偏好對 (preference pairs) 與獎勵設計。

圖 1(說明): Olmo 3 模型流程示意圖。從 Dolma 3 Mix 預訓練語料出發,依序經過中段訓練 (Midtraining) 與長上下文擴充 (Long-context Extension),產生 Olmo 3 Base;接著透過 SFT、DPO 與 RLVR 三階段的後訓練,分別衍生出 Olmo 3 Think、Olmo 3 Instruct 與 Olmo 3 RL-Zero 變體。每一個圓圈都是一個釋出的檢查點 (checkpoint),每一條箭頭都是一段被釋出的程式碼與資料。
我們的核心訊息是:Olmo 3 不只是一組權重,而是一條軌跡。 你可以從預訓練後接續長上下文訓練;可以從中段訓練檢查點分叉做你的領域特化;也可以從 Olmo 3 Base 直接開始你自己的後訓練流程。每一個檢查點都是可分支的起點。
在這份報告中,Olmo 3.1 Think 32B 是當前最強的完全開放思考模型;它在 MATH、AIME、HumanEvalPlus、IFEval 等多項基準上接近 Qwen 3 32B 與 DeepSeek-R1-Distill-Qwen-32B,而我們僅使用了對手約一半的訓練 token 數。
二、模型流程概覽
Olmo 3 是一條端到端的訓練軌跡。本節依序描述基礎模型訓練、後訓練流程,以及最終結果與訓練成本。
2.1 基礎模型訓練
基礎模型訓練 (Base Model Training) 由三個階段組成:
- 預訓練 (Pretraining):使用 5.9T token 的 Dolma 3 Mix,於 8192 token 序列上進行訓練。資料來源以 Common Crawl 為主(76.1%),加上我們新建的 olmOCR 科學 PDF 資料集 (13.6%)、StarCoder 程式碼、StackExchange 問答、維基百科等。
- 中段訓練 (Midtraining):100B token 的 Dolma 3 Dolmino Mix,重點補強數學、程式碼、問答 (QA)、推理 (thinking) 與指令合成資料。在這個階段我們導入了雙階段 (microanneal + integration test) 的方法論,可以分別測試單一資料子集以及它們在完整混合中的相互作用。
- 長上下文擴充 (Long-context Extension):50B–100B token 的 Dolma 3 Longmino Mix,將上下文窗從 8192 擴展到 65536;技術上使用 YaRN (Yet another RoPE extensioN) 對 Rotary Position Embedding (RoPE) 進行外推,並僅對全注意力 (full attention) 層套用、避免影響滑動視窗注意力 (Sliding Window Attention, SWA) 層。
2.2 後訓練流程
後訓練 (Post-training) 將 Olmo 3 Base 轉換為三類變體:Think(具備「思考」軌跡的推理模型)、Instruct(指令與工具使用模型)、RL-Zero(純 RL 後訓練流程示範)。流程主軸為:
- 監督式微調 (Supervised Fine-Tuning, SFT):使用 Dolci Think SFT 或 Dolci Instruct SFT 等資料集對基礎模型進行第一階段微調。我們將 SFT 程式碼從 Open Instruct 移植到 OLMo-core,獲得約 8 倍的吞吐量加速。
- 偏好調校 (Preference Tuning):使用 Direct Preference Optimization (DPO) 並導入 Delta Learning 策略——同一個提示用一個強模型 (Qwen3 32B) 與一個弱模型 (Qwen3 0.6B) 各產生一個回應作為偏好對 (preference pair)。
- 強化學習 (Reinforcement Learning, RL):以我們自研的 OlmoRL 框架進行可驗證獎勵 (verifiable rewards) 的 RL,基礎演算法為 GRPO,並融入 DAPO 的多項改進,包括零梯度過濾、主動取樣 (active sampling)、token 級 loss、移除 KL 懲罰、不對稱裁切 (clip-higher)、截斷重要度取樣 (truncated importance sampling),以及取消 std 正規化。
2.3 結果
表 1(說明): Olmo 3.1 Think 32B 與其他主要開放/半開放推理模型(Qwen 3 32B、DeepSeek-R1-Distill-Qwen-32B、QwQ-32B、s1.1-32B 等)在數學 (MATH、AIME)、程式碼 (HumanEvalPlus、MBPPPlus、LiveCodeBench)、推理 (BBH、GPQA、ZebraLogic) 與指令遵循 (IFEval) 上的對照。Olmo 3.1 Think 32B 在多數基準上與封閉開源模型差距控制在數個百分點之內,並在部分推理任務上超越同級對手。
關鍵觀察:
- Olmo 3.1 Think 32B 是當前最強的完全開放思考模型;
- Olmo 3 Base 32B 是當前最強的完全開放基礎模型,並可與 Qwen 2.5 32B、Gemma 3 27B 等開放權重模型匹敵;
- Olmo 3 Instruct 7B/32B 在指令遵循、聊天、工具使用上超越同規模 Qwen 2.5、Gemma 3、Llama 3.1。
2.4 訓練成本
訓練 Olmo 3.1 Think 32B 的整段流程在 1024 張 NVIDIA H100 GPU 上耗時約 56 天,依市場價約 2.75M 美元。我們相信這個成本與封閉模型相比具有極佳的性價比,特別是考量到我們同時釋出了所有資料、程式碼與中間檢查點。
三、Olmo 3 Base
3.1 主要結果
表 2(說明): 32B 規模對照表。Olmo 3 Base 32B 與 Marin 32B、Apertus 70B、Qwen 2.5 32B、Gemma 3 27B 在 OlmoBaseEval 的 43 項任務上的對照結果。Olmo 3 Base 32B 是當前最強的完全開放基礎模型,並在多項程式碼與長上下文任務上達到或超越 Qwen 2.5 32B。
表 3(說明): 7B 規模對照表。Olmo 3 Base 7B 與 SmolLM 3、Llama 3.1 8B、Mistral 7B、Qwen 2.5 7B、Gemma 3 7B 對照。Olmo 3 Base 7B 全面超越 SmolLM 3,並可與 Qwen 2.5 7B、Gemma 3 7B 等開放權重模型匹敵。
3.2 模型架構
Olmo 3 Base 是僅解碼器 (decoder-only) Transformer,採用下列關鍵設計:
- 滑動視窗注意力 (SWA):4096 token 視窗,4 層中有 3 層為 SWA、1 層為全注意力。這在不犧牲長上下文能力的前提下大幅降低 KV 快取與計算量。
- 預訓練上下文:8192 token;後續透過 YaRN 擴充至 65536 token。
- 位置編碼:Rotary Position Embedding (RoPE),base frequency 500000。
- 訓練框架:自研的 OLMo-core,在 H100 上對 7B 模型可達 7700 token/sec/GPU,對 32B 模型可達 1960 token/sec/GPU 的吞吐量。
3.3 實驗設計
我們建立了 OlmoBaseEval——一套涵蓋 43 項基準的基礎模型評估套件。設計上強調:
- 聚類分析 (clustering analysis):將任務分為知識、推理、程式碼、數學、長上下文等群組,避免單一任務主導排名;
- 縮放分析 (scaling analysis):在多個模型尺寸(150M、530M、1.4B、7B)上觀察分數隨 token 數的單調性;
- 訊噪比 (Signal-to-Noise Ratio, SNR) 分析:剔除噪音過大的基準項目,只保留可靠地反映模型差異的任務。
3.4 預訓練
預訓練資料 Dolma 3 Mix 共 5.9T token。組成大致如下:
- Common Crawl 網頁資料:76.1%(經過 datamap-rs 的多階段品質過濾);
- olmOCR 科學 PDF:13.6%(由我們新訓練的 OCR 模型 olmOCR 從 arxiv、open access 期刊與 PMC 抽取);
- StarCoder 程式碼語料、StackExchange 問答、Wikipedia、BookCorpus 等補充資料。
去重 (Deduplication) 是資料品質的關鍵:我們採用三層去重——精確雜湊 (exact hash) 移除 67% 的重複、MinHash 移除 23%、子字串 (substring) 去重移除 14%。所有去重工具被打包進 duplodocus 套件。
個資 (PII) 過濾:我們使用 Gemma 3 12B 對網頁段落進行高敏感度的 PII 偵測並予以移除。
3.5 中段訓練 (Midtraining)
Dolma 3 Dolmino Mix 共 100B token,著重在數學、程式碼、QA、思考與指令合成資料上補強基礎模型的弱點。
表 5(說明): Dolmino Mix 的組成。包含 Dolmino-1 數學資料、TinyMATH、CraneMath、MegaMatt(合計約 30B 數學 token),Stack-Edu FIM (Fill-in-the-Middle)、CraneCode(合計約 25B 程式碼 token),以及 Reddit-to-Flashcards、Wiki-to-RCQA、Nemotron QA(合計約 20B QA token)。
方法論:微觀退火 + 整合測試 (Microanneal + Integration Tests)
中段訓練的關鍵挑戰是:「新加入的某個資料子集,單獨看起來有益,但放進完整 mix 時可能拖累其他能力」。為此我們設計了兩階段的測試方法:
- 微觀退火 (Microanneal):用一個很小的退火預算(例如 5B token)獨立測試單一資料子集對該子集對應的下游能力的提升幅度。
- 整合測試 (Integration Test):在完整 mix 中加入或抽出一個子集,觀察對所有下游能力的整體影響,捕捉資料間的相互作用。
我們前後跑了五輪這種測試循環。
表 6 / 表 7(說明): 第一輪到第五輪 mix 的結果,以及不同領域的此消彼長 (tradeoff) 模式。例如:加入更多數學資料會輕微拉低人文知識任務的分數;加入程式碼 FIM 會提升 HumanEval 但降低 BBH。
3.5.3 去汙染 (Decontamination)
我們使用自研的 decon 套件對 Dolmino Mix 與所有評估基準進行去汙染:採用 8-gram 重疊比對 (8-gram overlap matching) 與精確子字串比對,移除任何與評估集存在重疊的訓練文件。
3.6 長上下文擴充 (Long-context Extension)
我們將 Olmo 3 Base 從 8192 token 擴展到 65536 token 上下文。Dolma 3 Longmino Mix 包含 50B(7B 模型)或 100B(32B 模型)token,由長文件、程式碼倉庫、科學論文構成。
技術細節:
- YaRN 套用於 RoPE,但只應用於全注意力層——SWA 層不需要外推(因為它本來就只看 4096 token);
- 文件內遮罩 (intra-document masking):避免不同文件間的注意力洩漏;
- 上下文平行 (Context Parallelism, CP):將長序列切到多張 GPU 上以降低單張 GPU 的記憶體壓力。
3.7 基礎模型結果
表 13(說明): Olmo 3 Base 在 OlmoBaseEval 完整 43 項任務上的最終分數,以及與 Marin 32B、Qwen 2.5 32B、Gemma 3 27B 等基線模型的全面對照。Olmo 3 Base 32B 在「完全開放模型」範疇中拿下首位,並在多項任務上接近或超越同規模開放權重模型。
四、Olmo 3 Think
4.1 主要結果
表 14 / 表 15(說明): Olmo 3 Think 32B / 7B 與 Qwen 3 32B / 7B、DeepSeek-R1-Distill-Qwen-32B、QwQ-32B、s1.1-32B 等推理導向模型的對照。Olmo 3.1 Think 32B 在 AIME 24/25、MATH-500、HumanEvalPlus、LiveCodeBench、GPQA Diamond、ZebraLogic 與 IFEval 上達到完全開放模型中的最先進水準。
4.2 監督式微調 (SFT)
4.2.1 Dolci Think SFT 資料
Dolci Think SFT 由以下幾類資料構成:
- 數學推理軌跡:來自 OpenR1、NuminaMath 等開源推理資料,並由 Qwen3 32B 重寫成完整的「思考 + 答案」格式;
- 程式碼推理軌跡:包含演算法解題、Codeforces 問題、LeetCode 解題的完整推理;
- 科學推理:包含物理、化學、生物的多步驟推理;
- 一般任務 + 思考軌跡:將通用指令任務改寫為帶有 thinking 區段的格式。
4.2.2 SFT 訓練
我們將 SFT 訓練程式碼從 Open Instruct 移植到 OLMo-core,獲得 約 8 倍的吞吐量加速。
4.3 偏好調校 (Preference Tuning)
我們在 SFT 之後執行 Direct Preference Optimization (DPO),並導入 Delta Learning 策略:
核心想法:對同一個提示,使用一個「強模型 (Qwen3 32B)」生成 chosen 回應,使用一個「弱模型 (Qwen3 0.6B)」生成 rejected 回應。這樣偏好對的差距 (delta) 顯著且穩定,可以加速收斂並減少噪音。
表 19(說明): Dolci Think DPO 的提示來源組成(包含 wildchat、open-thoughts、tulu-3-mix 等)。
表 21(說明): Delta Learning 對下游推理基準的提升幅度。對比沒有 delta learning 的標準 DPO,delta learning 在 MATH 上提升約 +3.2 點、AIME 上提升 +2.8 點。
4.4 OlmoRL:強化學習框架
我們的 RL 框架 OlmoRL 以 GRPO (Group Relative Policy Optimization) 為基礎,並融入 DAPO 的多項改進:
- 零梯度過濾 (zero gradient filtering):丟棄整批正確或整批錯誤的樣本(沒有學習訊號);
- 主動取樣 (active sampling):優先取樣模型當前正錯參半的提示;
- token 級 loss:取代序列級 loss,避免長序列被稀釋;
- 取消 KL 懲罰:發現對推理 RL 而言反而有害;
- 不對稱裁切 (clip-higher):放寬對正向更新的裁切上界;
- 截斷重要度取樣 (truncated importance sampling):針對 actor 與 rollout 模型不同步的情況做修正;
- 取消 std 正規化:對長度分歧的 group 更穩定。
4.4.1 驗證器 (Verifiers)
- 數學:精確答案比對 + sympy 等價判定;
- 程式碼:執行單元測試 (unit tests) 並回傳通過率;
- 指令遵循 (IF):規則式驗證(句長、格式、關鍵字限制);
- 聊天 (chat):兩種模式——reference-based(與參考答案比對)與 open-ended(由評審模型評分)。
4.4.2 Dolci Think RL 資料
表 20(說明): Dolci Think RL 約 100K 樣本,跨數學、程式碼、IF、chat 四個領域。
4.4.3 基礎設施 (Infrastructure)
我們的 RL 基礎設施採用以下三大關鍵技術:
- 連續批次處理 (continuous batching):允許不同長度的序列在同一個 batch 中接續執行,避免空閒 GPU;
- 飛行中權重更新 (inflight weight updates):在 rollout 期間就更新權重,無需等到整個 epoch 結束;
- 完全非同步 RL (fully asynchronous RL):actor、rollout、reward 三個元件解耦並行。
表 23(說明): 基礎設施消融實驗。從 baseline 的 5.34 Mtok 與 MFU 0.25%,逐步加上連續批次 (8.21 Mtok)、inflight 更新 (12.45 Mtok)、主動取樣 (16.78 Mtok),最終達到 21.23 Mtok 與 MFU 1.01%——相當於約 4 倍的訓練速度提升。
4.5 關鍵發現
- DPO 是比 SFT 更好的 RL 起點:從 DPO 後接續 RL,比直接從 SFT 後接續 RL 收斂更快、最終分數更高。
- 思考軌跡品質比數量更重要:少量高品質的 thinking 軌跡優於大量低品質軌跡。
- Delta Learning 是穩定 DPO 的關鍵:使用強/弱模型 contrast 的偏好對可顯著穩定訓練。
五、Olmo 3 Instruct
Olmo 3 Instruct 是專為指令遵循、聊天與工具使用 (tool use) 設計的變體,不包含顯式的思考軌跡。
5.1 主要結果
在 IFEval、AlpacaEval、MT-Bench、ToolBench、BFCL 等基準上,Olmo 3 Instruct 7B / 32B 全面超越 Qwen 2.5、Gemma 3、Llama 3.1 等同規模開放權重模型。
5.2 函數呼叫 (function-calling) SFT 資料
我們專門為函數呼叫構建了一套 SFT 資料,內容涵蓋:
- 單一工具呼叫;
- 多工具串接 (tool chaining);
- 工具錯誤處理 (error recovery);
- 工具不適用場景 (graceful refusal)。
5.3 資料規模效應與長度偏差 (length bias)
我們發現:在 SFT 階段資料量超過某個閾值之後(約 400K 樣本),繼續加資料的回報快速遞減;同時若不對長度進行控制,模型會學到「更長的回應 = 更好」的虛假關聯。我們透過長度懲罰 (length penalty) 緩解此問題。
表 31(說明): 工具使用對照表。Olmo 3 Instruct 32B 在 BFCL v3 上超越 Qwen 2.5 32B Instruct 與 Gemma 3 27B Instruct。
六、Olmo 3 RL-Zero
Olmo 3 RL-Zero 是專為 RL 研究而設計的變體:它直接從 Olmo 3 Base 出發,不經過 SFT 或 DPO,僅以純 RL 進行後訓練。我們釋出四套領域專屬的 RL 資料:
- Dolci RL-Zero Math:可驗證數學題;
- Dolci RL-Zero Code:含單元測試的程式題;
- Dolci RL-Zero IF:規則式指令遵循題;
- Dolci RL-Zero Chat:兩階段 chat(reference-based + open-ended)。
6.2 關鍵發現
- 主動取樣穩定訓練:在純 RL 環境下,主動取樣顯著降低了訓練的方差;
- 偽獎勵 (spurious rewards):我們以人工注入錯誤標籤的方式驗證 RL 訓練是否被基準污染;結果顯示去汙染流程是有效的;
- 純 RL 也可達到具競爭力的推理能力,雖然仍弱於 SFT + DPO + RL 的完整流程。
七、結論
Olmo 3 不只是一組模型,而是一條軌跡 (trajectory):
- 任何人都可以從預訓練檢查點分支開始;
- 任何人都可以從中段訓練檢查點分叉,加入自己的領域資料;
- 任何人都可以從 Olmo 3 Base 出發,跑自己的 SFT、DPO 或 RL;
- 任何人都可以複製、檢視、批評、改進這條軌跡上的每一步。
我們相信:對於 LM 研究、教育與下游應用而言,完全開放的模型流程是封閉模型無可取代的。Olmo 3 Base 32B 是當前最強的完全開放基礎模型;Olmo 3.1 Think 32B 是當前最強的完全開放思考模型;Olmo 3 Instruct 是同規模下最強的工具使用模型;而 Olmo 3 RL-Zero 為 RL 後訓練研究提供了完整的起點。
我們將持續更新與擴充 Dolma、Dolci 與 Olmo 系列。歡迎社群檢視、分支與貢獻。
附錄概覽
完整論文包含八個附錄 (A.1–A.8),篇幅約 35 頁。為避免本翻譯文件過長,我們僅列出附錄結構供讀者參考;如需深入細節請參閱原文:
- A.1 模型卡 (Model Cards):所有發布變體的權重、tokenizer、上下文長度與授權細節。
- A.2 資料卡 (Data Cards):Dolma 3 Mix、Dolmino Mix、Longmino Mix、Dolci 系列的完整來源、授權與處理流程。
- A.3 預訓練細節 (Pretraining Details):超參數 (hyperparameters)、學習率排程 (learning rate schedule)、batch size、optimizer 細節。
- A.4 中段訓練實驗紀錄 (Midtraining Experiments):5 輪 microanneal + integration test 的完整數據。
- A.5 長上下文擴充細節:YaRN 參數、CP 設定、ablation study。
- A.6 後訓練細節 (Post-training Details):SFT、DPO、RL 各階段的完整超參數與資料混合比例。
- A.7 評估細節 (Evaluation Details):OlmoBaseEval 與後訓練評估的提示模板、scoring rubric、few-shot 範例。
- A.8 安全與可重現性 (Safety & Reproducibility):安全評估結果、紅隊 (red teaming) 結果、環境設定與版本資訊。
參考文獻
完整參考文獻請見原始論文 PDF 第 70–82 頁。為節省篇幅,本翻譯文件不重複列出。下列為文中重點引用的工作(保留英文原文):
- DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. 2025.
- Yang, A. et al. Qwen3 Technical Report. 2025.
- Gemma Team. Gemma 3 Technical Report. 2025.
- Soldaini, L. et al. Dolma: An Open Corpus of Three Trillion Tokens for Language Model Pretraining Research. 2024.
- Lambert, N. et al. Tulu 3: Pushing Frontiers in Open Language Model Post-Training. 2024.
- Rafailov, R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023.
- Shao, Z. et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models (GRPO). 2024.
- Yu, H. et al. DAPO: An Open-Source LLM Reinforcement Learning System at Scale. 2025.
- Peng, B. et al. YaRN: Efficient Context Window Extension of Large Language Models. 2023.
- Su, J. et al. RoFormer: Enhanced Transformer with Rotary Position Embedding. 2021.
- Beltagy, I. et al. Longformer: The Long-Document Transformer (sliding window attention). 2020.
術語對照表
| English | 繁體中文 |
|---|---|
| Language Model (LM) | 語言模型 |
| Large Language Model (LLM) | 大型語言模型 |
| State-of-the-Art (SOTA) | 最先進 |
| Pretraining | 預訓練 |
| Midtraining | 中段訓練 |
| Long-context Extension | 長上下文擴充 |
| Post-training | 後訓練 |
| Supervised Fine-Tuning (SFT) | 監督式微調 |
| Direct Preference Optimization (DPO) | 直接偏好最佳化 |
| Reinforcement Learning (RL) | 強化學習 |
| Reinforcement Learning from Verifiable Rewards (RLVR) | 可驗證獎勵的強化學習 |
| Group Relative Policy Optimization (GRPO) | 群組相對策略最佳化 |
| Reward Model | 獎勵模型 |
| Preference Pair | 偏好對 |
| Delta Learning | 差距學習 |
| Active Sampling | 主動取樣 |
| Continuous Batching | 連續批次處理 |
| Inflight Weight Update | 飛行中權重更新 |
| Asynchronous RL | 非同步強化學習 |
| Token-level Loss | token 級損失 |
| Importance Sampling | 重要度取樣 |
| Truncated Importance Sampling | 截斷重要度取樣 |
| Decoder-only Transformer | 僅解碼器 Transformer |
| Sliding Window Attention (SWA) | 滑動視窗注意力 |
| Full Attention | 全注意力 |
| Rotary Position Embedding (RoPE) | 旋轉位置編碼 |
| YaRN (Yet another RoPE extensioN) | YaRN 位置編碼外推法 |
| Context Parallelism (CP) | 上下文平行 |
| KV Cache | KV 快取 |
| Fill-in-the-Middle (FIM) | 中間填空 |
| Tokenizer | 分詞器 |
| Checkpoint | 檢查點 |
| Open-weights Model | 開放權重模型 |
| Fully-open Model | 完全開放模型 |
| Model Flow | 模型流程 |
| Common Crawl | Common Crawl 網頁爬取資料 |
| Deduplication | 去重 |
| MinHash | MinHash 雜湊去重 |
| Substring Deduplication | 子字串去重 |
| Personally Identifiable Information (PII) | 個人可識別資訊 |
| Decontamination | 去汙染 |
| n-gram Overlap | n-gram 重疊 |
| Microanneal | 微觀退火 |
| Integration Test | 整合測試 |
| Instruction Following | 指令遵循 |
| Tool Use / Function Calling | 工具使用 / 函數呼叫 |
| Chain-of-Thought (CoT) | 思維鏈 |
| Thinking Trace | 思考軌跡 |
| Reasoning Model | 推理模型 |
| Verifier | 驗證器 |
| Unit Test | 單元測試 |
| Reward Hacking | 獎勵駭客 |
| KL Divergence | KL 散度 |
| Clip-higher | 不對稱裁切 |
| Spurious Rewards | 偽獎勵 |
| Length Bias | 長度偏差 |
| Red Teaming | 紅隊測試 |
| Hyperparameter | 超參數 |
| Throughput | 吞吐量 |
| Model FLOPs Utilization (MFU) | 模型 FLOPs 利用率 |
| Benchmark | 基準測試 |
| Signal-to-Noise Ratio (SNR) | 訊噪比 |
| Scaling Analysis | 縮放分析 |