MiMo-V2.6:將強化學習擴展至自我改進

原始論文:MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement 作者:LLM-Core Xiaomi 來源 ID:hf-XiaomiMiMo-MiMo-V2.6-Flash-RL 日期:2026 標籤:Reinforcement Learning Self-Improvement MoE Long Context Mixed-Task Agentic RL Reward Hacking Defense

【譯註:本篇譯文由自動化管線產出:先取 PDF 版面結構,再以 LLM 逐段翻譯並依全站術語詞表統一譯名(模型本身不對外公開資訊,僅說明為 LLM);未經逐句人工校對。 本篇非 arXiv 來源,授權為 MIT License(模型庫);本譯文為原文的衍生作品,一切以原文為準。】

目錄

LLM-Core Xiaomi

摘要

強化學習 (Reinforcement Learning, RL) 是推動大型基礎模型邁向自我改進 (self-improvement) 的核心訓練正規化。本報告介紹了 MiMo-V2.6 系列,這是一個全模態 (omni-modal) 模型家族,透過擴大 RL 計算規模來推動模型智慧的邊界。在進行 RL 之前,我們會在廣泛的多模態語料庫上進行中期訓練,以提供充足的探索空間,並在預訓練的混合 SWA 架構上建立穩固的基礎,以支援後續的規模擴展。我們從三個維度擴大 RL 計算規模:(1) 採用非同步訓練,使用更大的批次 (batches) 與更高的吞吐量,每次步驟消耗 1,568 個樣本與 2.7~3.7B 個 tokens,上下文長度 (Context Length) 達 1M;(2) 涵蓋程式碼、通用、視覺及網路領域,並結合多種代理人 harness (agent harnesses) 來建構更多元且複雜的環境;(3) 透過組式智能體式評分 (groupwise agentic grading) 增加評分器計算資源,為長期任務 (Long-Horizon Task) 提供更準確的獎勵訊號,並引導模型朝向更短、更具 Token 效率 (token-efficient) 的解決方案發展。為了在大規模訓練中維持穩定性,我們凍結了 MoE 路由器,並建立多層防禦機制以防止獎勵駭入 (Reward Hacking)。此外,我們也為混合任務智能體式 RL 建立基礎設施,包括統一軌跡代表性 (unified trajectory representation)、高並發多框架 rollout、解耦的控制與資料平面,以及訓練與推論一致性 (training-inference consistency)。我們開源了訓練動態、RL 環境與 RL 框架,以促進對大規模 RL 與模型自我改進的研究與重現。

Figure 1

圖 1. MiMo-V2.6-Pro 與 MiMo-V2.6-Flash 在 RL 訓練過程中各項任務的基準分數。

1 Introduction 3
2 Architecture 4
2.1 Overall Architecture 4
2.2 MiMo-ViT 4
2.3 Audio Encoder 5
2.4 Speculative Decoder 5
3 Pre-Training 7
3.1 Pre-Training Setup 7
3.2 Mid-Training Setup 7
4 Scaling Reinforcement Learning 8
4.1 Scaling RL Training Computation 8
4.2 Scaling RL Environments and Harnesses 9
4.3 Groupwise Agentic Grading 16
5 Experiments: You Only RL Once 20
5.1 Training Setup 20
5.2 Evaluation Settings 21
5.3 RL Performance 22
5.4 Router Freezing for Stable RL 23 5.5 RL Failure Analysis 23 5.6 Broadening Capabilities via MOPD2 24 6 RL and OPD Infrastructure 26 6.1 Agentic RL with Fine-grained Learning Signals 26 6.2 Harness Pool and Payload Porter: Large-Batch RL with Multiple Harnesses 27 6.3 Sample Mixer: Stable Asynchronous Mixed-task RL 29 6.4 Training/Inference Consistency and Optimization 32 7 Open Foundations for Agentic RL 33 7.1 Distillation from MiMo-V2.6 33 7.2 RL with Open Environments 34 8 Conclusion 36 A Contributions and Acknowledgments 44

1 引言

遞迴式自我改進 (recursive self-improvement, RSI) 旨在讓模型透過持續的探索與回饋,不斷擴展其能力。要實現此願景,必須讓模型與互動式環境結合的「代理人 (agents)」,藉此提供自我改進所需的多步驟軌跡 (trajectories) 與回饋訊號。為了達成此目標,在複雜的智能體式任務中擴展強化學習 (reinforcement learning, RL) 的規模,便成為一條具體的路徑。然而,實現此潛力面臨兩大挑戰。首先,針對基礎模型 (foundation models) 的 RL 需要合適的模型架構,以及為代理人提供足夠豐富的探索空間。其次,擴展 RL 規模需要針對基礎設施、環境與評分器 (grader) 提出精密的解決方案。在本報告中,我們推出了 MiMo-V2.6 系列,包含 MiMo-V2.6-Pro,這是一個擁有 1.02 兆 (T) 個參數、其中 420 億 (B) 個為活躍參數的混合專家 (Mixture-of-Experts) 模型,以及 MiMo-V2.6-Flash,這是一個擁有 3100 億 (B) 個參數、其中 150 億 (B) 個為活躍參數的混合專家模型。這些模型旨在彌補上述差距,並在大型強化學習領域邁出實務的一步。

MiMo-V2.6 的架構、預訓練與中期訓練共同建構了一個強大且高效的基礎模型。受限於在低運算成本下仍需保留全域上下文的需求,MiMo-V2.6 採用混合稀疏 MoE Transformer 骨幹,將區域性滑動視窗注意力 (SWA) 與全域注意力 (GA) 交錯結合,並輔以輕量級視覺編碼器與音訊編碼器。此外,大規模預訓練使模型具備廣泛的知識,並能跨文本、音訊與影片展現多模態的通用理解能力。我們進一步引入以代理人為中心的中訓練階段,藉此擴展智能體任務的探索空間,使模型在後訓練期間能發現更有效的任務解決軌跡。

首先,我們透過一個橫跨三個關鍵組件的系統化協同設計架構,來擴展 RL 的運算規模。第一,我們透過全非同步訓練來擴大批次大小與訓練吞吐量,每一步驟即可處理數千個長程 Rollout 與數十億個 Token,且上下文長度可達 1M。第二,我們針對編碼、通用、視覺及網路安全等任務,擴展 RL 環境的多樣性與複雜度,並使用多樣化的代理人 Harness 與強化對抗獎勵駭入的防護機制。同時調整 Harness 與任務內容可提升模型的泛化能力。第三,我們引入組式智能體式評分,以提供超越二元測試案例的更具資訊量的獎勵訊號。我們不再將相同的獎勵分配給所有通過測試案例的解決方案,而是比較各組內的解決方案,以區分問題解決的品質與行為。透過我們提出的組式獎勵合成(Groupwise Reward Synthesis, GRS)與組式優勢重新分配(Groupwise Advantage Redistribution, GAR),這些細粒度區分將被轉換為更具資訊量的學習訊號,引導模型朝向更準確且高效的解決方案發展。

要在大規模環境下實現上述目標,對於基礎設施而言,無論在研究或工程層面都面臨諸多挑戰。為了支援靈活的智能體式互動情境,我們設計了一種統一軌跡代表性與一種罰金機制,兩者共同優化學習訊號。為了處理大型訓練批次,我們透過 Harness 池維持跨多元代理人框架的高並發度互動,並將控制平面與數據平面解耦,以緩衝並傳輸攜帶路由與多模態 Payload 的海量軌跡。樣本混合機制與動態取樣及部分 rollout 配合運作,能穩定訓練批次中各任務的樣本組合。我們將訓練與推論引擎針對 MoE 路由與 top-p 取樣候選集進行對齊,並針對 RL 工作負載優化這兩類引擎。

大幅提升 RL 運算資源能顯著發揮模型潛力,無論是在編碼等可驗證任務,或是網頁開發等較難驗證的任務上皆然。如圖 1 所示,MiMo-V2.6-Pro 與 MiMo-V2.6-Flash 隨訓練步驟增加,在各項報告基準測試中的效能均持續提升。此外,這些進步並非侷限於單一領域,而是橫跨 DeepSWE 上的編碼、AutomationBench 上的通用工作流、MiMo 視覺編碼的視覺任務,以及 MiMo Cyber Bench 上的資安領域,在多樣化任務中皆表現一致。這些成果顯示 MiMo-V2.6 具備更強的複雜問題解決能力,且在日常協作情境中的表現更為可靠,反映出更具通用性的代理式智慧。

為促進代理式 RL 的研究,我們開源了一套完整的工具包,涵蓋了 RL 開發堆疊的關鍵組件,包括輕量級模型 MiMo-V2.6-Distill-Qwen-9B、跨多個領域且附有驗證器的精心策劃任務環境、端對端 RL 訓練框架,以及可組合的 mini-harness,用於靈活的代理人互動。這些組件共同提供了一個統一且易於取得的平台,用於在多樣化的任務、環境與代理人配置下研究代理式 RL,同時降低了重現與擴展大規模 RL 實驗的工程障礙。使用 MiMo-V2.6-Distill-Qwen-9B 進行的實驗顯示,在多種任務與代理人 harness 中皆能獲得一致的 RL 效能提升,驗證了此套件的有效性與普適性。我們期盼這套開源工具能成為社群中公平、強大且可重現的基線,藉此系統性地研究代理式 RL,並推動研究朝向遞迴式自我改進邁進。

2 架構

2.1 整體架構

如圖 2 所示,MiMo-V2.6 採用標準 Transformer (Vaswani et al., 2017) 骨幹,並增強了視覺與音訊編碼器,兩者透過輕量級投影器相互連接。

MiMo-V2.6 的文字骨幹主要由交替使用局部滑動視窗注意力 (SWA) 與全域注意力 (GA) 的混合區塊所組成。它堆疊了 M 個混合區塊,每個區塊的結構為 N 個連續的 SWA 區塊,後接一個 GA 區塊。唯一的例外是第一個 Transformer 區塊,該區塊使用全域注意力與密集型前饋網路 (FFN) 以穩定早期代表性的學習。MiMo-V2.6 使用的滑動視窗大小 W 為 128。SWA 區塊與 GA 區塊皆採用不具共享專家的稀疏 MoE 前饋網路。此外,MiMo-V2.6 整合了基於 SWA 與密集型 FFN 的 MTP (Gloeckle et al., 2024; Liu et al., 2024; Xia et al., 2025) 以提升預訓練期間的模型效能。文字骨幹架構的更詳細描述可參考 Core Team et al. (2026)。模型配置詳見表 1。

2.2 MiMo-ViT

MiMo-ViT 採用混合注意力架構。它將 MiMo-VL-7B (Yue et al., 2025) 中固定的非重疊視窗注意力,替換為槽增強 SWA,藉此在連續層級中實現跨視窗邊界的資訊交換,並緩解視覺碎片化問題。區域性 SWA 層交替使用列主序與行主序 Token 序列化,以支援沿著兩個空間軸的資訊傳播。最後,定期插入 GA 層以直接彙整全域上下文。此設計大幅降低了高解析度視覺處理的計算成本,同時達成與 GA ViT 相當的效能。請參考 He et al. (2026) 以獲得更多分析。為了從零預訓練 MiMo-ViT,我們將其與小型預訓練 LLM 搭配,並僅針對多模態理解資料,使用交叉熵目標來最佳化該 VLM。這種簡單的配方避免了對比學習等輔助目標,使預訓練更具效率且具備擴展性。最重要的是,LLM 仍保持可訓練性,能為 ViT 提供穩定且具語意意義的梯度。在超過 4T

Figure 2

圖 2 MiMo-V2.6 的整體架構。音訊、視覺與文字輸入皆會映射至共享的 Token 序列,並由 MiMo 混合 SWA 骨幹處理,接著再經由語言建模頭與多 Token 預測(MTP)區塊進行處理。

image tokens,MiMo-ViT 學習了強大的視覺表示,並為 MiMo-V2.6 提供了穩健的基礎。

2.3 音訊編碼器

MiMo-V2.6 的音訊編碼包含兩個階段:音訊詞元化與程式碼修補編碼。音訊詞元化編碼器首先透過一個兩層的卷積前端處理對數梅爾頻譜圖,將影格速率減半。接著,產生的序列會傳遞至具備因果混合注意力架構的 Transformer,該架構交替疊加 SWA 與 GA 層。SWA 層負責擷取區域性的時間依賴性,而 GA 層則彙整完整前序序列的上下文資訊。隨後的下採樣卷積會將影格速率進一步減半至 25 Hz,之後由 20 層殘差向量量化器(RVQ)將每個影格表示為 20 個離散音訊詞元。音訊詞元化編碼器遵循 MiMo-Audio(Xiaomi, 2025)的訓練配方,並在涵蓋語音、音樂及其他音訊內容的 2,000 萬小時音訊資料上進行訓練。

音訊 Patch 編碼器的架構設計遵循 MiMo-Audio,並與文字骨幹(backbone)共同訓練。在每個時間步長,音訊 Token 會透過各別的嵌入表(每個 RVQ 碼本一個)進行嵌入,並將產生的嵌入向量加總以形成單一影格(Frame)的代表性。系統會將每四個連續影格組合成一個音訊 Patch,並由具備雙向自注意力的 Transformer 處理,且該自注意力機制僅限於該 Patch 內部。接著將四個輸出的代表性向量串聯,並透過線性投影轉換為單一的骨幹輸入嵌入,將音訊序列的速率從 25 Hz 降低至 6.25 Hz。

2.4 推測解碼器

MiMo-V2.6 中的推測式解碼採用多 token 預測 (MTP) 模組,並遵循 DFlash (Chen et al., 2026) 的區塊擴散設計。草稿模型由 5 層 Transformer 層與密集前饋網路組成。該模型以骨幹的隱藏特徵與乾淨錨點為條件。

BlockConfigurationMiMo-V2.6-FlashMiMo-V2.6-Pro
Main BlockLayers (Total/SWA/GA)48/39/970/60/10
Hidden Size40966144
SWA Heads (Q/KV)64/8128/8
Sliding Window Size128128
GA Heads (Q/KV)64/4128/8
Head Dimensions (QK/V)192/128192/128
Experts (Total/Activated)256/8384/8
# Total Parameters310B1.02T
# Active Parameters15B42B
MiMo-ViTLayers (Total/SWA/GA)28/24/4
Hidden Size1280
Attention Heads (Q/KV)32/8
Head Dimension64
Patch Size (T × H × W)2 × 16 × 16
Sliding Window Size (Left/Right)64/64
Spatial Merge Size2 × 2
# Parameters681M
Audio Tokenizer EncoderLayers (Total/SWA/GA)24/12/12
Hidden Size1024
Attention Heads (Q/KV)16/16
Head Dimension64
Mel Bins128

Sliding Window Size 128
Codebooks 20
# Parameters 308M
Audio Patch Encoder
(音訊 Patch 編碼器)
Layers 6
Hidden Size 1024
Attention Heads (Q/KV) 16/16
Head Dimension 64
Attention Group Size 4
# Parameters 127M
Speculative Decoder
(推測性解碼器)
Layers (Total/SWA/GA) 5/5/0
Hidden Size 4096
SWA Heads (Q/KV) 64/8
Sliding Window Size 1024
GA Heads (Q/KV) 64/4
Head Dimensions (QK/V) 128/128

表 1 MiMo-V2.6-Flash 與 MiMo-V2.6-Pro 的詳細模型配置。主要區塊層數不包含 MTP 模組。編碼器參數數量包含輸入嵌入,但不包含投影器。音訊 Tokenizer 編碼器參數數量不包含 EMA 碼本。

token 後,它在前向傳遞中預測 7 個後續 token,並由骨幹進行平行驗證。所有草稿層均採用分組查詢的滑動視窗注意力 (SWA) 以限制注意力計算與 KV 快取大小。Token 在草稿區塊內雙向關注,並最多關注錨點前 1,024 個骨幹上下文位置。

3 預訓練

3.1 預訓練設定

MiMo-V2.6 的預訓練語料庫涵蓋了文本、視覺與音訊。文本語料庫來源廣泛,包含公開的網頁內容、書籍、學術論文、程式碼以及 STEM 相關教材。視覺語料庫則包含圖像描述、接地 (Grounding)、OCR、GUI、對話、影片與視覺編碼資料。至於音訊部分,我們彙整了大量高品質且多樣化的資料,並將其整理為三種任務格式:語音-文本交錯、自動語音辨識 (ASR) 以及一般音訊描述。

我們採用兩階段預訓練策略。在第一階段,我們使用純文本資料訓練語言骨幹,以建立強大的基礎語言能力。在第二階段,我們將骨幹與內部預訓練的 ViT 以及音訊編碼器整合,並在全模態資料上聯合訓練整個模型,使其具備理解圖像、影片與音訊的能力。

我們首先以 32K Token 的上下文長度開始進行預訓練,並在訓練過程中將其擴展至 256K。MiMo-V2.6-Flash 在 48T Token 上進行訓練,其中文字階段包含 26T Token,全能階段則包含 22T Token。MiMo-V2.6-Pro 則在 30T Token 上進行訓練,其中兩個階段分別包含 27T 與 3T Token。我們在 MiMo-V2.6 的預訓練中採用 AdamW 優化器。

3.2 中訓練設定

預訓練建立廣泛的知識與跨文本、視覺及音訊領域的通用理解。中訓練則銜接此通用基礎與後續的大規模 RL,進一步發展模型的智能體能力、擴展長上下文支援,並調整大型批次訓練的最佳化設定。

為此,我們在多樣且以智能體為中心的資料混合比例上訓練 MiMo-V2.6 模型系列。其多樣性橫跨任務領域與資料模態,結合了編碼、通用、視覺及研究任務中具真實感的智能體軌跡,以及高品質文本、倉庫層級程式碼,以及影像、影片與音訊資料。訓練分為兩個階段:首先以 256K 的上下文長度進行訓練,並將大部分運算資源分配至此階段;接著在最後階段將上下文長度擴展至 1M。

我們的基礎模型使用 AdamW 進行預訓練,但初步實驗顯示,在混合任務強化學習(mixed-task RL)中,隨著批次大小(Batch size)增加,最佳化效率會逐漸下降。與僅針對參數進行逐元素(element-wise)調整的 AdamW 不同,Muon 透過將隱藏權重(hidden weights)的更新正交化(orthogonalizing),善用了權重的矩陣結構(Jordan et al., 2024)。這種基於矩陣的更新(matrix-based update)在臨界批次大小區間(critical-batch-size regime)之外仍能保有較佳的資料效率,因此 Muon 特別適合用於大規模批次訓練(Liu et al., 2025b; Shah et al., 2025)。因此,我們在中訓練(Mid-training)階段切換至 Muon 最佳化器的變體 Muown,針對隱藏權重矩陣進行處理,以利後續的大規模批次強化學習。Muown 在 Muon 的基礎上加入了明確的列範數控制(row-norm control),能有效減輕譜範數漂移(spectral-norm drift),並降低對權重衰減(Weight decay)的敏感度,且額外負擔極低(Lion et al., 2026)。嵌入(Embedding)、LM head 以及 MoE 路由器(Router)則持續使用 AdamW。

先前研究指出,將 Adam 預訓練模型切換至 Muon 訓練可能會導致優化器不匹配並降低效能 (Qu et al., 2026)。然而,在我們的中訓練過程中,我們發現整個訓練過程並未出現損失尖峰。

我們在中訓練期間採用 MXFP4 量化感知訓練 (QAT),讓模型在適應低精度計算的同時,仍能維持模型品質。

Figure 3

圖 3 左:DeepSWE v1.1 的平均@3 分數與累積強化學習成本對比。右:MiMo-V2.6-Pro 與 MiMo-V2.6-Flash 的訓練、rollout 與評分器成本佔比。

4 強化學習的規模化

在此版本中,我們持續推動後訓練演算法的邊界,並特別著重於擴展 RL 計算量。在短暫的監督式微調 (SFT) 階段之後,我們從三個維度擴展 RL:訓練計算 (§4.1)、環境與代理人 harness (§4.2),以及評分器計算 (§4.3),藉此實現模型能力的根本性躍進。

4.1 強化學習訓練計算量的擴展

我們在單次執行中擴大 RL 計算規模,橫跨數千台 GPU,分別在 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 的 RL 後訓練上花費 2.6M 和 0.9M。我們採用大型訓練批次:1,568 個提示,群組大小 $G = 16$,因此每個步驟會展開 25K 個序列,總計產生 2.7B 至 3.7B 個訓練 Token(每個序列約 110K 至 150K 個 Token)。圖 3 左側面板展示了擴大 RL 計算規模的好處。在 DeepSWE 基準測試(Huang and Jiang, 2026)中,這兩個模型的平均@3 分數隨累積成本穩定提升:在 RL 過程中,MiMo-V2.6-Pro 從 58.4 提升至 72.6,而 MiMo-V2.6-Flash 則從 48.7 提升至 65.7。計算過程分為三個部分:rollout、評分與訓練。這種擴張需要穩固的基礎設施,以確保訓練過程高效且穩定。

我們將 RL 學習目標定義如下:

$$ \mathcal{L}(\theta) = -\mathbb{E}_{q \sim \text{D}_d, \{o_i\}_{i=1}^G \sim \text{\textbf{\textit{mu}}}_{\text{old}}}(\cdot|q) \left[ \frac{1}{\sum_{i=1}^G |o_i|} \sum_{i=1}^G \sum_{t=1}^{|o_i|} r_{i,t} M_{i,t} A_i \log \text{\textbf{\textit{pi}}}(o_{i,t} | q, o_{i,<t}) \right], \quad (1) $$

其中 $r$ 表示重要性取樣比,$M$ 是 token 層級的遮罩,而 $A$ 則是優勢。此運算可分解為三個部分。第一部分為 rollout:針對從任務資料集聯集 $\cup_d \mathcal{D}_d$ 中抽取的每個提示 $q$,rollout 策略 $\text{\textbf{\textit{mu}}}_{\text{old}}$ 會產生一組 $G$ 個候選解 $\{o_i\}$。第二部分為評分:我們投入額外的運算資源進行智能體式評估,以區分有效的解與行為,而不僅僅是依賴二元測試結果。這些判斷會影響優勢 $A_i$,進而實現跨軌跡更精確的信用分配。第三部分為訓練:所收集的 tokens 會透過以下方式更新 $\theta$:

$\log \pi_{\theta}(o_{i,t} | q, o_{i,<t})$ 的梯度,並採用提示平均聚合。圖 3 右側面板分析了 MiMo-V2.6-Pro 的成本分配:rollout 佔 43.8%,訓練佔 43.5%,而評分器則佔剩餘的 12.7%。我們使用大批次從跨越多種環境與 Harness 的多樣化 RL 任務中取樣(第 4.2 節)。此外,我們也擴充了評分器的規模,以提供更細緻的學習訊號(第 4.3 節)。

使用大批次有助於擴充 GPU 規模:Rollout 會針對序列進行平行化,並將批次分配至資料平行秩 (data-parallel ranks) 進行訓練,因此吞吐量會隨 GPU 數量增加。由於 HBM 大部分空間已由執行中的批次佔用,我們能維持高算術強度,以充分利用 GPU 進行 rollout。由於 rollout 與評分 (grading) 具有長尾特性,我們採用部分 rollout (Kimi Team, 2025) 來保持執行中的批次飽和:在收集訓練批次時,我們會讓進行中的序列保持中斷狀態,並在下一個 rollout 相位中恢復。其代價在於重新預填充 (re-prefill):在每次策略更新後,續寫 (continuation) 必須重建其 KV 快取,因此批次大小與部分 rollout 必須共同決定——大批次能攤銷重新預填充的成本。為了支援穩定的 RL 訓練,我們透過 R3 (Ma et al., 2025) 確保訓練與推論的一致性,並重播 top-$p$ 採樣候選集 (Liu et al., 2025a; The Microsoft AI Team, 2026)。為了確保所有樣本都能貢獻有效梯度進行訓練,我們納入動態採樣器 (Yu et al., 2025) 來過濾掉全數通過或全數失敗的群組。在多工 RL 中,我們實作 樣本混合器 (Sample Mixer),以確保在各種 rollout 持續時間與不同任務的通過率下,能有效且穩定地分配訓練批次。為了將 rollout 產生的軌跡打包成大型訓練批次 (2.7B–3.7B tokens),我們將資料平面 (data plane) 與控制平面 (control plane) 解耦。這些設計背後的基礎設施詳述於第六節。

4.2 強化學習環境與 Harness 的擴展規模

擴展智能體式 RL 需要多樣化的環境,以反映現實世界的任務、支援訓練規模下的可重現執行,並提供與任務目標一致的獎勵。同時滿足這些需求極具挑戰性:現實的工作流涉及異質工具與複雜狀態,而自動評分器可能不完整、不一致,或容易被鑽漏洞。因此,我們投入大量資源進行大規模環境合成與策展,涵蓋程式設計(§4.2.1)、一般專業工作流(§4.2.2)、視覺產物(§4.2.3)及網路安全(§4.2.4)領域,並強調監督品質。本節說明我們如何建構這些領域的任務與環境、代理人與之互動的 Harness(§4.2.5),以及用於提升獎勵可靠性並在訓練前後緩解獎勵駭入的執行檢查、基於 rollout 的審計與對抗性測試(§4.2.6)。

4.2.1 程式代理人任務

程式編碼任務特別適合使用 RL,因為候選解可以透過自動化測試執行與評估,進而提供大規模的回饋。然而,僅靠可執行評估並不能保證監督的可靠性:測試可能遺漏必要的行為、拒絕有效的實作,或在多次執行中產生不一致的結果。因此,核心挑戰在於如何在擴大任務建構規模的同時,確保獎勵能忠實反映任務的正確性。受此啟發,我們投入大量心力建構一個可擴展的合成與策展管線,專注於提升監督的準確度與穩健性。圖 4 彙整了任務合成路徑,以及用於評估監督準確度與穩健性的各項檢查。

從多元來源進行可擴展的任務合成 我們透過五種互補的合成路徑來擴大任務建構的規模,旨在涵蓋異質程式語言與開發環境。

Figure 4

圖 4 整體程式代理人任務擴展管線。我們從多元來源建構任務,並經過嚴格的評估階段,以確保監督的準確性與穩健性。

設定與任務時界。首先,在「基於 GitHub 的合成」中,我們會收集合併請求及其相關問題,並應用啟發式與模型輔助篩選器,以移除重複、格式錯誤或不可重現的候選項目。當合併請求連結到一個能充分描述預期變更的問題時,我們會將該問題作為任務規格。否則,LLM 會從參考修補程式與周圍儲存庫上下文重建問題風格的規格,同時明確指示其省略可能揭露解決方案的實作特定細節。其次,為了捕捉包含互動式「氛圍式編程」情境在內的「日常開發工作流」,我們會收集組織內部員工貢獻的真實開發請求。這些請求涵蓋功能實作、重構、除錯及儲存庫維護等常見活動,並由代理人生成並實作測試案例,以將請求的行為具體化。第三,「規格驅動任務」強調在詳細且多約束需求下進行程式碼生成,讓我們能評估模型是否能忠實地將複雜規格轉化為可執行的實作。第四,在「源碼驅動合成」中,我們使用 CodeMidas (Ye et al., 2026) 從現有程式碼庫中實作的功能推導任務。

代理人會識別候選功能,並將其可觀察行為轉化為任務規格與可執行的環境,此路徑讓跨越多樣化儲存庫的任務建構得以擴展,且無需發行追蹤 (issues)、拉取請求 (pull requests) 或其他開發產物。針對長時程的軟體工程任務,代理人會迭代地詳述任務需求、擴大所需變更的範疇、在元件間引入相依性,並建構用以測試最終多步驟行為的測試案例。我們也從公開來源 (Badertdinov et al., 2026; PrimeIntellect, 2026; Tao et al., 2026; Yang et al., 2026b; Zan et al., 2025; Zhao et al., 2026) 及授權資料供應商中收集並篩選樣本,以進一步豐富任務分佈。整體而言,這些路徑產生的任務涵蓋了廣泛的程式語言、開發情境、實作複雜度與任務時界。

監督準確度 我們將各項任務規格的行為範圍與其單元測試的行為範圍對齊。目標是接受符合規格的實作,並拒絕違反規格的實作,且不需參考實作的附帶細節。我們審查任務是否存在覆蓋率不足或過於嚴苛的檢查。具體而言,會修正或移除強制執行規格中未提及要求的測試。僅憑人工檢查可能無法發現

在規格與測試之間出現不一致的情況下,我們進一步透過基於推演的稽核來評估其對齊程度。每個任務都會由程式碼智能體嘗試執行四次。稽核代理人會在共享工作空間中接收所有四次推演,該空間包含問題陳述、測試項目、參考修補、以及每次推演提交的修補、測試輸出與完整的對話紀錄。稽核代理人首先說明正確解決方案所需具備的條件,並評估測試項目是否涵蓋了這些要求。接著,它會根據修補與對話紀錄,利用規格來評估每個提交的解決方案,並將此評估結果與觀察到的獎勵進行比對。若被判定為通過的解決方案實際上被認為不正確,則會被標記為潛在的偽陽性,顯示驗證可能不夠完善。若被判定為失敗的解決方案實際上被認為正確,則會被標記為潛在的偽陰性,顯示測試過於嚴苛或執行過程出現失敗。這些分歧有助於識別需要進一步審查的任務,並為預期行為與實作驗證之間可能存在的落差提供具體證據。

監督穩健性 我們透過重複執行來檢查獎勵穩定性。針對具備參考程式碼修補(Patch)的任務,我們確保在套用參考修補前,必須讓「由失敗轉通過」(F2P)測試失敗,且「維持通過」(P2P)測試必須通過;套用修補後,兩者都必須通過。我們要求這些結果在八次重新執行中保持穩定,藉此篩選出不穩定測試與環境引起的獎勵波動。我們也重複使用先前的 rollout 管線來收集代理人軌跡,以調查潛在的獎勵駭入行為。提交的程式碼修補與對話紀錄提供了代理人獲取獎勵的證據,有助於識別非預期的捷徑或對環境與評估流程的漏洞利用。這些檢查補充了對解決方案正確性的評估,並為下文所述更廣泛的獎勵駭入緩解程序提供參考。

這些程序共同支持在一致的監督品質標準下,建構一個多樣化的程式編碼任務語料庫。規格測試對齊(Specification-test alignment)旨在提升獎勵訊號的忠實度,重複的執行檢查(execution checks)則用於確保其穩定性,而基於推演的稽核(rollout-based auditing)則探測獎勵訊號是否與對解決方案正確性的獨立評估結果一致。我們的目標是使這套組合具備可擴展性,讓強化學習(RL)訓練能受益於廣泛的任務覆蓋率,同時引導代理人滿足預期需求,而非利用評估漏洞。

4.2.2 一般代理人任務

我們將代理人的能力擴展至多元領域的現實專業工作流,這些工作流要求代理人分析異質文件、使用專業軟體,並產出符合領域特定標準的交付物。我們合成支援此類工作流的環境,接著建構具備可驗證結果的具挑戰性任務。圖 5 總結了此管線,包含環境建構、任務合成以及迭代式評分準則精煉。

環境設計 一個通用代理人環境通常由工作空間與一組軟體工具組成,並可透過 MCP、API、CLI 與 GUI 等介面存取。我們的設計在擬真性與大規模 RL 的需求之間取得平衡:檔案、軟體行為與底層資料應反映專業實務,而執行則必須保持在本地,且環境必須易於重置。因此,我們收集現實世界的檔案以供直接納入,或作為合成的參考依據,並使用自動化多代理人工作流程來建置本地軟體模擬,以重現支援的操作、狀態變更、輸出格式與錯誤回應。那些本身不需外部服務即可運作的工具則直接整合。所有狀態均儲存於本地,且每次 rollout 都在隔離沙箱中執行,並可還原至固定的初始狀態。這能避免網路變異性與服務限制,同時支援可重現的執行。

Figure 5

圖 5 整體通用代理人環境與可驗證任務合成管線。我們首先利用真實世界的檔案與軟體模擬,建構出逼真且可重置的環境。接著,代理人探索這些環境,並合成具備可驗證評分準則的任務。

環境合成 為了將這些元件組合成連貫的情境,規劃代理人會指定工作空間結構、選擇合適的工具,並規劃檔案與資料庫的內容。網頁搜尋將計畫與現實世界的資訊連結,而檔案間以及檔案與資料庫紀錄之間的關聯,則支援後續的多跳推理與交叉驗證。接著,多個代理人會依據共享計畫與各個模擬案例的資料規格,平行地產生檔案並填入資料庫。審查代理人會檢查個別產物與全域一致性,包含實體名稱、數值對帳、時間軸與引用。在任務建構前,透過迭代式修復來解決不一致之處。工作空間與工具配置會因情境而異,因此每個環境都能反映相關的工作實務,而無需包含所有可用的檔案類型或軟體介面。

任務合成與驗證 我們調查常見的專業任務,並將其彙整與泛化為種子任務。代理人會探索各個環境,並利用這些種子任務建構出適合其內容與工具的任務。任務完成情況是使用原子化且二元的評分準則項目來進行評估:以程式碼為基礎的檢查會驗證決定性屬性,例如資料庫值與交付成果的格式;而以 LLM 為基礎的檢查則用於評估更具開放性的內容。針對 LLM 為基礎的項目,透過相同模型在重複判斷中的一致性,以及不同裁判模型之間的共識,有助於識別其中的模糊性。

僅靠一致性並不足以證明評分準則能準確捕捉任務完成情況。因此,我們收集了不同能力等級模型的 rollout,並由審核代理人(reviewer)檢視其軌跡、執行結果與評分準則的判斷。審核者會修正過於嚴苛、導致正確解被拒絕的標準,以及過於寬鬆、接受不完整解的標準。為了測試對獎勵駭入(reward hacking)的抵抗力,我們加入了負面檢查,以偵測對無關檔案或資料庫的非預期變更,並建構出在表面上看似正確,但實際上並未解決任務的對抗性解。在強化學習(RL)過程中,自建的 MiMo-V2.6-SFT 模型負責擔任評分器,以支援穩定的評分。此流程產生了數千個環境與多樣化的可驗證任務,我們將其與其他任務結合,用於強化學習訓練。

4.2.3 視覺代理人任務

為了讓代理人能透過創意表達與精確的視覺控制來塑造數位世界,我們彙整了一套多元的視覺任務,讓代理人能與各類產物互動,例如網站、互動式應用程式、遊戲、3D 場景、簡報、SVG、影片及 Figma 設計。我們將這些任務分為兩個互補的類別:開放式設計與高忠實度視覺複製。這兩者共同提升了模型產出具備強烈美學品質與精確視覺控制之可靠實作的能力。

開放式設計旨在產生兼具美感且符合使用者意圖的視覺產物。由於有效的創意解決方案具備高度多樣性,僅靠固定規則難以精確衡量其美感品質。因此,我們結合了逐點評分與群組評分機制,在建立一致的品質標準之餘,也能針對美感品質的相對提升給予獎勵。具體而言,我們首先透過迭代方式,優化針對執行正確性、指令遵循度、版面完整性及基本美感品質的逐點評分準則。待這些準則趨於穩定後,再導入群組評分機制,針對同一查詢在每個 rollout 群組中呈現的產物進行聯合比較,藉此辨識出明顯較佳與較弱的候選項目,並據此分配獎勵。

高忠實度視覺複製旨在忠實重現指定的視覺目標。相較於開放式設計,明確的參考資料能更直接地評估視覺忠實度。我們主要透過規則導向的相似度指標(例如渲染偽影與參考資料之間的像素級相似度)來評分這些任務,並輔以 LLM 判斷以進行整體的視覺評估。這些訊號的結合,有助於強化學習在視覺複製任務中的有效擴展。

4.2.4 網路安全代理人任務

我們使用 RL 在真實世界的漏洞重現情境下訓練網路安全代理人:給定一個專案與目標漏洞,代理人必須建構一個能觸發該漏洞的輸入。這項基礎的攻擊安全技能是開發漏洞、權限提升以及 CTF 挑戰的核心。此外,這項任務非常適合大規模應用 RL;OSS-Fuzz 提供了數萬個經人工確認的實例,其規模遠超過其他安全任務。困難點不在於觸發當機,因為複雜的 C/C++ 專案通常有多條可達成的當機路徑,而在於觸發「特定」的漏洞。因此,驗證機制必須將目標漏洞與無關的當機區分開來,且由於驗證同時作為 RL 的獎勵,其結果必須準確、具備確定性且成本低廉。

現有的 Oracle 仍有不足。CyberGym (Wang et al., 2025) 中使用的「Fix-binary 差異化測試」僅接受能使受測二進位(binary)崩潰,但無法使修補後二進位崩潰的 PoC。若修補不完整,會導致正確的 PoC 被拒絕;而兩個版本間不相關的變更,則可能導致裁定(verdict)翻轉,且原因與漏洞無關。這兩種錯誤都會損害訓練梯度。而「以 LLM 為基礎的評分」在不同執行次數中,對於相同的 PoC 可能得出不同的裁定,因此無法作為穩定的獎勵(Reward)。我們改為從原始的消毒器(Sanitizer,如 ASan/MSan/UBSan)報告中擷取兩個屬性:漏洞類型(例如:heap-buffer-overflow)與 崩潰位置(專案層級的最高層堆疊影格)。若 PoC 的崩潰情況在規則導向的字串比對下符合這兩個屬性,則判定為有效。這種方式具備確定性、可重現性,且運算成本微乎其微。任務描述同樣從該報告中擷取,明確指出崩潰必須發生的確切類型與函式,因此描述與驗證皆共享單一的真實來源(source of truth);相較之下,CyberGym 的 LLM 產生的描述往往過於籠統(例如:「libxml2 中的緩衝區溢位」),或甚至完全錯誤。

針對每項漏洞,我們會檢查報告的 commit 原始碼、建置模糊測試 Harness,並提供完整的執行環境給代理人:包含完整的原始碼與編譯後的 Harness 二進位檔。CyberGym 會保留二進位檔,限制代理人只能進行原始碼分析;這能更貼近真實的漏洞分析情境,研究人員在該情境下會執行目標程式並搭配除錯工具,檢查記憶體內容,並根據執行時的觀測結果製作突變。

4.2.5 多 Harness 訓練

代理人 harness 在模組設計上各有不同,且是為了滿足不同的應用需求而選用或建置。因此,模型必須適應多樣的互動機制,包括在訓練期間未曾見過的 harness,這使得跨 harness 泛化成為一項重要的能力。

僅在單一 Harness 中進行訓練,可能會使任務解決策略與該 Harness 的特定實作產生綁定,進而限制遷移能力。因此,我們將 Harness 多樣性視為與任務及環境多樣性並列的額外訓練維度。一種自然的方法是針對 MiMo Code 和 Codex 等多個生產環境進行訓練。然而,在實務上,這對 RL 而言並非理想選擇。首先,生產環境會以工程安全機制與多步驟工作流包覆代理迴路,並透過大量的約束與指令提示來引導模型。這些額外元素都超出任務完成的獎勵訊號範圍,導致信用分配變得不可靠,並使獎勵未測量的需求被直接忽略。其次,其模組之間緊密耦合,而非獨立可配置,因此無法單獨調整單一互動機制,也無法透過受控的重組來建立多樣性。

為了達成此目標,我們提出採用精心設計的 mini-harnesses 進行多 harness 訓練。所有 mini-harnesses 皆源自相同的最小代理迴路,其中已包含完成任務所需的所有組件:系統提示、工具與情境管理。這些模組保持最小化且解耦,因此實作方式可以自由重組,並確保 harness 的擴充過程能維持在可控、安全且乾淨的狀態。接著,我們為 Code、General、Visual 與 Cyber 等領域推導出多樣化且經任務適應的 mini-harness 配置。產生的訓練分布既多樣又可控,支援對個別 harness 機制的分析,並鼓勵具備可遷移性的任務解決策略。

4.2.6 獎勵駭客緩解

強化學習 (RL) 仰賴獎勵來衡量任務成功率,但代理人 (Agent) 有時會透過鑽環境或評估流程的漏洞來獲取高額獎勵。這種行為稱為獎勵駭入 (Reward hacking),可能在訓練過程中被強化,導致分數提升卻未改善任務效能。以儲存庫修復 (repository-repair) 等常見程式碼智能體 (Coding Agent) 任務為例,一種常見的失效模式是解答洩漏 (solution leakage):代理人取得超出預期任務上下文的公開修補方案,並將其用於建構程式碼修補 (Patch)。表 2 將每個任務請求與代理人的陳述意圖及其後續動作,連結至五個儲存庫中的情況。此類行為可能在僅依賴測試結果的獎勵機制下獲得滿足,卻無法證明代理人是從錯誤報告與指定的檢查版本 (checkout) 中推導出修復方案。隨後,我們將介紹一種緩解措施,結合中期訓練 (Mid-training) 對齊資料、強化學習環境的準備、對抗性篩選以及全訓練過程的稽核。

中訓練對齊資料在早期實驗中,我們觀察到 MiMo 傾向於進行獎勵駭客攻擊(reward hacking)。為了減輕這種行為,我們從這些案例中合成了一組訓練範例,並將其納入中訓練階段。針對每個案例,MiMo 會反思錯誤的推理,修正相關的回合內容,並繼續執行基於任務規格(task specification)的動作。修正後的推理保留了原始錯誤的特徵,並使修正過程變得顯而易見。我們發現,加入這些範例能有效提升模型的對齊程度。

環境準備在程式編碼任務中,代理人可能會透過從環境中復原洩漏的解答,或經由網路檢索現有解答來通過測試。建置專案時

---``` ```

表 2 儲存庫修復任務中具代表性的獎勵鑽漏洞案例。在此情境下,檢索指派的快照以外的現有修復方案,即可繞過預期的修復任務。任務查詢已彙整摘要,思考摘錄則逐字引用,動作則以縮寫表示。每一列皆來自單一 rollout。

在環境建構過程中套用的參考修補程式(Patch),可能會留下揭露解法的偽影(Artifact)。因此,我們會移除建置紀錄、驗證器(Verifier)輸出、剩餘修補程式,以及可能洩漏解法的專案產生物(Artifact)或位元組碼(Bytecode)。我們也會清除可能包含解法資訊的快取,包括儲存庫(Repository)以外的快取,同時保留離線重建所需的第三方相依性。針對每個任務,我們會保留從基準提交(Base commit)到當前提交的 Git 紀錄,並移除後續提交及其相關參考。我們強制執行容器層級的網路隔離,以限制存取上游修補程式或可能包含解法的替代套件版本。這些防護措施並附有明確指示,禁止擷取現有解法或規避必要的實作要求。

攻擊代理人接著針對準備好的環境進行偵測,以找出剩餘的漏洞與可利用的弱點。我們引導其搜尋時,參考了早期實驗的範例,包括從快取偽影(cached artifacts)或預先安裝的目標專案副本中復原解決方案。該代理人在檢查這些已知路徑的同時,也會搜尋新的路徑。它發現了許多在訓練過程中未曾觀察到,且現有清理程序也未涵蓋的漏洞路徑。我們利用這些發現來優化清理與存取限制,接著再次執行攻擊代理人。

Figure 6

圖 6 獎勵駭客防範與監控。(a) 在訓練前進行環境準備與迭代式駭客代理人篩選,同時透過離線軌跡稽核監控訓練期間的駭客行為。兩個階段的發現皆用於改進環境。(b) 上方:清理回合中發現可被駭入的環境比例。下方:最終 RL 執行過程中,偵測到獎勵駭客行為的軌跡比例。

更新後的環境。隨後的檢查不斷揭露更多弱點,需要進行額外的清理與測試。我們持續此流程,直到駭客代理人已無法在任何環境中找到可利用的漏洞。

訓練期間稽核 我們在訓練過程中,會定期離線稽核代理人軌跡以檢查是否存在獎勵駭客行為。隨著策略演進,系統可能會發現先前對抗性篩選中未察覺到的捷徑。我們利用這些觀測結果來識別環境的弱點,並據此引導後續的清理與存取限制。除了離線稽核,群組式智能體式評分器(第 4.3.2 節)在重新計算群組統計數據與優勢之前,會將已確認的駭客軌跡有效獎勵設為零。在實施此修正後,MiMo-V2.6-Flash 與 MiMo-V2.6-Pro 在整個訓練過程中,已確認的駭客行為比例均維持在 2% 以下(圖 6)。

4.3 組式智能體式評分

針對程式代理人任務,二元測試獎勵雖然能提供具備擴展性的正確性訊號,但無法區分通過方案之間的實作品質或問題解決行為。我們針對這些任務的不同子集,採用兩種互補的方法。針對一組高通過率任務,我們使用組式獎勵合成 (GRS)。它透過比較多個離線 rollout 來建構任務特定的評分準則,並在訓練過程中重複使用這些準則來評分個別 rollout,將其品質分數與測試獎勵結合。至於其餘所有程式代理人任務,我們主要依賴組式優勢重分配 (GAR)。其線上智能體式評分器會共同檢視每個混合結果群組中的成功與失敗軌跡,對通過方案進行排名,並將正向優勢重新分配給品質較高的通過軌跡。圖 7 總結了這兩種工作流。

Figure 7

圖 7 程式代理人 RL 的組式智能體式評分。(a) 組式獎勵合成將測試結果與預先計算的任務特定評分準則(Rubric)的每回合(rollout)分數結合。(b) 組式優勢重新分配會線上比較軌跡(trajectories),將已確認的作弊獎勵重設為零,並重新分配序列層級的優勢。長條圖示意了從較低品質的通過解決方案到較高品質的通過解決方案,正向優勢重新分配的情形。

4.3.1 群組智慧獎勵合成 (GRS,離線評分準則)

針對每個選定的任務,我們會收集多個離線 rollout,並要求代理人與任務規格及程式碼庫一同研究這些 rollout。比較這些嘗試可以揭示不同的解決方案、常見錯誤,以及可能分散在多個軌跡中的實用行為。代理人會將此分析轉化為兩組評分準則:評估最終實作結果的「解決方案評分準則」,以及評估代理人如何處理與驗證其工作的「行為評分準則」。

解決方案評分準則描述了良好實作方案中與任務相關的特性,包括符合需求、妥善處理邊緣案例,以及與周圍程式碼庫一致的變更。行為評分準則描述了支援可靠問題解決的可觀察做法,例如蒐集相關證據和檢查程式碼變更的影響。我們尋求能夠區分品質差異的標準,同時允許針對該任務採用不同的有效方法。

從採樣 Rollouts 中取得的資訊可用於建構評分準則,但這些準則仍須根基於任務本身。有用的行為可能僅出現在單次嘗試中,而任務所支持的要求也可能在所有觀察到的解決方案中皆不存在。因此,代理人仍能識別出超越採樣 Rollouts 所示範的改進之處。同時,單一成功解決方案所採用的選擇,並不會自動成為其他所有方案的必要條件。

產出的評分準則會被重複用於個別評估後續的訓練 Rollouts。評分器代理人會進入每個 Rollout 的執行環境,並根據任務特定的評分準則進行評估,將產生的程式碼、執行結果與軌跡作為證據。系統會為實作品質指派一個解決方案分數 $S^{\text{sol}}$,並為代理人處理與驗證工作的方式指派一個行為分數 $S^{\text{beh}}$。

針對軌跡 $i$,令 $R_i^{\text{test}}$ 代表原始的二元測試獎勵。我們將此測試獎勵與兩個評分準則分數相乘,藉此合成最終的訓練獎勵:

$$ R_i = R_i^{\text{test}} \cdot S_i^{\text{sol}} \cdot S_i^{\text{beh}}. \qquad (2) $$

這種乘法形式將評分準則監督與測試結果連結。失敗的軌跡仍維持零獎勵,而通過的軌跡則進一步依據實作品質與問題解決行為進行區分。即使同一組中的所有 rollout 皆通過測試,兩個評分準則分數的乘積差異仍可提供學習訊號。因此,離線任務分析便成為可重複使用的監督來源,讓訓練得以捕捉二元測試獎勵未能表達的品質差異。

4.3.2 群組式優勢重新分配 (GAR,線上評分)

我們針對剩餘的程式碼代理人任務,應用線上群組優勢重新分配(online groupwise advantage redistribution)。針對每個混合結果的 rollout 群組,我們將所有軌跡置於共享工作空間中,其中包含任務規格、儲存庫、提交的修補程式以及測試輸出。一個經過 SFT 訓練的智能體式評分器(agentic grader)會共同檢視群組內的所有軌跡,對比成功與失敗的嘗試,並根據五個維度評估通過的修補程式:解決方案方法的適用性、執行該方法時不遺漏或不進行不必要回退的精確率、相對於必要變更的最小化程度、避免任務範圍外的非預期影響,以及符合程式碼庫規範的工藝品質。這些評估結果會引導群組排名,若差異不明顯則視為平手。評分器可以檢查儲存庫程式碼並執行針對性測試,以更深入了解任務並驗證候選解。當證據顯示軌跡依賴外部或洩漏的答案時,我們會將該軌跡的有效獎勵重設為零,並將其視為失敗,然後重新計算群組統計數據。

我們利用剩餘的品質排名重新分配序列層級的優勢。對於軌跡 $i$,令 $R_i$ 為修正駭客問題後的有效二元獎勵,$\bar{R}$ 為其群組平均值,$A_i = R_i - \bar{R}$ 為其序列層級優勢,且 $\mathcal{P} = \{i : R_i = 1\}$。當 $\mathcal{P}$ 非空時,品質因子 $f_i \in (0, 1]$ 會先調降較低品質的通過次數,隨後再由一個共同因子將移除的正優勢質量重新分配給通過的軌跡。未受上限限制的更新式如下:

$$ \lambda = \frac{\sum_{j \in \mathcal{P}} A_j}{\sum_{j \in \mathcal{P}} f_j A_j}, \qquad A'_i = \begin{cases} \lambda f_i A_i, & i \in \mathcal{P}, \\ A_i, & i \notin \mathcal{P}. \end{cases} \qquad (3) $$

這項未受上限限制的更新會保留 $\sum_{i \in \mathcal{P}} A'_i = \sum_{i \in \mathcal{P}} A_i$ 與品質誘導的相對權重,且不會更動失敗軌跡。實際上,這會將正向優勢質量從較低品質的成功軌跡,重新分配至較高品質的成功軌跡。單純降低正向優勢的權重會使負向優勢維持不變;重新正規化則能作為防範過度熵增長的保障,藉此恢復兩者間的平衡。在實務上,我們會將常見的再縮放因子設定上限,以防止正向優勢過度放大。接著,我們會從通過與失敗軌跡的優勢中減去群組平均值,得出最終序列優勢 $A_i^{\text{new}}$,並使其群組平均值為零。我們將此序列層級的優勢廣播至軌跡中的所有回應 Token。評分程序以非同步方式執行,若評分器輸出無效,則會回退至原始優勢。

為了評估線上分組優勢重新分配對訓練動態的影響,我們比較了具備與不具備此功能的 MiMo-V2.6-Flash 程式碼專用 RL 執行結果,並使用 128 的訓練批次大小與 Token 平均損失聚合(圖 8)。若未使用線上分級,回合數與總 Token 數

Figure 8

圖 8:在 DeepSWE v1.1 上,使用 MiMo-V2.6-Flash 進行僅限程式碼的 RL(訓練批次大小 128),比較有無啟用線上群組優勢重新分配(online groupwise advantage redistribution)的結果。通過率為 avg@n,其中 n = 3;我們亦報告回合總數與總 Token 長度的平均值。

軌跡長度快速增長,導致更多軌跡達到長度限制,使得提升通過率變得困難。透過線上評分,在第 52 步之前都能持續提升通過率,而回合數大致維持穩定,Token 長度則逐漸增長。這些趨勢顯示,線上評分有助於在更穩定的訓練制度下持續優化策略。

分別針對維護人員進行的稽核發現,在提升測試通過率的壓力下,未經線上評分的政策越來越常採用不理想的行為,例如推測性相容分支、廣泛的匯出、例外吞沒、放寬驗證以及特定於評估的配置變更。這些變通方法旨在提高通過測試的可能性,但可能會超出任務指令的範圍、不必要地擴充 API、掩蓋失敗,並使程式碼更難以維護。相較之下,採用線上評分訓練的政策傾向於產生較小且更精確的修補程式,且能維持在要求的範圍內,並更易於維護。

4.3.3 行為正規化

為了提升 RL 訓練的穩定性並鼓勵高效且可靠的行為,我們引入了兩種互補機制。組相對長度懲罰 (Group-relative length penalty) 可抑制過度的 Token 增長,而片段層級的行為懲罰 (Segment-level behavioral penalties) 則用於處理格式違規與工具呼叫錯誤。批次層級的優勢再平衡 (Batch-level advantage rebalancing) 改善了信用分配,同時限制了可能導致不受控熵增長的過度負向最佳化壓力。

組相對長度懲罰 我們發現,採用組相對長度懲罰 (Group-Relative Length Penalty) 可以提升泛化 (Generalization) 能力,並抑制在強化學習 (RL) 訓練過程中產生的 Token 數量快速增長。針對每個提示 q,若有 G 次取樣 Rollouts,令 $R_i$ 為原始結果獎勵 (Outcome Reward),$\mathcal{P}_q$ 為成功 Rollouts 的索引,且 $\ell_i = |o_i|$ 為產生的 Token 數量。令 $A \in [0, 1]$ 為最低組通過率,且 $B \in (0, 100)$ 為百分位參數。對於通過率 $|\mathcal{P}_q|/G > A$ 的組別,我們計算參考長度 $\ell_q^* = \text{Quantile}_{B/100}\{\ell_j : j \in \mathcal{P}_q\}$,並得到調整後的獎勵

$$ \tilde{R}_i = R_i - 1[i \in \mathcal{P}_q] X \left[ \text{clip} \left( \frac{\ell_i / \ell_q^* - 1 - \delta}{s - \delta}, 0, 1 \right) \right]^\gamma . \quad (4) $$

這裡 $X \ge 0$ 是最大獎勵扣除額,$\delta \ge 0$ 是容許的相對超額(相對於 $\ell_q^*$),$s > \delta$ 是懲罰開始飽和的超額值,而 $\gamma \ge 1$ 是斜率指數;當 $\delta = 0$ 時,會對長於參考長度的成功 rollout 進行懲罰。指標函數 $1[\cdot]$ 將扣除範圍限制在成功的 rollout 上,且 $\text{clip}(x, 0, 1) = \min(1, \max(0, x))$。其他群組則保留其原始獎勵。公式 (1) 中的結果優勢 $A_i$ 是根據調整後的獎勵 $\tilde{R}_i$ 計算而得;門檻值 $A$ 是一個獨立的超參數。這能鼓勵針對每個提示使用參考長度調整後的簡潔成功解,同時保留「通過率門檻」以利在處理困難提示時保有探索空間。

片段-Level 行為懲罰 結果獎勵可能會強化錯誤的中間行為,因此我們針對格式違規與工具呼叫錯誤(例如格式錯誤的標記、無效的工具名稱或格式錯誤的參數)制定了片段層級的規則。令 $h_{i,t} = 1$ 代表已標記的 Token,否則為 0。在整個訓練批次中,$H_+$ 與 $C_+$ 分別收集損失遮罩 $M_{i,t} = 1$ 的已標記與未標記 Token 索引 $(i, t)$;$\pm$ 表示所屬軌跡的結果優勢 $A_i$ 的正負號,而下文所有加總皆針對 Token 進行計算。

$$ \tilde{A}_{i,t} = \begin{cases} \alpha(1 - h_{i,t})A_i, & A_i > 0, \\ [\beta(1 - h_{i,t}) + \kappa h_{i,t}]A_i, & A_i < 0, \quad \kappa > 1, \\ 0, & A_i = 0, \end{cases} \qquad (5) \\ \alpha = \min\left(\alpha_{\max}, 1 + \frac{\sum_{H_+} A_i}{\sum_{C_+} A_i}\right), \quad \beta = \max\left(\beta_{\min}, 1 - \frac{(\kappa - 1) \sum_{H_-} |A_i|}{\sum_{C_-} |A_i|}\right). $$

這裡 $\kappa > 1$ 會將標記 Token 的負向優勢(advantage)更新幅度(magnitude)放大;$\alpha$ 會將未標記的正向 Token 向上調整比例,而 $\beta$ 則會將未標記的負向 Token 縮放至零。超參數 $\alpha_{\max} \ge 1$ 與 $0 < \beta_{\min} \le 1$ 分別限制了正向放大的上限,並界定了負向衰減的範圍。調整後的 Token 優勢 $\tilde{A}_{i,t}$ 替代了公式 (1) 中的 $A_i$。這會遮罩(mask)正向軌跡(trajectories)中的標記 Token,並在負向軌跡中對其施加更強的懲罰。移除的正向優勢會重新分配給未標記的正向 Token,而增加的負向更新幅度則會透過減少未標記負向 Token 的懲罰來抵銷:對於未偵測到錯誤的行為,視軌跡的符號而定,會獲得更多的強化(reinforcement)或較少的懲罰。在未對比例進行裁剪(clipping)的情況下,各符號的總優勢質量(advantage mass)會保持守恆,藉此限制過度的負向壓力,避免驅動不受控的熵(entropy)增長。若分母為零,其比例將設為 1;在這種情況或發生裁剪時,無法保證質量守恆。

5 實驗:你只需要一次 RL

在本節中,我們將說明擴展 RL 訓練的執行過程,包括訓練配置(§5.1)、評估設定(§5.2)、RL 效能(§5.3)、專家負載穩定性(§5.4)以及失敗分析(§5.5)。執行紀錄可於 https://mimo.xiaomi.com/rl/mimo-v26 取得。

5.1 訓練設定

RL 設定 我們的 RL 任務涵蓋多個領域,包括智能體式與競爭性編碼 (68%)、一般工具使用 (12%)、美學設計 (13%)、上下文遵循 (3%) 以及網路安全 (4%)。我們從中取樣一個包含 1568 個提示的批次,每個提示執行 16 次 rollout,總計全域訓練批次為 25K 個軌跡。訓練採用 GRPO,並以陳舊性為 4 的非同步部分 rollout 進行。

優化器 我們使用 Muown 優化器,學習率設為 $3 \times 10^{- 6}$,不使用權重衰減或學習率暖身,並將梯度裁剪門檻設為 1.0。針對 Muon 元件,我們使用動量係數 0.95 並啟用 Nesterov 動量,每次更新執行 10 次 Newton-Schulz 迭代,並套用額外的更新縮放因子 0.5。針對 Adam

針對該組件,我們設定 $\beta_1 = \beta_2 = 0.95$ 且 $\epsilon = 10^{-8}$。為了穩定 MXFP4 的訓練,我們從 SFT 檢查點載入 FP32 主權重與 Muown 的列狀態來初始化 RL。在 RL 訓練期間,我們會凍結路由器以維持專家負載的穩定。

群組相對策略最佳化 (GRPO) 演算法 我們採用 Eq. (1) 中的群組相對策略最佳化 (GRPO),其優勢計算詳見 §4.3。在損失聚合方面,我們使用「提示平均聚合 (prompt-mean aggregation)」,亦即在提示 (prompt) 層級對替代量 (surrogate) 進行平均,而非針對所有回應 Token 進行平均;此做法可防止回應長度在強化學習 (RL) 過程中過度增長。針對重要度取樣 (importance sampling),每個 Token 的比率計算方式如下:$r_{t,i} = \text{sg}[\pi_{\theta}(o_{i,t})/\mu_{\theta_{\text{old}}}(o_{i,t})]$。在訓練框架中,每個 Token 的訓練機率由當前模型產生,而推論機率則是該 Token 生成時由 rollout 模型所產生的;對於部分 rollout (partial rollouts),我們不會重新計算推論機率。我們使用四個解耦的邊界來裁剪重要度取樣比,分別為正優勢的 $\epsilon_+^l, \epsilon_+^h$ 以及負優勢的 $\epsilon_-^l, \epsilon_-^h$,進而得到裁剪遮罩 $M = \mathbb{1}[(A \ge 0 \land \epsilon_+^l \le r \le \epsilon_+^h) \lor (A < 0 \land \epsilon_-^l \le r \le \epsilon_-^h)]$。正邊界與負邊界皆初始化為 $[0.2, 5.0]$,並根據策略熵 (policy entropy) 在執行時期 (runtime) 獨立進行調校:當熵過低時,我們會放寬正邊界並收窄負邊界,以將熵拉回正常範圍;當熵過高時則反之。在整個訓練過程中,我們也會持續監控各更新方向的 Token 裁剪率。

5.2 評估設定

基準套件 我們針對四個類別評估智能體能力:程式碼智能體、網路安全、通用智能體與視覺智能體。我們的評估結合了公開基準與三個內部基準:MiMo Code Bench、MiMo Cyber Bench 與 MiMo Visual Coding。

程式碼智能體 我們使用 DeepSWE v1.1 (Huang et al., 2026)、ProgramBench (Yang et al., 2026a) 與 MiMo Code Bench 來評估軟體工程能力。DeepSWE 專注於長程開發任務。ProgramBench 評估端到端的軟體建置:智能體必須從編譯後的二進位檔案與文件重建程式,並產出能重現參考程式行為的實作。MiMo Code Bench 則針對多樣化的程式碼任務,提供額外的內部評估。

網路安全 我們使用 CyberGym (Wang et al., 2025)¹、ExploitGym (Wang et al., 2026)、ExploitBench (Lee and Brumley, 2026)、SEC Bench Pro (Lee et al., 2026) 以及 MiMo Cyber Bench,來評估漏洞重現與漏洞利用的互補面向。CyberGym 衡量代理人重現現實世界軟體漏洞的能力,而 SEC Bench Pro 則強調從錯誤報告中重現複雜漏洞。ExploitGym 評估開發漏洞利用的過程,而不僅僅是重現當機。ExploitBench 則透過多個漏洞利用階段及其產生的安全影響來評估進展。MiMo Cyber Bench 則以內部網路安全評估,補充了上述公開基準測試。

通用代理人 我們評估通用代理人在工具使用、專業知識工作、終端機導向的問題解決以及電腦操作等面向的表現。AutomationBench (Shepard and Salimans, 2026) 透過模擬 SaaS 環境中的 REST API,評估跨應用程式工作流編排,包含 API 發現與遵循業務規則的能力。Toolathlon-Verified (HKUST NLP, 2026; Li et al., 2026a) 則利用多樣化工具(包含透過模型上下文協定 (MCP) 提供的工具)來評估長程、多應用程式工作流。

我們根據第 4.2.4 節所述方法修正了有瑕疵的評估環境。

Figure 9

圖 9:DeepSWE v1.1、AutomationBench v1.0.6 以及我們自建的 MiMo Visual Coding 基準測試中,於 RL 訓練期間的基準測試分數(上方)與訓練 Token 總數(以千為單位,下方)。淺橘色與深橘色曲線分別代表 Flash 與 Pro。

GDPval-AA v2.1 (Artificial Analysis, 2026; Patwardhan et al., 2025) 是 Artificial Analysis 針對 GDPval 提出的評估框架,旨在評估具經濟價值的專業交付物品質。JobBench (Li et al., 2026b) 則評估領域專家認為應優先委派給 AI 代理人的工作流。Agents' Last Exam (Sun et al., 2026) 評估具經濟價值且具備可驗證結果的長程專業任務。Terminal-Bench 4.0 與 2.1 (Marten et al., 2026; Merrill et al., 2026) 評估在終端環境中完成複雜任務的能力。OSWorld-Verified (Xie et al., 2024; XLANG Lab, 2025) 則評估在真實網頁與桌面應用程式中進行的互動式電腦使用。

視覺代理人 我們使用 MiMo Visual Coding 來評估視覺編碼能力,這是一個由內部開發的基準測試,涵蓋了開放式設計與高忠實度視覺複製。該基準包含 WebDev 與 Image2Code 等任務,分別涉及根據使用者要求建立網站,以及將參考圖片轉換為視覺上忠實的程式碼實作。

基線配置 所有具備可配置推理投入的基線模型,均在最高支援設定 (max) 下進行評估。

5.3 RL 效能

在訓練過程中會持續監控效能變化,以驗證擴展 RL 計算的效果。如圖 9 所示,Flash 與 Pro 在 RL 訓練期間,於 DeepSWE v1.1、AutomationBench v1.0.6 以及 MiMo Visual Coding 的整體表現均有所提升,儘管檢查點之間存在波動。這些進步通常伴隨著總 Token 數量的增加,顯示隨著 Token 使用量的提升,任務效能也會隨之增強。我們進一步探討...

Figure 10

圖 10:DeepSWE v1.1 在多重 Harness 訓練中的 pass@1 表現,分別以 (a) 訓練 Harness 與 (b) 保留 Harness 進行評估。較淺的曲線顯示個別 Harness 的結果;粗厚的橘色曲線則顯示各面板內的平均值。

multi-harness 訓練的效果已於圖 10 中呈現。專用的訓練提升了 DeepSWE v1.1 在四個訓練 mini-harness 以及三個保留 harness(codex、claude code 與 mini-swe-agent)上的效能。儘管檢查點之間存在波動,但這三個保留 harness 的效能在訓練過程中均有所提升,其平均 pass@1 從約 50% 增加至 66%。訓練 harness 與保留 harness 之間的平均效能差距也隨之縮小,證明所學得的程式編碼能力可跨 harness 實作進行遷移。這些結果支持我們採用輕量化、模組化的 mini-harness 設計,以在 RL 過程中引入受控的多樣性。

5.4 路由器凍結以實現穩定的 RL

圖 11 比較了兩個 MiMo-V2.6-Pro RL 執行案例,兩者的差異僅在於 MoE 路由器的參數是否凍結。圖中追蹤了解碼器第 9 層的三項專家負載統計數據:變異係數 (CV)、峰值負載因子 (max/mean) 以及負載低於平均值 0.1 倍的冷專家比例(負載已按步數進行正規化)。我們觀察到,當路由器的參數可進行訓練時,會出現嚴重的負載塌陷 (load-collapse) 問題:這三項指標在最初的 20 個步驟內均呈單調上升,其中 CV 從 0.78 增加到 2.0,峰值負載從 6× 增加到 16×,而冷專家的比例則從 0.5% 增加到 22%。為了診斷原因,我們將第 20 步驟檢查點 (checkpoint) 的路由器參數還原為 RL 訓練前的初始值,同時保持所有其他參數不變:負載平衡隨即恢復至接近初始水準,而基準測試 (benchmark) 效能則維持不變。這顯示負載塌陷是由路由器參數漂移 (router drift) 所引起,而非專家權重的退化。因此,我們在 RL 訓練中凍結了路由器;在凍結路由器的執行案例中,這三項統計數據均保持平穩(CV ≈ 0.7,峰值負載 ≈ 5.5×,冷專家比例接近 1%),且基準測試效能亦正常成長。

5.5 RL 失敗分析

Figure 12 彙整了 MiMo-V2.6-Pro 與 MiMo-V2.6-Flash 訓練執行過程中的中斷情形。基礎設施故障 主要為 GPU 記憶體雙位元錯誤 (DBEs)。Flash 亦在 Kubernetes 故障導致 Cyber-task 叢集中,於步驟 15 與 16 之間使 Pods 發生當機後重新啟動。Pro 則是在步驟 14 之後,評分器無法透過網路連線而導致系統重新啟動。Rollout 失敗 發生在部分 rollout 設定中:較短的 rollout 在之後優先完成。

Figure 11

圖 11 MiMo-V2.6-Pro 在 RL 期間於解碼器第 9 層(384 位專家)的專家負載平衡情形,比較使用與未使用路由器凍結(freezing)的執行結果。 (a) 專家負載變異係數。 (b) 峰值負載因子(最大值/平均值)。 (c) 負載低於平均值 0.1 倍的冷專家比例。

Figure 12

圖 12 在 30 個訓練步驟中,MiMo-V2.6-Pro 與 MiMo-V2.6-Flash 的時間軸已依經過時間對齊。淺橘色代表已完成的步驟;其他顏色則依故障原因標示失敗與恢復區間。

啟動階段時,預測性 Rollout Dispatch (§6.3) 中的長度估計存在偏誤,且耗盡了 GPU 與釘選主記憶體 (pinned host-memory) KV 池。儘管經過初步的優化,其中一個 Harness 後來產生的 Rollout 長度不到其他 Harness 的一半,導致在重啟後的第二步與第三步估計值產生偏差。訓練失敗 則是因微批次 (micro-batch) 內的 MoE 不平衡導致 GPU 記憶體不足 (OOM) 錯誤:在某一特定層級中,專家平行 (EP) 階層收到的 Token 負載超過平均值的 30 倍,儘管完整批次的負載相對均衡。我們調整了平行化策略,以減少活化記憶體的使用量,並容納這些峰值。驅動程式失敗 發生在 Flash 階段的打包過程中,因為序列長度增加導致每個節點 (node) 的資料量超過了主記憶體容量。雖然打包是分散在各個節點上進行的 (§6.2),但本機記憶體需求仍導致 CPU OOM 並中斷了執行。

5.6 透過 MOPD2 擴展能力

在混合 RL 之後,我們使用多前綴多教師同策略蒸餾 (MOPD2) 來整合不同任務訓練之教師模型的各項能力,其中包括難以驗證的任務。我們在 MiMo-V2-Flash (Core Team et al., 2026; Ma et al., 2026) 的 MOPD 基礎上,保留在具備合適 mixRL 教師的領域中,由學生模型自主進行 Rollouts (Standard MOPD) 的方式。

Figure 13

圖 13 MiMo MOPD2 概述。(a) 針對可驗證任務,使用 MixRL 訓練領域專用的教師;針對開放領域任務,則使用 SFT 進行合成示範訓練。(b) 標準 MOPD 使用 RL 教師監督完整的學生 Rollout。(c) Prefix-Conditioned OPD 重新利用教師 Rollout 中的軌跡(Teacher-Prefix OPD)或 SFT 資料(SFT-Prefix OPD)。一個包含 k 個助理回合決策點的來源軌跡會產生 k 個完整歷史前綴 $h_i$,每個前綴皆可初始化一個獨立的學生生成回合 $y_i$,藉此由相關領域教師進行詞元層級蒸餾。SFT 資料提供的是前綴上下文,而非固定的延續目標。

加入前綴條件的單回合推演 (prefix-conditioned single-turn rollouts) (Liao et al., 2026)。圖 13 說明了教師配置以及標準與前綴條件蒸餾的工作流。

前綴來自教師推演 (Teacher-Prefix OPD) 或 SFT 資料 (SFT-Prefix OPD)。一個包含 k 個助理回合的軌跡會提供 k 個完整的前綴歷史,且每個前綴都以對應的回合結束。學生會從每個前綴中抽取一個新的回合,而不會重新產生先前的互動。由預先指定的教師提供 token 級監督,並以相同的歷史紀錄與學生的先前 token 為條件。

針對難以設計可靠 RL 獎勵的開放領域任務,我們在高品質的合成示範上訓練 SFT 教師。然而,其訓練過程對於長時程任務中,學生在重複偏離後的歷史紀錄覆蓋率可能有限 (Xu et al., 2025)。因此,SFT-Prefix OPD 在每次 rollout 的開頭都會使用固定的示範前綴,藉此限制在取樣回合前的偏離行為。示範負責提供上下文,而學生則生成自己的延續內容,而非模仿固定的回應。

MOPD2 進一步將 RL 訓練模型的應用範圍擴展至可靠訓練時驗證極具挑戰性的領域,包括具備複雜環境或難以設計驗證器的領域,例如長程遊戲開發、科學研究以及具身智慧。MiMo-V2.6 的最終評估結果詳見表 3。MiMo-V2.6 系列相較於 MiMo-V2.5 有顯著提升,在各個領域的效能已能媲美前沿模型。

Pattern and shortcutIllustrative case
Install and read
Uses a newer release of the target package as an answer key, copying a fix absent from the assigned checkout.

Task (pytest): Fix Windows conftest.py imports broken by path lowercasing.

Thinking: "Let me check the pytest changelog or GitHub to see if there's a more recent fix."

Action: pip install pytest==5.4.3; inspect the installed source.

Fetch upstream source
Downloads an upstream file or patch that already contains the fix, exposing the code changes needed to pass the tests.

Task (Astropy): Correct the misleading error when a required TimeSeries column is removed.

Thinking: "Let me just look at the file directly from the GitHub raw URL."

Action: curl .../astropy/timeseries/core.py

Clone upstream
Reads a newer upstream checkout to reconstruct the published fix missing from the assigned historical commit.

Task (Matplotlib): Stop ax.clear() from restoring hidden ticks and labels on shared axes.

Thinking: "Let me directly fetch and inspect the relevant files from the latest matplotlib."

Action: git clone .../ matplotlib.git; inspect axis.py.

Look up a solution
Searches issue discussions, pull requests, or linked commits for the original solution and uses it to guide the patch.

Task (Django): Fix MultiValueField ignoring required subfields.

Thinking: "Let me get more info - changesets and the fix that was applied."

Action: Read the change history of Django ticket #29205.

Probe versions
Finds a newer release to download and compare for its fix. The probe is a precursor to copying the solution.

Task (Sphinx): Remove the spurious return type from class documentation.

Thinking: "Let me look for the fix. The issue is likely fixed in later versions."

Action: pip index versions sphinx

---CyberGym 94.0 95.1 40.0 - - - MiMo Cyber Bench 80.2 77.2 0.0 - - - ExploitGym 17.8 6.0 0.2 22.1 30.3 28.4 ExploitBench 47.9 25.3 16.6 70.0 78.5 78.0 SEC Bench Pro 66.3 47.5 17.7 - 79.1 - Visual Agent MiMo Visual Coding 72.3 71.5 - 70.0 73.4 69.1

表 3:MiMo-V2.6 與前代及前沿模型在智能體式基準測試上的比較。

6 RL 與 OPD 基礎設施

MiMo-V2.6 系列將 RL 與 OPD 訓練擴展至大規模的混合任務智能體 rollout 批次。為了支援靈活的智能體 rollout 情境,我們定義了執行模型與軌跡資料結構,並透過 Penalty Module(第 6.1 節)優化學習訊號。在大型批次規模下,我們實作了 Harness Pool 以容納多個 Harness 並維持高並發度的 rollout,以及 Payload Porter 來緩衝數萬條包含路由與多模態資料的軌跡(第 6.2 節)。我們實作了 Sample Mixer,與動態採樣器及部分 rollout 協同運作,以穩定地提供符合指定訓練分布的訓練批次(第 6.3 節)。為了實現穩定且高效的 RL 訓練,我們在訓練與推論引擎之間對齊 MoE 路由與 top-p 取樣候選集,同時針對 RL 工作負載優化兩個引擎(第 6.4 節)。

6.1 使用細緻學習訊號的智能體式 RL

智能體式 rollout 橫跨多個回合與對話上下文,而結果獎勵僅提供粗略的監督。因此,我們採用以代理人為中心的執行模型,並將軌跡資料組織成階層結構。在此階層中,可配置的 Penalty Module 應用損失遮罩與優勢塑造,旨在針對區域性模型錯誤,並將基礎設施故障排除在訓練訊號之外。

代理迴路 我們將 Rollout 從以推論為中心的設計,轉變為以代理人為中心的設計:每個序列皆作為一個「代理迴路」執行,負責擁有環境生命週期、管理其產生的對話,並根據需求呼叫推論引擎。生命週期涵蓋了設定、互動、獎勵評估(例如執行測試案例)以及清理。在互動期間,迴路會提供一個請求端點,由外部代理人透過呼叫該端點來驅動 Rollout。每次對話都會同時以字串前綴與 Token 序列的形式儲存。透過前綴比對來定位接收到新請求時所要擴充的對話,並僅將新的後綴進行 Token 化,再傳遞給推論引擎,藉此維持其介面純粹為「Token 輸入、Token 輸出」。

軌跡階層、子代理人、上下文壓縮以及多重代理人角色,能在單一 rollout 中產生並行的對話分支。我們將軌跡資料組織為四層階層結構:Sample → Sequence → Context → Segment。Sample 是由 Sample Mixer (§6.3) 發送的提示。在 GRPO (Shao et al., 2024) 等群組演算法中,Sample 會產生一組 Sequences,且該群組會被整體接受或拒絕。Sequence 代表一次 Agent Loop 的執行,且可能包含多個並行的 Contexts。Context 是單一對話分支,其中包含一份 Segments 清單;它是前綴比對、KV 快取重複使用以及訓練資料匯出的基本單位。Segment 是單一回合——系統或使用者訊息、模型生成內容或工具結果——且僅有模型生成的回合會計入損失。

【譯註:此段落為論文內文,請參考上述硬規則與術語表進行翻譯。】


懲罰模組群組式演算法將結果獎勵平均分配至序列中所有模型產生的 Token。在上述階層結構中,功勞分配通常並不均勻:某些回合可能偏離路徑或退化,且部分失敗與模型無關。為了準確歸功,我們將「偵測」與其對訓練的「影響」分開處理。規則(Rule)透過人工編寫邏輯或基於模型的裁判,來評估片段、上下文或序列。例如,規則可以識別基礎設施故障(非模型造成)、混亂的 Token 模式、無法使用的工具呼叫以及重複內容。策略(Strategy)則將動作與階層層級綁定:遮罩(mask)會將受影響的內容排除在損失之外;優勢塑造(advantage shaping)則設定、縮放或扣除受影響 Token 的優勢;監控(monitor)僅記錄指標。複合早期停止(early stop)策略會在規則觸發時立即終止 rollout,將結果獎勵設為零,並對觸發回合與先前回合分別執行動作,同時遮罩其兄弟上下文。懲罰會沿著階層升級:若上下文沒有存活的模型回合,則該上下文會被捨棄;若序列沒有存活的上下文,則該序列獲得零優勢;若樣本沒有存活的序列,則該樣本會被拒絕。訓練中具體應用的懲罰詳見 §4.3.3。

6.2 Harness Pool 與 Payload Porter:使用多個 Harness 的大批次 RL

將 RL 訓練擴展至大型批次,會增加 rollout 的並發度,以及軌跡資料的記憶體與通訊成本。混合任務批次增加了一個異質性的維度:單一批次混合了多個 Harness,且每組訓練樣本都綁定到一個 Harness。在執行層面,Harness Pool 在持續的多租戶 Actor Pool 中主辦並發的 Harness 實例與 Agent Loop,並獨立配置 Harness 程式碼庫、代理人行為與環境設定。在資料層面,Payload Porter 僅根據輕量級中介資料進行驅動程式排程。重型 Payload 僅寫入一次至分散式儲存,並在被取用時進行打包。多模態 Payload 同樣將資料拆分為中介資料與像素,並採用遞增式傳輸與負載平衡編碼。

Figure 14

Figure 14 RL 基礎架構概述。

多租戶 Rollout 執行 我們使用 Ray actors (Moritz et al., 2018) 在叢集中執行代理人 harness 與 Agent Loop。若為每個 harness 實例與 Agent Loop 配置專屬的 Ray actor,每個 actor 都會在 Ray 的全域控制儲存節點 (GCS) 上佔用一個檔案描述符 (file descriptor),且大型批次可能會耗盡 GCS 節點的檔案描述符。因此,我們改為執行固定大小的持續性主機 actor 池,每個主機 actor 可同時容納多個租戶——模型端的多個 Agent Loop 與環境端的 harness 實例。每個租戶皆保有其獨立的軌跡狀態,並透過飛行中實例 (in-flight instance) 數量來平衡任務分配。主機為單一程序,其租戶共享一個事件迴圈 (event loop)。在模型端,它們也共享一個請求端點、一個推論代理 (inference proxy) 與一個 tokenizer;在環境端,則共享一個匯入的 harness 程式碼庫。由於共享事件迴圈會導致單一阻塞呼叫影響所有租戶,因此環境操作與詞元化等阻塞工作會改在背景執行緒上運行。這能將程序與服務的開銷攤銷至多個併行 rollout,進而支援更大的併行批次,且無需成比例增加 actor 數量。

異質代理人 Harness 我們分別配置 Harness 程式碼庫、代理人行為與環境設定,以因應單次訓練執行期間的多樣化任務。不同的資料來源可使用不同的程式碼庫,而代理人的配置則可在同一來源內的不同提示之間進行調整。每個訓練樣本群組皆使用共同的配置,以進行群組相對優勢的估算。由於單一程序僅能匯入一個 Harness 程式碼庫,因此不同的程式碼庫必須在獨立的資源池中執行。這些資源池會根據在每個步驟中排定的訓練資料混合比例,分配固定預算的主機代理人(Actor)比例,且此比例在啟動時即設定完成,與訓練資料混合比例無關。因此,Harness 的多樣性與 Rollout 的並發度皆可在單一執行框架內進行擴展。

拆分資料平面與控制平面大規模批次必須一次緩衝數萬個序列,且每個序列都相當龐大:除了 Token ID 與對數機率外,還包含 MoE 路由資料、top-$p$ 採樣索引以及多模態資料。Payload 的體積會隨著序列數量與長度而增加,且將所有 Payload 集中在單一驅動節點上會使批次大小受限於該節點的記憶體。因此,我們將資料平面與控制平面拆分,並在 rollout 完成時將每個序列進行拆分:其 Payload 將一次性寫入分散式鍵值儲存體(例如:

翻譯下列片段(論文內文):


Ray 物件儲存或 TransferQueue (Han et al., 2025) 的驅動程式會在輕量級中介資料上執行所有排程,包含純量獎勵、每組上下文長度,以及指向各個 Payload 的鍵。在群組完成時,僅從儲存中讀取所需的欄位,例如用於生命週期鉤子的幾行資料。若已配置群組評分器,則會與代理迴路完全非同步地並行執行,其延遲會被隱藏且結果可容許延遲,並在回傳時重新計算群組獎勵。接著,取樣器僅根據中介資料的通過率接受或拒絕該群組;而鉤子則會施加長度懲罰、計算群組相對優勢並應用優勢整形。每 Token 的優勢會寫回儲存中;預設情況下,所有優勢皆為零的群組將被捨棄。在 OPD 模式下,獎勵評估會由教師評分取代:每條軌跡都會傳送至教師伺服器,並將其分數非同步地收集至相同的分散式儲存中。在批次產出時,一旦每個資料來源都貢獻了其應有的份額,產出鉤子便會將接受的序列打包成微批次並分配給各個 Rank,且不會觸及任何張量。在打包時間,每個訓練張量平行 (TP) 群組中的一個打包器會為該群組中的每個 Rank 提供服務。從儲存中讀取不含填充的列時,僅提取其上下文平行 (CP) 視窗所觸及的部分,並僅擷取該視窗。此結果會以單一唯讀記憶體副本的形式,在 TP 群組中共享。這能避免在驅動程式端進行全批次聚合,並減少打包過程中產生密集填充的中間項。

多模態資料多模態 Payload 遵循相同的 Meta/Payload 切分方式,但需要額外的處理:由於代理人在回合之間會不斷擷取截圖並讀取圖片,單一軌跡(Trajectory)可能會累積達數 GB 的資料,儲存成本高昂,且隨著歷史紀錄增加,重新傳輸的成本也隨之上升。因此,在 Rollout 期間,代理迴路(Agent Loop)僅會傳送請求之間的多模態差異(§6.4)。在訓練階段,每項圖片都必須通過視覺編碼器。由於編碼器在 Tensor-parallel 群組中被複製,而 LLM 骨幹(Backbone)則被分片(Shard),因此編碼會先以資料平行方式執行——圖片項目會根據各 Rank 的負載進行平衡,而不受序列 Token 的分佈位置影響。編碼完成後,嵌入(Embedding)會重新分配到持有對應 Token 的 Rank。Payload 本身則儲存在分散式鍵值儲存(Distributed key-value store)中:負載平衡規劃僅讀取項目中介資料(Metadata),且僅在進行編碼器運算時才擷取像素。這能限制不必要的 Payload 移動,同時支援不均勻的多模態工作負載。

6.3 樣本混合器:穩定的非同步混合任務強化學習

自從 MiMo-V2-Flash (Core Team et al., 2026) 發表以來,我們便持續維護一個資料排程器,其目標是在資料來源之間達成指定的訓練分布,並結合動態採樣器 (Yu et al., 2025) 與部分 rollout (Kimi Team, 2025)。混合任務強化學習 (mixed-task RL) 必須在 rollout 時長與過濾速率有顯著波動的情況下,仍能維持此分布,以確保每個資料來源都能獲得有效的訓練。在 25 個受測的資料來源中,平均生成的 Token 數量與啟動中的 rollout 時長分別相差 90 倍與 66 倍 (圖 15),這也促使我們開發出能適應各來源工作負載的排程機制。為了應對這些挑戰,我們實作了樣本混合器 (Sample Mixer),透過四種機制來填補指定的訓練分布:自適應 rollout 並發度 (Adaptive Rollout Concurrency) 設定各來源的預算、自適應 rollout 排程 (Adaptive Rollout Scheduling) 在預算內選擇資料來源、預測性 rollout 派送 (Predictive Rollout Dispatch) 將新 rollout 分配至各節點,以及樣本重播 (Sample Replay) 處理啟動與恢復階段。

適應性 Rollout 並發度較慢的來源需要更多的並發 Rollout,才能維持相同的訓練貢獻。對於來源 i,令 $B_i$ 表示每訓練步驟目標保留的樣本群組數,$r_i$ 為估計的群組接受率,而 $t_i$ 為估計的有效 Rollout 持續時間(包含模型生成與環境互動,但不包含訓練步驟之間的暫停)。預期生成需求為 $m_i = B_i/r_i$;在固定的訓練吞吐量下,所需的

Figure 15

圖 15 橫跨 25 個資料來源的 Rollout 不均勻性。每條線段連接一個來源的起始 (Start) 點(虛線)與結束 (End) 點(實線);每個點則繪製該來源的平均生成 Token 數與平均 Rollout 時間,其 Rollout 時間是根據已完成的 Rollout 總和(在上下文過濾前,將對話上下文中的 Token 總和)計算而得。兩軸均採用對數尺度。

並發度會隨 $t_i m_i$ 進行擴展。我們為每個來源分配 $(1 + p_i)m_i$ 個群組的排程預算,其中* 過取樣比例 * $p_i$ 滿足

$$ p_i = \text{clip}(ct_i - 1, p_{\text{min}}, p_{\text{max}}), \qquad \frac{\sum_i m_i p_i}{\sum_i m_i} = \bar{p}. \qquad (6) $$

共同因子 $c$ 會使 $p_i$ 的需求加權平均值維持在全域過取樣比例 $\bar{p}$,並受限於每個來源的上限。當工作負載改變時,我們會根據最新的時間統計與接受率統計重新計算此配置。在穩定狀態下,並發度需求會隨著來源的 Rollout 持續時間與目標而增加,並隨著其接受率而減少。

在這些預算內,排程會平衡長期生成需求與當前訓練批次(training batch)的進度。若來源 $i$ 的當前批次中已有 $A_i$ 個群組被接受,則其排程權重為

$$ w_i = \alpha \frac{B_i}{r_i} + (1 - \alpha) \frac{(B_i - A_i)^+}{r_i}, \qquad (7) $$

其中 $(x)^+ = \max(x, 0)$ 且 $\alpha \in [0, 1]$。目標項(Target term)用於維持生成需求;缺口項(Deficit term)則優先處理具有剩餘缺口(Remaining deficit)的來源。這些權重驅動了平滑加權輪詢(Smooth weighted round-robin);Steady-state startup 結合了 $\alpha = 0.5$ 與按 $t_i m_i$ 比例分配的初始並發度。圖 15 中的軌跡驅動模擬(Trace-driven simulation)在固定的並發度限制與非約束性來源預算下,比較了各項策略。在此工作負載中,缺口修正排程($\alpha = 0.5$)在佔用率穩定性(Occupancy stability)上優於缺口導向排程($\alpha = 0$),並在平衡性(Collection balance)上優於目標導向排程($\alpha = 1$)。模擬持續時間已根據圖 15 中各來源在 End 處的平均 rollout 時間進行校準。

預測 Rollout 調度 我們共同估計 KV 需求與預期推論並發度,以引導新 Rollout 在各個階層(ranks)中的接納與配置。針對每個來源的先驗分布(priors)會估計 Rollout 的總序列長度(包含輸入與產生的 Token),並加總其上下文(contexts)的數量;這些

Figure 16

圖 16 六個來源的軌跡驅動排程模擬。圖例:平均持續時間 / 群組接受率。上方:收集進度(已接受群組 / 每個步驟的目標值,並將剩餘部分延後)。下方:Rollout 佔用率(已佔用序列槽的比例)。步驟間距反映經過的時間。虛線標示步驟邊界。本模擬未包含訓練時間、信用分配延遲、陳舊性到期及重播。

先驗知識會根據已完成的 rollout 進行更新,並用於估計 KV 需求。只有當該 rollout 的估計 KV 需求乘以安全係數後,仍能容納在目標 rank 的剩餘 GPU KV 容量內時,我們才會允許該 rollout。分層快取 (§6.4) 橫跨 HBM 與一個固定主機集區:這兩個層級共同保留已接受 rollout 的狀態。將 rollout 在環境執行中耗費的時間比例轉換為 rollout 並發度,即可推算出預期的推論並發度。我們利用 CUDA 圖形擷取所使用的最大執行中請求來界定此期望值,藉此限制佇列延遲,避免延長 rollout 的生命週期並增加陳舊性。為了在滿足上述約束的前提下最大化吞吐量,一個貪婪啟發式會選擇剩餘容量最大的可行 rank(即可用並發度插槽與剩餘 KV 容量的最小值,兩者皆以序列單位表示),並在每次配置後更新這兩個數值。

樣本重播 我們利用樣本重播來加速從慢速來源收集初始資料。在分析中,啟動時的樣本收集時間約為持續運作的 1.8 倍。在慢速來源中,較短的 rollout 傾向於較早完成,即使已達到每個來源的目標,也會導致初始批次產生偏見。因此,在啟動或檢查點恢復後的第一次收集步驟中,我們會重複使用選定慢速來源的已完成 rollout 群組,並在現行過濾規則下填補剩餘的來源缺口。新鮮啟動重播假設儲存的 rollout 是根據執行起始策略所產生;恢復重播則重複使用在恢復前且仍在各來源陳舊性限制內的已完成 rollout。將重播限制在第一次收集步驟,可以在等待慢速來源的同時,維持指定的訓練分布。

6.4 訓練/推論一致性與最佳化

我們擴充了 MiMo-V2-Flash (Core Team et al., 2026) 的 RL 與 OPD 基礎架構,並分別使用 SGLang (Zheng et al., 2024) 與 Megatron-LM (Shoeybi et al., 2019) 作為推論與訓練引擎。在 MiMo-V2.6 中,我們在 rollout 期間將專家的資料類型設定為 MXFP4。我們在混合專家 (MoE) 路由與機率正規化中,維持兩個引擎之間的一致性。在推論端,Context Cache 在各回合之間攜帶路由記錄、候選集取樣結果與視覺輸入,並連同 KV 狀態一併處理,同時將閒置狀態卸載至主機記憶體。透過 RL rollout log 訓練出的草稿模型,進一步利用推測式解碼 (speculative decoding) 加速生成。在訓練端,我們降低了長序列在記憶體與通訊上的成本。

Training–Inference Consistency 為了支援 MiMo-V2.6 系列,我們在每次參數更新後,對專家進行量化與去量化 (QDQ)。量化過程遵循 rollout 期間所使用的 MXFP4 Humming GEMM 核心 (vLLM Project, 2026) 之數值約束,確保兩個引擎看到的專家權重完全相同。即使參數相同,引擎之間的數值差異也可能翻轉離散的專家選擇;Rollout Routing Replay (R3) (Ma et al., 2025) 會記錄 rollout 期間使用的專家索引,並在訓練期間重播這些索引,藉此重現捕捉到的執行路徑。Top-k 與 top-p 取樣是在受限的候選集而非完整詞彙表上進行重新正規化;我們在 rollout 期間記錄每個 Token 的候選集 (Liu et al., 2025a; The Microsoft AI Team, 2026),並在其中重新正規化訓練的對數機率,以符合取樣器的正規化方式。針對 top-p 取樣,僅 GPU 與 CPU 之間的傳輸為密集格式:我們傳送一個固定形狀且具備完整詞彙寬度的位元圖 (bitmap)。固定形狀可避免 GPU 與 CPU 同步;完整寬度則確保即使候選集涵蓋整個詞彙表也不會被截斷。後續所有階段均為稀疏格式:在典型的 top-p 為 0.97 時,候選集平均少於五個 Token。R3 與 top-p 候選集重播所帶來的額外負擔微乎其微,因為 Payload 維持精簡且移出關鍵路徑。

Context Caching 依循 MiMo-V2-Flash (Core Team et al., 2026) 的回合級 KVCache,每個對話上下文都具備一個持續存在的鍵。在同一個策略版本內,後續的回合會命中快取的 KV(包含已生成的 Token),並僅針對新後綴進行預填充。情境快取是一種刻意採用的狀態化選擇:快取的狀態會存活於每個回合之後。專家索引與候選集因此不會在中間回合回傳,而是在最終收集 rollout 時才回傳,藉此避免每回合破碎的通訊與處理。歷史多模態輸入不需要重新雜湊(re-hashing)或重新傳送:其視覺 Token 已位於快取的 KV 之中。只有新引入的影像會跨越處理邊界;完整的視覺輸入僅在策略更新或快取未命中(cache miss)時才會傳送。多回合環境互動將軌跡的實體時鐘(wall clock)劃分為 GPU 時間(生成)與工具時間(等待環境);快取的階層式擴充反映了這種時間分割的空間結構——狀態在 GPU 時間期間位於 HBM,而在工具時間期間則位於固定主機集區(pinned host pool)。離載(offloading)與還原(restoration)在側邊 CUDA 流(side CUDA streams)上執行,而非在計算流(compute stream)上執行,因此不會造成生成停滯。HBM 因而能盡可能地用於執行請求:解碼批次越大,算術強度與計算利用率就越高。

Draft Model 加速 RL rollout 預設使用區塊 6 的 DFlash 進行推測式解碼,取代了從 SFT 繼承而來的多 token 預測(MTP-3)配置。DFlash 最初是在 SFT 策略上進行訓練,接著再針對與 RL 訓練分布相符的早期 RL rollout 日誌進行微調。在此預設配置下,平均接受長度比使用 MTP 配置高出 31.3%。在大型 RL 批次大小下,我們會根據

端對端吞吐量,而非僅看接受率。較小的草稿區塊可減少驗證工作:在混合任務強化學習評估中,區塊 6 的全域平均吞吐量比區塊 8 高出約 6%,且平均接受長度幾乎沒有變化。此外,也採用低精確度草稿運算(FP8)以降低草稿處理的負擔。在我們的長上下文工作負載中,RL 調整後的 FP8 DFlash 之每節點吞吐量比基線高出約 10.3%。

訓練最佳化 我們在 1M-token 的上下文長度下訓練 RL。MiMo-V2.6 交替使用 128-token 滑動視窗層與全注意力。在上下文平行化下,滑動視窗層僅交換其查詢 (queries) 可觸及的 KV—最多為視窗大小的片段—因此每層的流量受限於視窗而非序列長度。長序列也會增加記憶體佔用,且 MoE 專家的不平衡會將峰值記憶體推得更高。最佳化器狀態保留在 CPU 記憶體中,僅在參數更新時才複製回 GPU。所有損失計算皆整合至單一核心:策略梯度損失(搭配或不搭配 top-p 重正規化)與 OPD 損失,可選用熵、標籤 logit 及 top-p 質量等指標。此整合能節省記憶體並縮短步驟時間。

7 開放基礎:代理式 RL

MiMo-V2.6 系列展示了強化學習在顯著提升智能體(Agentic)能力方面的潛力。要延續這項進展,需要具備高效能的模型與高品質的強化學習環境,將具意義的任務與可靠的驗證器(Verifier)相結合。分享這些資源並提供可重現的基線(Baselines),將有助於開源社群持續進行研究與創新。因此,我們開源了 MiMo-V2.6-Distill-Qwen-9B²,這是一個從 MiMo 蒸餾(Distilled)而來的小型模型,作為進一步強化學習訓練的共享起點。除了模型之外,我們也釋出了高品質的強化學習環境與一套端對端(End-to-end)的開源強化學習框架。在本節中,我們利用這些釋出的資源建立領域特定的 GRPO 基線。此外,我們針對「程式碼」進行了獨立的多 Harness 訓練實驗,並遵循 MiMo-V2.6 的方法。我們的實驗結果顯示,在多個領域皆取得了顯著的進展,證明了這些資源在強化學習訓練中的價值。

7.1 從 MiMo-V2.6 進行蒸餾

擴大 RL 計算規模並提升環境與 Harness 的覆蓋率,能創造更多探索與學習的機會。在這些情境下,有效的探索取決於動作的協調以及對環境回饋的反應。因此,要實現 Agentic RL 的潛力,首先必須具備強大的任務解決能力基礎。

為了為開源社群提供這樣的基礎,我們開發了 MiMo-V2.6-Distill-Qwen-9B,將 MiMo 的 Agentic 經驗遷移至較小型的模型中。我們透過在 MiMo 生成的資料上對 Qwen3.5-9B (Qwen Team, 2025) 進行監督式微調來取得此模型,該資料涵蓋了程式編寫、通用領域、視覺以及網路安全任務。此混合資料集總計包含 774 億個 Token,其中 272 億個 Token 為用於 SFT 目標的損失 Token。表 4 彙整了資料的組成比例。

產出的 MiMo-V2.6-Distill-Qwen-9B 檢查點在所有報告的評估項目中均優於 Qwen3.5-9B(表 6)。例如,SWE-bench Pro(Deng et al., 2025)的得分從 32.0 提升至 44.6,而 AutomationBench 則從 5.0% 提升至 30.3%。我們認為這些增強的任務解決能力,為透過 RL 進一步提升效能奠定了良好的基礎。因此,我們

²https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B

<table><thead><tr><th>資料來源</th><th>總 Token (B)</th><th>Token 比例 (%)</th><th>損失 Token (B)</th></tr></thead><tbody><tr><td>程式碼</td><td>23.2</td><td>29.9</td><td>7.3</td></tr><tr><td>網路安全</td><td>11.0</td><td>14.2</td><td>4.8</td></tr><tr><td>通用</td><td>22.0</td><td>28.5</td><td>5.7</td></tr><tr><td>視覺</td><td>21.2</td><td>27.4</td><td>9.4</td></tr><tr><td>總計</td><td>77.4</td><td>100.0</td><td>27.2</td></tr></tbody></table>

表 4 加權 SFT 資料組合。Token 數量以十億為單位。數值四捨五入至小數點後第一位;總計則使用未四捨五入的彙總數量。

基準測試MiMo-V2.6 ProMiMo-V2.6 FlashMiMo-V2.5 ProClaude Opus 5GPT-5.6 SolClaude Fable 5
程式碼代理人
DeepSWE v1.171.967.919.074.073.070.0
ProgramBench26.526.012.537.025.033.0
MiMo Code Bench63.261.240.468.659.3-
一般代理人
AutomationBench v1.0.653.152.316.050.345.846.2
Toolathlon-Verified76.973.649.180.674.977.9
GDPval-AA 2.11673-1107170815881595
Agents' Last Exam31.627.613.231.630.825.7
Terminal Bench 4.034.928.81.549.039.942.4
Terminal Bench 2.189.987.665.289.188.884.3
OSWorld-Verified82.080.8-83.483.086.0
JobBench62.061.225.065.745.457.4
網路安全
DomainTask FamilyTraining TasksVerifier
CodeSoftware engineering3kExecutable tests
CyberVulnerability reproduction1kRule checks
GeneralKnowledge work1kRubric-based judging
VisualWeb development2kVisual grading

表 5 釋出之 RL 環境概述,包含訓練任務數量以及用於評估任務完成的驗證器。任務數量為估計值,係根據各訓練集中的不同任務識別碼;k 代表一千。

使用此檢查點作為後續所述領域特定 GRPO 實驗與多 Harness 程式碼實驗的共同初始化。

7.2 使用開放環境的 RL

環境概述表 5 彙整了我們發布的 RL 環境,涵蓋程式編寫、網路安全、通用領域及視覺任務。這四個訓練集總計包含約 7,000 項任務,其中通用領域集專注於知識工作。此外,訓練資源還包含約 1,000 項音樂生成任務,以支援下文所述的 GRPO 實驗。

從相同的 MiMo-V2.6-Distill-Qwen-9B SFT 檢查點開始,我們針對程式設計、網路安全、通用領域及視覺任務,分別使用對應的公開環境進行 GRPO 訓練。除了公開基準測試外,我們還在四個內部資料集上進行評估:用於軟體工程的 MiMo Code Bench (mini)、用於漏洞重現的 MiMo Cyber Bench (mini)、用於知識工作的 MiMo General Bench (mini),以及用於網站開發的 MiMo Visual Coding (mini)。這些評估資料集的任務分佈與其對應的訓練資料集相同。

表 6 顯示,在該表所列的 11 項評估中,RL 在所有四個任務領域均優於 SFT 檢查點。SWE-bench Verified (Jimenez et al., 2024) 的分數從 61.1 提升至 66.2,而 Terminal Bench 2.1 (Merrill et al., 2026) 則從 37.1 提升至 52.8。OfficeQA Pro (Opsahl-Ong et al., 2026) 從 19.5 提升至 24.8,Toolathlon-Verified (HKUST NLP, 2026) 則從 35.2 提升至 38.0。MiMo Visual Coding (mini) 從 64.0 提升至 72.4,MiMo Cyber Bench (mini) 則從 31.3 提升至 47.0。除了表 6 所列的任務外,我們也探索了藝術創作與設計等新興任務,例如音樂組合。在我們的內部音樂基準測試中,分數在經過 SFT 訓練後為 45.7,而在經過 RL 訓練後則大幅提升至 52.5。

基準測試指標Qwen3.5-9BMiMo-V2.6-Distill-Qwen-9B
SFTRL
程式碼
SWE-bench Verifiedavg@360.061.166.2
SWE-bench Proavg@332.044.647.6
MiMo Code Bench (mini)avg@319.551.659.9
網路安全
MiMo Cyber Bench (mini)avg@35.731.347.0
通用
AutomationBench v1.0.6avg@15.030.333.1
Terminal Bench 2.1avg@127.037.152.8
Toolathlon-Verifiedavg@125.935.238.0
OfficeQA Proavg@19.019.524.8
JobBenchavg@12.618.325.2
MiMo General Bench (mini)avg@128.562.270.6
視覺
MiMo Visual Coding (mini)avg@161.764.072.4

表 6 Qwen3.5-9B、在 SFT 後的 MiMo-V2.6-Distill-Qwen-9B,以及經過進一步 GRPO 訓練(RL)後的領域特定檢查點評估。程式碼採用單 Harness RL。各列中的最高分數以粗體標示。

這些結果突顯了高品質訓練資料與強大的 SFT 初始化對於後續透過 RL 進行改進的重要性。

多 Harness 訓練 表 6 的程式碼結果是透過單一 Harness RL 取得。我們進一步在另一項獨立的程式碼實驗中探討多 Harness 訓練,並從相同的 MiMo-V2.6-Distill-Qwen-9B SFT 檢查點開始。依循 MiMo-V2.6 的多 Harness 訓練方法,我們在四個 mini-harness 中聯結優化模型,並在這些 Harness 與另外三個保留的 Harness 上進行評估。表 7 比較了在三個程式碼評估與七個代理人 Harness 中,經過單一 Harness RL 與多 Harness RL 訓練前後的 Qwen3.5-9B 與 MiMo-V2.6-Distill-Qwen-9B。MiMo-V2.6-Distill-Qwen-9B 在所有 21 組資料集-Harness 組合中均優於 Qwen3.5-9B,且多 Harness RL 更進一步提升了每一組的表現。在 MiMo Code Bench (mini) 上,相較於 SFT,在七個 Harness 中,額外獲得的提升幅度從 1.8 到 9.3 個百分點不等。

案例研究 為了更直觀地展示我們的 SFT 與 RL 配方如何逐步提升模型能力,我們針對網頁開發領域(一個視覺品質一目了然的領域)進行案例研究,並在圖 17 中比較由 Qwen3.5-9B、MiMo-V2.6-Distill-Qwen-9B (SFT) 與 MiMo-V2.6-Distill-Qwen-9B (RL) 生成的網頁。如左欄所示,由 Qwen3.5-9B 生成的網頁在視覺設計上相對樸素,佈局簡單且影像使用極少。值得注意的是,(c) 中的人力資源管理介面存在明顯的佈局問題。蒸餾過後的 MiMo-V2.6-Distill-Qwen-9B (SFT)(中間欄)則生成了內容更豐富、色彩配置更協調,且更有效地整合影像資產的網頁,例如 (b) 中的衣索比亞遺產頁面便展示了精美的攝影元素。在經過 RL 訓練(右欄)後,模型更進一步,呈現

模型訓練 Harness保留 Harness
mini-harness1mini-harness2mini-harness3mini-harness4codexclaude codemini-swe-agent平均值
SWE-bench Verified
Qwen3.5-9B58.436.454.857.848.654.860.653.1
MiMo-V2.6-Distill-Qwen-9B61.763.961.763.158.561.765.362.3
+ Multi-Harness RL67.965.166.667.261.165.366.765.7
SWE-bench Pro
Qwen3.5-9B33.515.231.131.123.126.931.627.5
MiMo-V2.6-Distill-Qwen-9B45.246.645.145.540.342.245.644.4
+ Multi-Harness RL48.546.947.648.042.643.148.446.5MiMo Code Bench (mini)Qwen3.5-9B19.07.516.522.510.513.517.515.3MiMo-V2.6-Distill-Qwen-9B53.256.751.556.346.051.256.853.1+ Multi-Harness RL62.564.557.063.350.753.062.059.0

表 7 各代理人 Harness 的程式撰寫效能。平均值為七個 Harness 分數的未加權平均,四捨五入至小數點後第一位。資料集內各欄位中表現最佳的結果以粗體標示。

最精緻的呈現效果,包含精緻的排版、視覺衝擊力強的英雄區段(例如圖 (b) 中的日落意象),以及更完整且結構嚴謹的頁面配置(例如圖 (c) 中的全功能 HR 儀表板,配備側邊欄導覽、行事曆小工具與詳細的統計卡片)。這些漸進式的質化改進,與表 6 中觀察到的量化軌跡(61.7 → 64.0 → 72.4)相符,共同證明了先進行 MiMo-V2.6 蒸餾再接續 RL 的累積效益,能同時提升生成內容的美學品質與功能完整性。

8 結論

這份報告介紹了 MiMo-V2.6 系列,並提出一種透過大規模智能體式強化學習(agentic reinforcement learning)來推動基礎模型發展的實務方法。我們在全能基礎模型與以代理人為中心的中期訓練(agent-centric mid-training)之上,沿著三個維度擴展強化學習:訓練批次大小與吞吐量、環境與代理人 Harness 的多樣性與複雜度,以及投入於組式智能體式評分(groupwise agentic grading)的運算資源。這些進展由非同步訓練、混合任務 Rollout 基礎設施、訓練-推論一致性機制,以及防範訓練偏移與獎勵駭入(reward hacking)的防護措施所支持。這些技術共同實現了長程互動下的持續最佳化,同時提升了解決方案品質與代幣效率。在公開與內部基準測試中的評估結果顯示了此方法的有效性,MiMo-V2.6 在廣泛的智能體任務中,展現出與前沿模型(frontier models)競爭的效能。

為了讓研究社群能接觸到此研究方向,我們釋出了 MiMo-V2.6-Distill-Qwen-9B,並附上精心整理的任務環境、驗證器、端對端 RL 框架以及可組合的 mini-harness。在各個領域與 Harness 中皆能觀察到一致的 RL 增益,這顯示這些資源作為進一步實驗的共享基礎具有極高價值。本研究在模型自我改進的道路上邁出了實質的一步,強調了廣泛探索、具啟發性的回饋以及可擴展訓練系統的重要性。我們期盼這些開放資源能支援可重現的研究,並在邁向更具能力、通用代理人的過程中累積進展。

Figure 17

圖 17 Qwen3.5-9B、MiMo-V2.6-Distill-Qwen-9B (SFT) 與 MiMo-V2.6-Distill-Qwen-9B (RL) 生成的網站首部區範例。每一列 (a-c) 均顯示三個模型針對相同提示所產出的結果。

A 貢獻與致謝

我們誠摯感謝所有貢獻者的寶貴支援與付出,包括小米資料平台、CloudML、NGK、MiChat、Mify、MiKS 以及 LLM-Plus 團隊,以及其他未在本文中明確列出的成員。作者名單依姓氏字母順序(以姓氏首字母為準)排列。

核心貢獻者:Zongming Qiao、Ziyue Hua、Zirui Ou、Zihao Yue、Zihan Jiang、Zhuo Huang、Zhiyang Chen、Zhixian Zheng、Zhipeng Xu、Zhengrui Ma、Yuyang Hu、Yuhang Dong、Yuechen Zhang、Yudong Wang、Yuanxin Liu、Yixin Yang、Yishuo Cai、Yikai Zhao、Yihan Yan、Yifan Zhang、Yifan Song、Xiyu Wei、Xing Zhang、Xin Zhang、Xiaoqian Liu、Xiaodong Ji、Xiangwei Deng、Xueyu Guo、Wenhan Ma、Weimin Xiong、Weikun Wang、Weiji Zhuang、Shuo Liu、Shuhuai Ren、Shuhao Gu、Shimao Chen、Shijie Cao、Shihua Yu、Shicheng Li、Shengjie Zhou、Shaolei Zhang、Rang Li、Qiying Wang、Qingkai Fang、Qianli Chen、Minzheng Wang、Liwen Wang、Linli Yao、Linghao Zhang、Liangyu Cheng、Liang Zhao、Lei Li、Jinhao Dong、Jinyu Xiang、Jianyu Wei、Jiangshan Duo、Huaqiu Liu、Huanjie Fan、Hongyi Guan、Hongshen Xu、Hao Tian、Hanyu Li、Hailin Zhang、Gang Wang、Fuli Luo†、Feng Wei、Dong Zhang、Dawei Zhu、Chiheng Lou、Chenhong He、Chenhao He、Chenghua Liu、Bowen Ye、Bowen Shen、Boshen Xu、Bo Yang、Bingquan Xia、Bangjun Xiao、Baixuan Xu

貢獻者:Zhouxiang Mao、Zhiyang Zhang、Zhixiang Xu、Zhenru Lin、Zhengju Tang、Zhaojun Huang、Yuzhe Weng、Yuxing Xiang、Yuxiao Li、Yuheng Yang、Yuhang Wang、Yuchen Liu、Yuanyuan Tian、Yuanliang Dong、Yu Cheng、Yongzhe He、Yongshun Liang、Yong Wang、Yiyan Wang、Yitian Gong、Yijie Zhang、Yanshu Xin、Xun Zhang、Xingjian Zhao、Wenyu Yang、Wenshan Huang、Wenhao Li、Tingwei Huang、Tianyu Yu、Tianyang Lu、Taoyu Yang、Sinan Du、Shutong Tian、Shulin Du、Shengfan Wang、Shanchuan Fang、Qihao Zhang、Qibin Yang、Qian Yu、Qian Tu、Pengrong Xie、Peipei Wang、Peidian Li、Minkun Guo、Mingchen Shao、Luohan Gao、Lijie Wang、Liang Shi、Kaiqi Chen、Kaiming Liu、Kaifei Wang、Kai Yang、Jinlong Xue、Jiechen Zhang、Jiaxuan Liu、Hongxu An、Hao Peng、Hanglong Lü、Guonan Wang、Feiyu Yang、Fanyu Cao、Fangyue Liu、Fan Cui、Cong Wang、Chun Chen、Chenxu Bai、Chengxuan Zhu、Chenghua Wang、Boyi Zeng

† 通訊作者

參考文獻

依原文順序編號,內文引用的數字對應下列條目。

  1. Artificial Analysis. GDPval-AA v2.1 Leaderboard, 2026. URL https://artificialanalysis.ai/evaluations/gdpval-aa. Accessed September 21, 2026.
  2. I. Badertdinov, M. Nekrashevich, A. Shevtsov, and A. Golubev. Swe-rebench v2: Language-agnostic swe task collection at scale, 2026. URL https://arxiv.org/abs/2602.23866.
  3. J. Chen, Y. Liang, and Z. Liu. Dflash: Block diffusion for flash speculative decoding, 2026. URL https://arxiv.org/abs/2602.06036.
  4. Core Team, B. Xiao, B. Xia, B. Yang, B. Gao, B. Shen, C. Zhang, C. He, C. Lou, F. Luo, et al. MiMo-V2-Flash technical report, 2026. URL https://arxiv.org/abs/2601.02780.
  5. X. Deng, J. Da, E. Pan, Y. Y. He, C. Ide, K. Garg, N. Lauffer, A. Park, N. Pasari, C. Rane, et al. Swe-bench pro: Can ai agents solve long-horizon software engineering tasks?, 2025. URL https://arxiv.org/abs/2509.16941.
  6. F. Gloeckle, B. Y. Idrissi, B. Rozière, D. Lopez-Paz, and G. Synnaeve. Better & faster large language models via multi-token prediction. In Forty-first International Conference on Machine Learning, ICML 2024, Vienna, Austria, July 21-27, 2024. OpenReview.net, 2024. URL https://openreview.net/forum?id=pEWAcejiU2. Z. Han, A. You, H. Wang, K. Luo, G. Yang, W. Shi, M. Chen, S. Zhang, Z. Lan, C. Deng, et al. Asyncflow: An asynchronous streaming rl framework for efficient llm post-training, 2025. URL https://arxiv.org/abs/2507.01663. C. He, L. Li, S. Li, H. Lv, L. Kong, Q. Liu, T. Yang, and S. Ren. Semantic head specialization guides hybrid vit attention for multimodal llms, 2026. URL https://arxiv.org/abs/2608.28383. HKUST NLP. Introducing Toolathlon-Verified, June 2026. URL https://toolathlon.xyz/docs/bl og/toolathlon-verified. W. Huang and P. Jiang. Deepswe v1.1: a cleaner, more reproducible benchmark for frontier coding agents, 2026. URL https://github.com/datacurve-ai/deep-swe. W. Huang, C. Lee, L. Tng, and S. Ge. Deepswe: Measuring frontier coding agents on original, long-horizon engineering tasks, 2026. URL https://arxiv.org/abs/2607.07946. C. E. Jimenez, J. Yang, A. Wettig, S. Yao, K. Pei, O. Press, and K. R. Narasimhan. Swe-bench: Can language models resolve real-world github issues? In The Twelfth International Conference on Learning Representations, ICLR 2024, Vienna, Austria, May 7-11, 2024. OpenReview.net, 2024. URL https://openreview.net/forum?id=VTF8yNQM66. K. Jordan, Y. Jin, V. Boza, J. You, F. Cesista, L. Newhouse, and J. Bernstein.
  7. Muon: An optimizer for hidden layers in neural networks, 2024. URL https://kellerjordan.github.io/posts/muon/. Kimi Team. Kimi k1.5: Scaling reinforcement learning with llms, 2025. URL https://arxiv.org/ abs/2501.12599. H. Lee, J. Liu, D. Kim, Z. Zhang, C. S. Xia, and L. Zhang. Sec-bench pro: Can language models solve long-horizon software security tasks?, 2026. URL https://arxiv.org/abs/2605.26548. S. Lee and D. Brumley. Exploitbench: A capability ladder benchmark for LLM cybersecurity agents, 2026. URL https://arxiv.org/abs/2605.14153. J. Li, W. Zhao, J. Zhao, W. Zeng, H. Wu, X. Wang, R. Ge, Y. Cao, Y. Huang, W. Liu, J. Liu, Z. Su, Y. Guo, F. Zhou, L. Zhang, J. Michelini, X. Wang, X. Yue, S. Zhou, G. Neubig, and J. He. The tool decathlon: Benchmarking language agents for diverse, realistic, and long-horizon task execution. In International Conference on Learning Representations, 2026a. URL https://ar xiv.org/abs/2510.25726. Y. Li, Y. Feng, Z. Xu, Z. Ma, K. Zheng, F. Jiang, X. Sun, R. Shao, Z. Chen, Y. Huang, X. Han, B. Lee, K. Xu, S. Zeng, H. Hua, X. Zhang, B. Alomair, R. Krishna, L. Zettlemoyer, P. W. Koh, B. Ramasubramanian, L. Niu, X. Yue, and R. Poovendran. JobBench: Aligning agent work with human will, 2026b. URL https://arxiv.org/abs/2605.26329. B. Liao, H. Dong, C. Monz, X. Xu, L. Dong, and F. Wei. Multi-turn on-policy distillation with prefix replay, 2026. URL https://arxiv.org/abs/2607.04763. K. Lion, F. Hübler, B. Li, A. Orvieto, and N. He. Muown: Row-norm control for Muon optimization, 2026. URL https://arxiv.org/abs/2605.10797.
  8. A. Liu, B. Feng, B. Xue, B. Wang, B. Wu, C. Lu, C. Zhao, C. Deng, C. Zhang, C. Ruan, et al. Deepseek-v3 technical report, 2024. URL https://arxiv.org/abs/2412.19437. A. Liu, A. Mei, B. Lin, B. Xue, B. Wang, B. Xu, B. Wu, B. Zhang, C. Lin, C. Dong, et al. Deepseek-v3.2: Pushing the frontier of open large language models, 2025a. URL https://arxiv.org/abs/2512.02556. J. Liu, J. Su, X. Yao, Z. Jiang, G. Lai, Y. Du, Y. Qin, W. Xu, E. Lu, J. Yan, Y. Chen, H. Zheng, Y. Liu, S. Liu, B. Yin, W. He, H. Zhu, Y. Wang, J. Wang, M. Dong, Z. Zhang, Y. Kang, H. Zhang, X. Xu, Y. Zhang, Y. Wu, X. Zhou, and Z. Yang. Muon is scalable for LLM training, 2025b. URL https://arxiv.org/abs/2502.16982. W. Ma, H. Zhang, L. Zhao, Y. Song, Y. Wang, Z. Sui, and F. Luo. Stabilizing moe reinforcement learning by aligning training and inference routers, 2025. URL https://arxiv.org/abs/2510.11370. W. Ma, J. Wei, L. Zhao, H. Zhang, B. Xiao, L. Li, Q. Yang, B. Gao, Y. Wang, R. Li, J. Dong, Z. Sui, and F. Luo. Mopd: Multi-teacher on-policy distillation for capability integration in llm post-training, 2026. URL https://arxiv.org/abs/2606.30406. R. Marten, A. Shaw, I. Bercovich, B. Droste, T. Cerruti, S. Dillmann, R. Wang, D. Wahdany, A. Hart, K. Krauth, ScaleAI, Snorkel AI, Turing, gNucleus AI, Boolean AI, N. Carlini, S. Lyu, A. Wei, A. Khatua, B. Plüster, C. Dwivedi, C. Sutcliffe, Yuming, D. Tivris, D. Wang, H. W. Goh, H. Xing, H. Lin, I. Salia, J. Seol, J. Bao, J. Ouyang, J. Park, L. Walsh, L. Kong, M. Ivanov, M. Ubl, M. Liamets, O. Menis, P. Migdal, Q. Bao, R. Movva, R. Ben Chaim, N. Srinath, S. Bogdanik, S.
  9. Yadav, S. Benjamin, T. Kung, W. Hughes, X. Lan, H. Gupta, S. Mishra, C. Wang, H. He, J. Tu, K. Montgomery, Z. Tu, A. Naik, D. Mortensen, I. Zhang, Y. Mathur, E. Liu, K. Singh, M. Yu, S. Feng, V. Gangal, Z. Tao, S. Ruan, J. Mueller, J. Cabezas, J. Bauer, K. X. Li, R. Zhang, A. Feller, A. Madayan, L. Chen, B. Feuer, X. Li, B. Li, H. Raj, S. Galler, L. Shi, I. Segal, K. Buchanan, S. P., R. Desai, A. Schneider, C. Settles, X. Lin, M. Nezhurina, A. Wang, M. Kowalczyk, J.-X. Zhao, S. Satia, J. Hu, S. Atef, K. Chen, S. Vance, G. Segato, J. Jitsev, A. Dimakis, M. Merrill, A. Konwinski, and L. Schmidt. Terminal-Bench, 2026. URL https://github.com/harbor-framework/terminal-bench/releases/tag/v4.0.0. Software release, version 4.0.0. M. A. Merrill, A. G. Shaw, N. Carlini, B. Li, H. Raj, I. Bercovich, L. Shi, J. Y. Shin, T. Walshe, E. K. Buchanan, J. Shen, G. Ye, H. Lin, J. Poulos, M. Wang, M. Nezhurina, J. Jitsev, D. Lu, O. M. Mastromichalakis, Z. Xu, Z. Chen, Y. Liu, R. Zhang, L. L. Chen, A. Kashyap, J.-L. Uslu, J. Li, J. Wu, M. Yan, S. Bian, V. Sharma, K. Sun, S. Dillmann, A. Anand, A. Lanpouthakoun, B. Koopah, C. Hu, E. Guha, G. H. S. Dreiman, J. Zhu, K. Krauth, L. Zhong, N. Muennighoff, R. Amanfu, S. Tan, S. Pimpalgaonkar, T. Aggarwal, X. Lin, X. Lan, X. Zhao, Y. Liang, Y. Wang, Z. Wang, C. Zhou, D. Heineman, H. Liu, H. Trivedi, J. Yang, J. Lin, M. Shetty, M. Yang, N. Omi, N. Raoof, S. Li, T. Y. Zhuo, W. Lin, Y. Dai, Y. Wang, W. Chai, S. Zhou, D. Wahdany, Z. She, J. Hu, Z. Dong, Y. Zhu, S. Cui, A. Saiyed, A. Kolbeinsson, J. Hu, C. M. Rytting, R. Marten, Y. Wang, A. Dimakis, A.
  10. Konwinski, and L. Schmidt. Terminal-Bench: Benchmarking agents on hard, realistic tasks in command line interfaces, 2026. URL https://arxiv.org/abs/2601.11868. P. Moritz, R. Nishihara, S. Wang, A. Tumanov, R. Liaw, E. Liang, M. Elibol, Z. Yang, W. Paul, M. I. Jordan, et al. Ray: A distributed framework for emerging {AI} applications. In 13th USENIX symposium on operating systems design and implementation (OSDI 18), pages 561–577, 2018.
  11. K. Opsahl-Ong, A. Singhvi, J. Collins, I. Zhou, C. Wang, A. Baheti, O. Oertell, J. Portes, S. Havens, E. Elsen, M. Bendersky, M. Zaharia, and X. Chen. Officeqa pro: An enterprise benchmark for end-to-end grounded reasoning, 2026. URL https://arxiv.org/abs/2603.08655. T. Patwardhan, R. Dias, E. Proehl, G. Kim, M. Wang, O. Watkins, S. P. Fishman, M. Aljubeh, P. Thacker, L. Fauconnet, N. S. Kim, P. Chao, S. Miserendino, G. Chabot, D. Li, M. Sharman, A. Barr, A. Glaese, and J. Tworek. GDPval: Evaluating AI model performance on real-world economically valuable tasks, 2025. URL https://arxiv.org/abs/2510.04374. PrimeIntellect. Swe-rl: Software engineering tasks for rl, 2026. URL https://huggingface.co/collections/PrimeIntellect/swe-rl. X. Qu, P. Huang, and S. Horvath. Can Muon fine-tune Adam-pretrained models?, 2026. URL https://arxiv.org/abs/2605.10468. Qwen Team. Qwen3-next: Towards ultimate training & inference efficiency. https://qwen.ai/blog?id=4074cca80393150c248e508aa62983f9cb7d27cd&from=research.latest-advancements-list, September 2025. I. Shah, A. M. Polloreno, K. Stratos, P. Monk, A. Chaluvaraju, A. Hojel, A. Ma, A. Thomas, A. Tanwer, D. J. Shah, K. Nguyen, K. Smith, M. Callahan, M. Pust, M. Parmar, P. Rushton, P. Mazarakis, R. Kapila, S. Srivastava, S. Singla, T. Romanski, Y. Vanjani, and A. Vaswani. Practical efficiency of Muon for pretraining, 2025. URL https://arxiv.org/abs/2505.02222. Z. Shao, P. Wang, Q. Zhu, R. Xu, J. Song, X. Bi, H. Zhang, M. Zhang, Y. K. Li, Y. Wu, and D. Guo.
  12. Deepseekmath: Pushing the limits of mathematical reasoning in open language models, 2024. URL https://arxiv.org/abs/2402.03300. D. Shepard and R. Salimans. AutomationBench, 2026. URL https://arxiv.org/abs/2604.18934. M. Shoeybi, M. Patwary, R. Puri, P. LeGresley, J. Casper, and B. Catanzaro. Megatron-lm: Training multi-billion parameter language models using model parallelism, 2019. URL https://arxiv.org/abs/1909.08053. Y. Sun, X. Han, W. Zhang, Y. Pang, T. Wang, Y. Cao, Y. Huang, C. Duroiu, H. Zhang, J. Lin, W. Zhang, T. Zeng, Y. Yan, B. Liu, H. Wen, M. Xu, X. Liu, Z. Chen, W. Shi, A. Dsouza, V. S. Chen, P. Bryant, C. Boettiger, Y. Rangan, B. Rothenberg, K. Steinfeld, A. Rao, T. Schneider, G. Yannakakis, L. Zanna, K. Ozbay, I. Sim, T. Zohdi, G. E. Karniadakis, J. Gallant, T. Head-Gordon, Y. Li, W. Deng, T. Sun, H. Wang, Z. Wang, J. Xu, C. Y. Liu, Y. Cheng, R. Hu, A. Bacho, S. Cao, Z. Qin, Y. Chen, H. Fan, H. Liu, L. Zeng, S. M. Bharadwaj, L. Gong, Y. Yang, M. Song, R. Wang, Z. Zhang, H. Bao, S. Lu, J. Tu, Z. Wang, Z. Zhang, Z. Chen, Y. Jiang, Z. Li, B. Lyu, C. Ma, P. Xu, B. Zhang, S. Gu, H. Hua, H. Li, W. Liao, C. Liu, J. Peng, H. Sun, Z. Xu, B. Chen, J. Cheng, Y. Jiang, K. Kuang, Y. Li, Y. Pan, Z. Rao, A. Schubert, Y. Shen, V. Siu, X. Sun, K. Zhang, X. Zhang, Y. Zhu, I. S. Chandok, L. Ding, J. Fan, A. Glover, J. Hu, Y. Hu, W. Huang, Z. Jiang, H. Jin, L. Kim, M. Liu, Y. Liu, A. Rafiei, X. Shen, K. Sun, S. Sun, T. Sun, E. Wang, Y. Wang, H. Xing, S. Xu, Y. Xu, Z. Xu, Z. Yan, B. Yuan, R. Zhang, Y. Zhang, Z. Zhao, Liana, S. B. Antu, H. Bai, C. Bosio, J. Cavanagh, P.
  13. Cavazos-Rehg, T. Chen, X. Chen, Y. Chen, C. Zhu, C. Dai, S. D. Castro, Y. Deng, K. Dhole, J. Ding, C. Du, Z. Du, H. Fan, R.-Z. Fan, H. Fu, S. Gu, Y. Gu, C. Guo, B. Huang, B. Huang, R. Jaiswal, Z. Jiang, R. Jin, E. Kasson, X. Lan, J. Lee, D. Lei, C. Li, D. Li, H. Li, H. Li, J. Li, X. Li, Y. Li, Y. Li, Z. Li, W. Liang, L. Liao, K. Q. Lin, A. Z. Liu, C. Liu, J. Liu, K. Liu, X. Liu, P. Lu, W. Lv, Y. Lyu, Q. Mang, K. Montgomery, Y. Nie, R. Ning, J. Overwiening, X. Pan, L. Paraboschi, C. F. Park, J. Purnomo, S. Rajwal, S. Rankin, B. Ren, Y. Rong, H. Shang, V. Shaw, F. Shen, J. Shen, M. Shi, S. Qiu, H. Yao, T. Shi, J. So, V. Susoy, H. Szlyk, H. Wang,
  14. J. Wang, W. Wang, X. Wang, Z. Wang, D. Wong, A. Wu, D. Wu, F. Wu, M. M. Wu, Y. Wu, Y. Wu, Y. Wu, Q. Wuwu, W. Xiao, Y. Xiong, F. Xu, R. Xu, M. Yan, B. Yang, J. Yang, S. Yang, X. Yang, Y. Yang, H. Ye, X. Yu, Z. Yu, C. Zhang, C. Zhang, H. Zhang, H. Zhang, J. Zhang, K. Zhang, S. Zhang, W. Zhang, W. Zhang, Y. Zhang, Y. Zhang, B. Zhao, Q. Zhao, Y. Zhao, Y. Zheng, L. Zhou, T. Zhou, S. Zhu, S. Zhu, Y. Zhu, Y. Zhu, J. Zuo, C. Cai, H. Casademunt, W. Chen, C. Cheng, N. Deng, R. Fu, T. Fu, Y. Han, H. Ren, Z. He, Q. Jin, L. Li, Y. Li, S. Liu, L. Lu, L. Zhou, S. Mukherjee, Y. Ouyang, Y. Ren, D. Shi, H. Wu, Z. Wu, H. Yao, Z. Yi, J. Yu, R. Zhan, H. Zhou, B. Zhu, J. Zhu, A. Yuille, Y. Liu, R. A. Poldrack, J. Li, Z. Li, M. Tao, J. Huang, W. Shi, C. Spanos, L. Sun, C. Wang, O. Xu, Z. Dong, H. Gomez, A. Caliskan, A. Emami, H. Hu, Z. Li, L. Liu, M. Niu, Y. Shao, J. Sun, M. Tolonen, T. Wang, S. Das, Y. Gao, W. Guo, E. J. Schneider, Z. Lu, Y. Ma, M. Mueller, R. Poovendran, S. Sojoudi, Y. Zhu, and D. Song. Agents' last exam, 2026. URL https://arxiv.org/abs/2606.05405. C. Tao, J. Chen, Y. Jiang, K. Kou, S. Wang, R. Wang, X. Li, S. Yang, Y. Du, J. Dai, Z. Mao, X. Wang, L. Shang, and H. Bai. Swe-lego: Pushing the limits of supervised fine-tuning for software issue resolving, 2026. URL https://arxiv.org/abs/2601.01426. The Microsoft AI Team. MAI-Thinking-1: Building a hill-climbing machine. Technical report, Microsoft AI, 2026. URL https://microsoft.ai/pdf/mai-thinking-1.pdf. A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A. N. Gomez, L. Kaiser, and I. Polosukhin.
  15. Attention is all you need. In I. Guyon, U. von Luxburg, S. Bengio, H. M. Wallach, R. Fergus, S. V. N. Vishwanathan, and R. Garnett, editors, Advances in Neural Information Processing Systems 30: Annual Conference on Neural Information Processing Systems 2017, December 4-9, 2017, Long Beach, CA, USA, pages 5998-6008, 2017. URL https://proceedings.neurips.cc/paper/2017/hash/3f5ee243547dee91fbd053c1c4a845aa-Abstract.html. vLLM Project. Humming. https://github.com/vllm-project/humming/releases/tag/v0.1.15, September 2026. Version 0.1.15, GitHub repository, commit a74973b5079e42ef861720b62f847ce9d33447f5; accessed 2026-09-19. Z. Wang, T. Shi, J. He, M. Cai, J. Zhang, and D. Song. Cybergym: Evaluating AI agents' cybersecurity capabilities with real-world vulnerabilities at scale, 2025. URL https://arxiv.org/abs/2506.02548. Z. Wang, N. Schiller, H. Li, S. S. Narayana, M. Nasr, N. Carlini, X. Qi, E. Wallace, E. Bursztein, L. Invernizzi, K. Thomas, Y. Shoshitaishvili, W. Guo, J. He, T. Holz, and D. Song. Exploitgym: Can AI agents turn security vulnerabilities into real attacks?, 2026. URL https://arxiv.org/abs/2605.11086. B. Xia, B. Shen, D. Zhu, D. Zhang, G. Wang, H. Zhang, H. Liu, J. Xiao, J. Dong, L. Zhao, et al. Mimo: Unlocking the reasoning potential of language model-from pretraining to posttraining, 2025. URL https://arxiv.org/abs/2505.07608. L. Xiaomi. Mimo-audio: Audio language models are few-shot learners, 2025. URL https://arxiv.org/abs/2512.23808. T. Xie, D. Zhang, J. Chen, X. Li, S. Zhao, R. Cao, T. J. Hua, Z. Cheng, D. Shin, F. Lei, Y. Liu, Y. Xu, S. Zhou, S.
  16. Savarese, C. Xiong, V. Zhong, and T. Yu. Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments. In A. Globersons, L. Mackey, D. Belgrave, A. Fan, U. Paquet, J. M. Tomczak, and C. Zhang, editors, Advances in Neural Information Processing Systems 37: Annual Conference on Neural Information Processing Systems 2024, NeurIPS 2024, Vancouver, BC, Canada, December 10 - 15, 2024, 2024. doi: 10.5220/07901
  17. 7-1650. URL http://papers.nips.cc/paper_files/paper/2024/hash/5d413e48f84dc61244b6be5
  18. 50f1cd8f5-Abstract-Datasets_and_Benchmarks_Track.html. XLANG Lab. Introducing OSWorld-Verified, July 2025. URL https://xlang.ai/blog/osworld-verified. W. Xu, R. Han, Z. Wang, L. T. Le, D. Madeka, L. Li, W. Y. Wang, R. Agarwal, C. Lee, and T. Pfister. Speculative knowledge distillation: Bridging the teacher-student gap through interleaved sampling. In The Thirteenth International Conference on Learning Representations, ICLR 2025, Singapore, April 24-28, 2025. OpenReview.net, 2025. URL https://openreview.net/forum?id=EgJhwYR2tB. J. Yang, K. Lieret, J. Ma, P. Thakkar, D. Pedchenko, S. Sootla, E. McMilin, P. Yin, R. Hou, G. Synnaeve, D. Yang, and O. Press. Programbench: Can language models rebuild programs from scratch?, 2026a. URL https://arxiv.org/abs/2605.03546. S. Yang, C. Tao, J. Chen, T. Yu, R. Wang, Y. Jiang, Y. Du, W. Xu, J. Xiong, T. Wu, L. Shang, X. Li, N. Wong, and H. Bai. What makes interaction trajectories effective for training terminal agents?, 2026b. URL https://arxiv.org/abs/2606.03461. B. Ye, L. Li, S. Li, Z. Yue, L. Zhang, H. Lv, Y. Liu, W. Ma, H. Tian, R. Li, J. Dong, Y. Zhao, X. Deng, H. Zhang, L. Zhao, Q. Liu, L. Kong, T. Yang, and F. Luo. CodeMidas: Scaling agentic coding rl environments from code itself, 2026. URL https://arxiv.org/abs/2609.22068. Q. Yu, Z. Zhang, R. Zhu, Y. Yuan, X. Zuo, Y. Yue, W. Dai, T. Fan, G. Liu, J. Liu, L. Liu, X. Liu, H. Lin, Z. Lin, B. Ma, G. Sheng, Y. Tong, C. Zhang, M. Zhang, R. Zhang, W. Zhang, H. Zhu, J. Zhu, J. Chen, J. Chen, C. Wang, H.
  19. Yu, Y. Song, X. Wei, H. Zhou, J. Liu, W. Ma, Y. Zhang, L. Yan, Y. Wu, and M. Wang. DAPO: an open-source LLM reinforcement learning system at scale. In D. Belgrave, C. Zhang, L. N. Montoya, H. Lin, R. Pascanu, P. Koniusz, M. Ghassemi, N. Chen, I. V. M. Ruíz, and A. Loaiza-Bonilla, editors, Advances in Neural Information Processing Systems 38: Annual Conference on Neural Information Processing Systems 2025, NeurIPS 2025, San Diego, CA, USA, December 2-7, 2025 / Mexico City, Mexico, November 30 - December 5, 2025, 2025. URL http://papers.nips.cc/paper_files/paper/2025/hash/a4277440d50f1f15d2cb4c14f7e0c0d2-Abstract-Conference.html. Z. Yue, Z. Lin, Y. Song, W. Wang, S. Ren, S. Gu, S. Li, P. Li, L. Zhao, L. Li, et al. Mimo-vl technical report, 2025. URL https://arxiv.org/abs/2506.03569. D. Zan, Z. Huang, W. Liu, H. Chen, S. Xin, L. Zhang, Q. Liu, A. Li, L. Chen, X. Zhong, S. Liu, Y. Xiao, L. Chen, Y. Zhang, J. Su, T. Liu, R. Long, M. Ding, and L. Xiang. Multi-swe bench: A multilingual benchmark for issue resolving. In D. Belgrave, C. Zhang, L. N. Montoya, H. Lin, R. Pascanu, P. Koniusz, M. Ghassemi, N. Chen, I. V. M. Ruíz, and A. Loaiza-Bonilla, editors, Advances in Neural Information Processing Systems 38: Annual Conference on Neural Information Processing Systems 2025, NeurIPS 2025, San Diego, CA, USA, December 2-7, 2025 / Mexico City, Mexico, November 30 - December 5, 2025, 2025. URL http://papers.nips.cc/paper_files/paper/2025/hash/5afa9cb1e917b898ad418216dc726fbd-Abstract-Datasets_and_Benchmarks_Track.html. J. Zhao, G. Chen, F. Meng, M. Li, J. Chen, H. Xu, Y. Sun, X.
  20. Zhao, R. Song, Y. Zhang, P. Wang, C. Chen, J. Wen, and K. Jia. Immersion in the github universe: Scaling coding agents to mastery, 2026. URL https://arxiv.org/abs/2602.09892.
  21. L. Zheng, L. Yin, Z. Xie, C. Sun, J. Huang, C. H. Yu, S. Cao, C. Kozyrakis, I. Stoica, J. E. Gonzalez, C. W. Barrett, and Y. Sheng. Sglang: Efficient execution of structured language model programs. In A. Globersons, L. Mackey, D. Belgrave, A. Fan, U. Paquet, J. M. Tomczak, and C. Zhang, editors, Advances in Neural Information Processing Systems 37: Annual Conference on Neural Information Processing Systems 2024, NeurIPS 2024, Vancouver, BC, Canada, December 10 - 15, 2024, 2024. URL http://papers.nips.cc/paper_files/paper/2024/hash/724be4472168f31ba1c9ac630f15dec8-Abstract-Conference.html.

術語對照表

英文 中文
Accuracy 準確度
Accuracy of Supervision 監督準確度
active parameters 激活參數
Adversarial 對抗性
adversarial testing 對抗性測試
Agent 代理人
agent-centric mid-training phase 以代理人為中心的中訓練階段
Agentic 智能體式
agentic abilities 智能體能力
agentic evaluation 智能體式評估
agentic interaction scenarios 智能體式互動情境
agentic RL 代理式 RL
arithmetic intensity 算術強度
artifact 產物
auxiliary objectives 輔助目標
Batch size 批次大小
binary test outcomes 二元測試結果
Build Task 建構任務
candidate solutions 候選解
Code Generation 程式碼生成
complex problem solving 複雜問題解決
computational cost 計算成本
Consistency 一致性
Context 上下文
contrastive learning 對比學習
control plane 控制平面
Correctness 正確性
credit assignment 信用分配
curation 策展
cybersecurity 網路安全
data modalities 資料模態
data plane 數據平面
data-parallel ranks 數據平行秩
draft block 草稿區塊
dynamic sampler 動態採樣器
Environment 環境
environment construction 環境建構
environment synthesis 環境合成
executable evaluation 可執行評估
execution 執行
execution checks 執行檢查
Exploit 漏洞
fidelity 忠實度
fine-grained distinctions 細粒度區分
general-agent environment 通用代理人環境
Generation 生成
GitHub-based synthesis 基於 GitHub 的合成
Grader 評分器
Gradient 梯度
gradient 梯度
grouped queries 分組查詢
Groupwise Advantage Redistribution (GAR) 組式優勢重分配
groupwise agentic grading 組式智能體式評分
Hacking 鑽漏洞
Harness Harness
Heterogeneous 異質的
heuristic 啟發式
high-concurrency multi-framework rollout 高並發多框架 rollout
high-resolution visual processing 高解析度視覺處理
hybrid sparse MoE Transformer backbone 混合稀疏 MoE Transformer 骨幹
hybrid-SWA architecture 混合 SWA 架構
Inference 推論
inference 推論
information propagation 資訊傳播
iterative 迭代式
KV Cache 鍵值快取
KV cache KV 快取
learning signals 學習訊號
Local Sliding Window Attention 局部滑動視窗注意力
Long-Horizon 長時程的
long-horizon 長程
low-precision computation 低精度計算
matrix structure 矩陣結構
matrix-based update 基於矩陣的更新
model-assisted filters 模型輔助篩選器
multi-constraint requirements 多約束需求
multi-layer defense 多層防禦
multimodal understanding data 多模態理解數據
Observable 可觀察量
omni-modal 全模態
omni-modal data 全模態資料
optimizer mismatch 優化器不匹配
orthogonalizing 正交化
Pack 打包
partial rollout 部分 rollout
Partial Rollout 部分 rollout
Patch 程式碼修補
Phase 相位
Pipeline 管線
Policy 策略
policy 策略
post-training algorithms 後訓練演算法
pre-training corpus 預訓練語料庫
Prefill 預填充
re-prefill 重新預填充
Reliability 可靠性
Replay 重播
Reproducible 可重現的
Reward 獎勵
reward 獎勵
Reward Hacking 獎勵駭客
Reward hacking 獎勵駭入
RL workloads RL 工作負載
Robustness 穩健性
Robustness of Supervision 監督穩健性
Rollout Rollout
rollout rollout
rollout policy rollout 策略
rollout-based audits 基於 rollout 的審計
row-norm control 列範數控制
rubric refinement 評分準則精煉
Sample Mixer 樣本混合器
Scalable 可擴展的
Scenario 情境
Shard 分片
source-code-driven synthesis 源碼驅動合成
Specification 規格
specification-driven tasks 規格驅動任務
spectral-norm drift 譜範數漂移
state 狀態
supervision 監督
task horizons 任務時界
task synthesis 任務合成
task synthesis pathways 任務合成路徑
Throughput 吞吐量
token-efficient Token 效率高的
top-$p$ sampling top-$p$ 採樣
top-p sampling candidate sets top-p 取樣候選集
training 訓練
trajectories 軌跡
unified trajectory representation 統一軌跡代表性
verifiable tasks 可驗證任務
verifiable-task synthesis pipeline 可驗證任務合成管線
Vibe Coding Vibe 編程/氛圍式編程
visual encoder 視覺編碼器
visual fragmentation 視覺碎片化
visual representations 視覺表示
workflows 工作流
← 回到列表
已複製連結