MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention
我們推出 MiniMax-M1,全球第一個開放權重 (open-weight)、大規模的混合注意力 (hybrid-attention) 推理模型。MiniMax-M1 由混合專家混合 (Mixture-of-Experts, MoE) 架構結合閃電注意力 (lightning attention) 機制驅動。該模型基於我們先前的 MiniMax-Text-01 模型 (MiniMax et al., 2025) 開發,總參數 4560 億、每 token 激活 459 億。M1 模型原生支援 100 萬 token 的脈絡長度,是 DeepSeek R1 的 8 倍。此外,MiniMax-M1 的閃電注意力機制使測試時運算 (test-time compute) 能高效擴展——例如,相較於 DeepSeek R1,M1 在生成長度 10 萬 token 時只消耗 25% 的 FLOPs。這些性質使 M1 格外適合「需要處理長輸入、且需要大量思考」的複雜任務。MiniMax-M1 使用大規模強化學習 (RL) 在多樣問題上訓練,範圍從傳統數學推理到基於沙箱的真實世界軟體工程環境。除了閃電注意力對 RL 訓練固有的效率優勢,我們還提出 CISPO——一個進一步增強 RL 效率的新 RL 演算法。CISPO 裁剪的是重要性取樣權重 (importance sampling weight) 而非 token 更新,勝過其他有競爭力的 RL 變體。結合混合注意力與 CISPO,MiniMax-M1 在 512 張 H800 GPU 上的完整 RL 訓練只需三週完成,租金僅 53.47 萬美元。我們釋出兩個版本的 MiniMax-M1 模型,分別有 40K 與 80K 的思考預算 (thinking budget),其中 40K 模型代表 80K 訓練的一個中間階段。標準基準上的實驗顯示我們的模型可與 DeepSeek-R1、Qwen3-235B 等強大開放權重模型媲美或超越,在複雜軟體工程、工具使用與長脈絡任務上尤有優勢。我們公開釋出 MiniMax-M1:https://github.com/MiniMax-AI/MiniMax-M1 。 圖 1: 左:領先的商業與開放權重模型在競賽級數學、程式、軟體工程、代理式工具使用、長脈絡理解任務上的基準效能比較(MiniMax-M1 此處用 MiniMax-M1-80k 模型)。右:理論推論 FLOPs 隨生成長度(token 數)的縮放。
原文連結:arXiv