論 Qwen3.8-Next 架構設計:評測、效率與訓練穩定性

On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability

摘要

我們描述 Qwen3.8-Flash-Next 的架構與消融實驗。這是一個稀疏混合專家 (Mixture-of-Experts, MoE) 模型,總參數 125B、每 token 啟用 6B,另有 51B 參數的 N-gram embedding 表存放在加速器之外。在十四項預訓練基準上,本模型有八項領先前代的 397B-A17B 旗艦,其餘落後不超過 2.6 分,而每 token 啟用參數只有 1/3、訓練 token 只有 1/3、訓練 FLOPs 約為 1/9。Token 混合採用 Gated DeltaNet (GDN) 與全域注意力的逐層混合設計,每四層放一層全注意力;在持續預訓練 (Continued Pre-training, CPT) 階段,這些全注意力層會被 Qwen Sparse Attention (QSA) 取代——它用一個壓縮過的輕量索引器,以微區塊 (Micro-block) 粒度為上下文評分。殘差流被拓寬成四條分支,並透過逐元素的閘來讀取,我們稱這個設計為 Gated Residual (GR)。容量則透過骨幹之外的單一 N-gram embedding 層增加,其查找表由主機記憶體預取。我們沿三條軸線評估每一個候選改動:損失連同下游基準;該改動在訓練、prefill 與 decode 上的成本;以及它對最佳超參數與訓練穩定性的影響。損失與下游準確率並不總是同向移動:擴大 N-gram 詞彙表會讓損失單調下降,下游準確率卻會飽和。架構與 Muon 優化器合起來把最佳學習率與批次大小往上推,讓批次大小暖身變得不必要,並在壓力測試下大幅改善穩定性。損失、基準、效率與穩定性是同一個設計問題。把它們一起解,才會得到一份同時更有效率、更有能力、也更穩定的配方。

此論文授權為 未標明授權

非 Creative Commons 授權的論文需登入後方可閱讀翻譯全文

Google 登入後閱讀

原文連結:arXiv