Qwen3 Technical Report
在本研究中,我們介紹 Qwen3,Qwen 模型家族的最新版本。Qwen3 包含一系列大型語言模型 (Large Language Models, LLMs),旨在提升效能、效率和多語言能力。Qwen3 系列涵蓋稠密 (Dense) 和混合專家 (Mixture-of-Expert, MoE) 兩種架構的模型,參數規模從 0.6 億到 2350 億不等。Qwen3 的關鍵創新在於將思考模式 (Thinking Mode)(用於複雜的多步推理)和非思考模式 (Non-thinking Mode)(用於快速的上下文驅動回應)整合到統一框架中。這消除了在不同模型之間切換的需求——例如聊天優化模型(如 GPT-4o)和專用推理模型(如 QwQ-32B)——並能根據使用者查詢或聊天模板進行動態模式切換。同時,Qwen3 引入了思考預算 (Thinking Budget) 機制,允許使用者在推理過程中自適應地分配計算資源,從而根據任務複雜度平衡延遲與效能。此外,藉由利用旗艦模型的知識,我們大幅減少了建構較小規模模型所需的計算資源,同時確保其具有高度競爭力的效能。實證評估表明,Qwen3 在包括程式碼生成、數學推理、智慧代理任務等多樣化基準測試中取得了最先進的結果,與更大型的 MoE 模型和專有模型具有競爭力。與前代 Qwen2.5 相比,Qwen3 將多語言支援從 29 種擴展至 119 種語言和方言,透過改進跨語言理解和生成能力增強了全球可及性。為促進可重現性和社群驅動的研究與開發,所有 Qwen3 模型均以 Apache 2.0 授權公開。
原文連結:arXiv