讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: MoE 14 篇 × 清除
2609.03181v1 CC BY-NC-SA 4.0 Alibaba / Qwen Team

Jina-OCR-v1:以推測式解碼與稠密可驗證獎勵做高效文件解析

Jina-OCR-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable Rewards

Alejandro Barón García, Feng Wang, Emilia Garcia Casademont, Han Xiao

OCR文件解析推測式解碼MTPGRPORLVRMoE
鄭子凡 許願
hf-XiaomiMiMo-MiMo-V2.6-Flash-RL MIT License MIT

MiMo-V2.6:將強化學習擴展至自我改進

MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement

LLM-Core Xiaomi

Reinforcement LearningSelf-ImprovementMoELong ContextMixed-Task Agentic RLReward Hacking Defense
Liang-Hsun Huang 許願
2212.05055v2 arXiv License Google

稀疏再造 (Sparse Upcycling):從稠密檢查點訓練 Mixture-of-Experts

Sparse Upcycling: Training Mixture-of-Experts from Dense Checkpoints

Aran Komatsuzaki, Joan Puigcerver, James Lee-Thorp, Carlos Riquelme Ruiz, Basil Mustafa, Joshua Ains...

MoEMixture-of-Experts稀疏模型模型再造Vision TransformerT5訓練效率
Liang-Hsun Huang 許願
2506.13585v1 arXiv License Alibaba / Qwen Team

MiniMax-M1:以閃電注意力高效地擴展測試時運算

MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention

MiniMax(通訊:[email protected];共 128 位貢獻者,完整名單見原論文附錄 A)

Reasoning ModelLightning AttentionReinforcement LearningCISPOMoELong Context開源模型
Liang-Hsun Huang 許願
2404.06395v3 CC BY 4.0

MiniCPM:以可擴展的訓練策略揭示小型語言模型的潛力

MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies

Shengding Hu、Yuge Tu、Xu Han、Chaoqun He、Ganqu Cui、Xiang Long、Zhi Zheng、Yewei Fang、Yuxiang Huang 等(清華大...

Small Language ModelWSD SchedulerScaling LawPre-trainingMoELong Context開源模型
Liang-Hsun Huang 許願
gh-MoonshotAI-Moonlight MIT License Moonshot AI、UCLA

Muon 可以擴展到 LLM 訓練

Muon is Scalable for LLM Training

Jingyuan Liu、Jianlin Su、Xingcheng Yao、Zhejun Jiang、Guokun Lai、Yulun Du、Yidao Qin、Weixin Xu、Enzhe Lu、...

LLMMuonOptimizerMoEScaling Law開源模型
Liang-Hsun Huang 許願
gh-MoonshotAI-Kimi-K3 Kimi K3 License Moonshot AI

Kimi K3:開放的前沿智慧

Kimi K3: Open Frontier Intelligence

Kimi Team

LLMMoEKimiAgentLinear AttentionRL開源模型
Liang-Hsun Huang 許願
gh-QwenLM-Qwen3.8-Flash-Next 未標明授權 Qwen Team, Alibaba Group

論 Qwen3.8-Next 架構設計:評測、效率與訓練穩定性

On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability

Qwen Team(核心貢獻者:Zihan Qiu、Zekun Wang、Xiao Li、Yanpeng Li、Yang Xu、Yixuan Wang、Huaqing Zhang、Rui Men、Bo...

LLMMoEQwenLinear AttentionSparse AttentionMuon技術報告
Liang-Hsun Huang 許願
2503.05029v2 CC BY-NC-SA 4.0 Université de Montréal、Mila – Quebec AI Institute、Capital One、University of Chicago、Concordia University

MoE 的持續預訓練:你的路由器有多穩健?

Continual Pre-training of MoEs: How robust is your router?

Benjamin Thérien、Charles-Étienne Joseph、Zain Sarwar、Ashwinee Panda、Anirban Das、Shi-Xiong Zhang、Steph...

MoELLM持續預訓練RoutingLoad BalancingCatastrophic ForgettingReplay
Liang-Hsun Huang 許願
2607.15232v1 CC BY 4.0 MIT

預訓練 LLM 的原地詞元化器擴充

In-Place Tokenizer Expansion for Pre-trained LLMs

Jimmy T. H. Smith, Tarek Dakhran, Alberto Cabrera, Simon S. Lee, Paul Pak, Aditya Tadimeti, Tim Seyd...

LLMTokenizer詞彙擴充多語言持續預訓練On-deviceMoE
Liang-Hsun Huang 許願
2501.02086v3 arXiv License Meta

指令遵循式剪枝:面向大型語言模型

Instruction-Following Pruning for Large Language Models

Bairu Hou, Qibin Chen, Jianyu Wang, Guoli Yin, Chong Wang, Nan Du, Ruoming Pang, Shiyu Chang, Tao Le...

LLM結構化剪枝動態剪枝推論加速指令遵循端側部署MoE
林伯燊 許願
2512.20848v1 CC BY 4.0 Alibaba / Qwen Team

Nemotron 3 Nano:開放高效的 MoE 混合 Mamba-Transformer 智能體推理模型

Nemotron 3 Nano Open Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

NVIDIA(300+ 位貢獻者)

LLMMoEMambaHybrid ArchitectureAgenticRLHF開源模型
林伯燊 許願
2604.12374v1 CC BY 4.0 Alibaba / Qwen Team

Nemotron 3 Super:開源高效混合專家 Mamba-Transformer 模型,面向智能體推理

Nemotron 3 Super Open Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

NVIDIA(數百位貢獻者)

LLMMoEMambaAgenticRLHFQuantization開源模型
Teds Lin 許願
2505.09388v1 arXiv License Alibaba / Qwen Team

Qwen3 技術報告

Qwen3 Technical Report

Qwen Team

LLMMoEQwen開源模型推理模型多語言
Liang-Hsun Huang 許願