讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: Muon 4 篇 × 清除
2609.13356v1 CC BY 4.0 Alibaba / Qwen Team

ZGCM-1:一個完全開放、極致高效、面向數學與代理式搜尋的基礎模型

ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search

Jiyan He, Guang Liang, Hao Liu, Haoxiang Guan, Jinbo Sun, Junyi Guo, Wenjun Feng, Yantai Xie, Yifei ...

基礎模型開源模型數學推理代理式搜尋混合注意力FP8Muon長上下文
Liang-Hsun Huang 許願
2608.27370v2 CC BY-SA 4.0 Alibaba / Qwen Team

Puro-2B:窮實驗室在 5090 美元內、用 RTX 5090 訓出的 Qwen2-1.5B

Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090

Kairong Luo、Jiarui Cui、Yaorui Yin、Shengqi Chen 等(清華大學、鵬城實驗室;通訊作者 Kaifeng Lyu、Wenguang Chen)

PretrainingLow-Cost TrainingRTX 5090FP8MuonOpen RecipeScaling Law開源模型
Liang-Hsun Huang 許願
gh-MoonshotAI-Moonlight MIT License Moonshot AI、UCLA

Muon 可以擴展到 LLM 訓練

Muon is Scalable for LLM Training

Jingyuan Liu、Jianlin Su、Xingcheng Yao、Zhejun Jiang、Guokun Lai、Yulun Du、Yidao Qin、Weixin Xu、Enzhe Lu、...

LLMMuonOptimizerMoEScaling Law開源模型
Liang-Hsun Huang 許願
gh-QwenLM-Qwen3.8-Flash-Next 未標明授權 Qwen Team, Alibaba Group

論 Qwen3.8-Next 架構設計:評測、效率與訓練穩定性

On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability

Qwen Team(核心貢獻者:Zihan Qiu、Zekun Wang、Xiao Li、Yanpeng Li、Yang Xu、Yixuan Wang、Huaqing Zhang、Rui Men、Bo...

LLMMoEQwenLinear AttentionSparse AttentionMuon技術報告
Liang-Hsun Huang 許願