讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: Linear Attention 5 篇 × 清除
2412.06464v3 CC BY 4.0 MIT

門控 Delta 網路:用 Delta 規則改進 Mamba2

Gated Delta Networks: Improving Mamba2 with Delta Rule

Songlin Yang(MIT CSAIL,工作於 NVIDIA 實習期間完成)、Jan Kautz(NVIDIA)、Ali Hatamizadeh(NVIDIA)

Linear AttentionMamba2DeltaNetDelta RuleGatingLinear RNNHybrid Model
Liang-Hsun Huang 許願
gh-MoonshotAI-Kimi-K3 Kimi K3 License Moonshot AI

Kimi K3:開放的前沿智慧

Kimi K3: Open Frontier Intelligence

Kimi Team

LLMMoEKimiAgentLinear AttentionRL開源模型
Liang-Hsun Huang 許願
gh-QwenLM-Qwen3.8-Flash-Next 未標明授權 Qwen Team, Alibaba Group

論 Qwen3.8-Next 架構設計:評測、效率與訓練穩定性

On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability

Qwen Team(核心貢獻者:Zihan Qiu、Zekun Wang、Xiao Li、Yanpeng Li、Yang Xu、Yixuan Wang、Huaqing Zhang、Rui Men、Bo...

LLMMoEQwenLinear AttentionSparse AttentionMuon技術報告
Liang-Hsun Huang 許願
2604.14191v1 CC BY 4.0

Attention to Mamba:跨架構蒸餾的配方

Attention to Mamba A Recipe for Cross-Architecture Distillation

Abhinav Moudgil, Ningyuan Huang, Eeshan Gunesh Dhekane, Pau Rodríguez, Luca Zappella, Federico Danie...

MambaKnowledge DistillationCross-ArchitectureLinear AttentionHedgehogSSMLLM
Teds Lin 許願
2405.21060v1 CC BY 4.0

Transformer 即為 SSM:透過結構化狀態空間對偶性的廣義模型與高效演算法

Transformers are SSMs Generalized Models and Efficient Algorithms Through Structured State Space Duality

Tri Dao, Albert Gu

SSMMambaMamba-2Linear AttentionState Space DualityTransformerSequence ModelingICML2024
林伯燊 許願