讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: Transformer 2 篇 × 清除
2602.21371v1 CC BY 4.0

交錯頭注意力機制

Interleaved Head Attention

Sai Surya Duvvuri, Chanakya Ekbote, Rachit Bansal, Rishabh Tiwari, Devvrit Khatri, David Brandfonbre...

LLMAttention MechanismTransformerMulti-Head AttentionReasoning長上下文架構設計
Teds Lin 許願
2405.21060v1 CC BY 4.0

Transformer 即為 SSM:透過結構化狀態空間對偶性的廣義模型與高效演算法

Transformers are SSMs Generalized Models and Efficient Algorithms Through Structured State Space Duality

Tri Dao, Albert Gu

SSMMambaMamba-2Linear AttentionState Space DualityTransformerSequence ModelingICML2024
林伯燊 許願