讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: LLaMA 3 篇 × 清除
2605.14589v2 CC BY 4.0

EndPrompt:透過終端錨定 (Terminal Anchoring) 達成高效長上下文擴展

EndPrompt: Efficient Long-Context Extension via Terminal Anchoring

Han Tian, Luxuan Chen, Xinran Chen, Rui Kong, Fang Wang, Jiamin Chen, Jinman Zhao, Yuchen Li, Jiashu...

LLMLong-ContextRoPEPosition InterpolationContext ExtensionLLaMA高效訓練
Teds Lin 許願
2606.14150v2 arXiv License Carnegie Mellon University

小型大型語言模型:剪枝 vs. 從頭訓練

Small LLMs: Pruning vs. Training from Scratch

Yufeng Xu, Taiming Lu, Kunjun Li, Jiachen Zhu, Mingjie Sun, Zhuang Liu(Princeton University, New Yor...

LLMPruning剪枝Sparse初始化Llama小型模型
kerg kerg 許願
2404.19737v1 CC BY 4.0 ¹FAIR at Meta;²CERMICS, École des Ponts ParisTech;³LISN, Université Paris-Saclay

透過多 token 預測打造更好、更快的大型語言模型

Better and Faster Large Language Models via Multi-token Prediction

Fabian Gloeckle*¹,²、Badr Youbi Idrissi*¹,³、Baptiste Rozière¹、David Lopez-Paz⁺¹、Gabriel Synnaeve⁺¹

LLMPretrainingMulti-token PredictionSpeculative DecodingCode GenerationMetaLlama
林伯燊 許願