讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: Code Generation 2 篇 × 清除
2604.26951v1 CC BY 4.0

翻轉 TIDE:擴散大型語言模型的跨架構蒸餾

Turning the TIDE Cross-Architecture Distillation for Diffusion Large Language Models

Gongbo Zhang, Wen Wang, Ye Tian, Li Yuan

Diffusion LLMKnowledge DistillationCross-ArchitectureCross-TokenizerLLMCode Generation
Liang-Hsun Huang 許願
2404.19737v1 CC BY 4.0 ¹FAIR at Meta;²CERMICS, École des Ponts ParisTech;³LISN, Université Paris-Saclay

透過多 token 預測打造更好、更快的大型語言模型

Better and Faster Large Language Models via Multi-token Prediction

Fabian Gloeckle*¹,²、Badr Youbi Idrissi*¹,³、Baptiste Rozière¹、David Lopez-Paz⁺¹、Gabriel Synnaeve⁺¹

LLMPretrainingMulti-token PredictionSpeculative DecodingCode GenerationMetaLlama
林伯燊 許願