2404.19737v1
CC BY 4.0
¹FAIR at Meta;²CERMICS, École des Ponts ParisTech;³LISN, Université Paris-Saclay
透過多 token 預測打造更好、更快的大型語言模型
Better and Faster Large Language Models via Multi-token Prediction
Fabian Gloeckle*¹,²、Badr Youbi Idrissi*¹,³、Baptiste Rozière¹、David Lopez-Paz⁺¹、Gabriel Synnaeve⁺¹
LLMPretrainingMulti-token PredictionSpeculative DecodingCode GenerationMetaLlama
林伯燊 許願