讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: Pretraining 3 篇 × 清除
2608.27370v2 CC BY-SA 4.0 Alibaba / Qwen Team

Puro-2B:窮實驗室在 5090 美元內、用 RTX 5090 訓出的 Qwen2-1.5B

Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090

Kairong Luo、Jiarui Cui、Yaorui Yin、Shengqi Chen 等(清華大學、鵬城實驗室;通訊作者 Kaifeng Lyu、Wenguang Chen)

PretrainingLow-Cost TrainingRTX 5090FP8MuonOpen RecipeScaling Law開源模型
Liang-Hsun Huang 許願
2305.10429v4 arXiv License

DoReMi:最佳化資料混合比例加速語言模型預訓練

DoReMi Optimizing Data Mixtures Speeds Up Language Model Pretraining

Sang Michael Xie, Hieu Pham, Xuanyi Dong, Nan Du, Hanxiao Liu, Yifeng Lu, Percy Liang, Quoc V. Le, T...

LLMData MixingPretrainingDomain ReweightingDistributionally Robust Optimization資料選擇語言模型
Liang-Hsun Huang 許願
2404.19737v1 CC BY 4.0 ¹FAIR at Meta;²CERMICS, École des Ponts ParisTech;³LISN, Université Paris-Saclay

透過多 token 預測打造更好、更快的大型語言模型

Better and Faster Large Language Models via Multi-token Prediction

Fabian Gloeckle*¹,²、Badr Youbi Idrissi*¹,³、Baptiste Rozière¹、David Lopez-Paz⁺¹、Gabriel Synnaeve⁺¹

LLMPretrainingMulti-token PredictionSpeculative DecodingCode GenerationMetaLlama
林伯燊 許願