由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇
Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090
Kairong Luo、Jiarui Cui、Yaorui Yin、Shengqi Chen 等(清華大學、鵬城實驗室;通訊作者 Kaifeng Lyu、Wenguang Chen)
MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies
Shengding Hu、Yuge Tu、Xu Han、Chaoqun He、Ganqu Cui、Xiang Long、Zhi Zheng、Yewei Fang、Yuxiang Huang 等(清華大...
Scaling Data-Constrained Language Models
Niklas Muennighoff、Alexander M. Rush、Boaz Barak、Teven Le Scao、Aleksandra Piktus、Nouamane Tazi、Sampo ...
Muon is Scalable for LLM Training
Jingyuan Liu、Jianlin Su、Xingcheng Yao、Zhejun Jiang、Guokun Lai、Yulun Du、Yidao Qin、Weixin Xu、Enzhe Lu、...