讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: Data Parallelism 1 篇 × 清除
1812.06162v1 arXiv License OpenAI

大批次訓練的一個經驗模型

An Empirical Model of Large-Batch Training

Sam McCandlish、Jared Kaplan、Dario Amodei、以及 OpenAI Dota Team(OpenAI;Jared Kaplan 亦屬 Johns Hopkins Un...

Large-Batch TrainingGradient Noise ScaleData ParallelismOptimizationSGDScalingOpenAI
Liang-Hsun Huang 許願