Sparse Upcycling: Training Mixture-of-Experts from Dense Checkpoints
把大型深度神經網路訓練到收斂可能貴到難以負擔。因此,實務上往往只有少數幾個熱門的稠密 (Dense) 模型被跨情境、跨任務地重複使用。稀疏激活 (Sparsely Activated) 模型——試圖把「模型大小」與「計算成本」解耦——正日益成為稠密模型的一個有吸引力的替代方案。稀疏模型雖然在品質與計算成本上更有效率,但在大規模場景下仍然「吃資料」、且從零訓練 (From Scratch) 成本高昂。 本文提出稀疏再造 (Sparse Upcycling)——一個簡單的做法,透過「用一個稠密檢查點來初始化一個稀疏激活的 Mixture-of-Experts (MoE) 模型」,重複利用已投入的沉沒訓練成本 (Sunk Cost)。我們證明:稀疏再造的 T5 Base/Large/XL 語言模型,以及 Vision Transformer Base/Large 模型,在 SuperGLUE 與 ImageNet 上都顯著勝過它們的稠密對照組,而且只用了初始稠密預訓練沉沒成本的約 50%。這些再造模型也勝過「用 100% 初始稠密預訓練計算預算從零訓練的稀疏模型」。 > 【譯註:程式碼開源於 https://github.com/google-research/vmoe (視覺)與 https://github.com/google-research/t5x/tree/main/t5x/contrib/moe (語言)。】
原文連結:arXiv