小型大型語言模型:剪枝 vs. 從頭訓練

Small LLMs: Pruning vs. Training from Scratch

摘要

剪枝 (Pruning) 承諾了一條通往強大小型語言模型的捷徑。在本研究中,我們透過對 Llama-3.1-8B 進行剪枝來檢驗這項承諾:採用涵蓋深度 (depth)、寬度 (width) 與稀疏 (sparse) 三種粒度 (granularity) 的六種方法,在 0.5–0.8 的剪枝比例 (pruning ratio) 下,於兩種受控的 token 匹配 (token-matched) 設定中進行比較。 (1) 在相同的訓練 token 預算下,剪枝後的初始化一貫地優於隨機初始化。這顯示父模型 (parent model) 提供了一個強大的起點,儘管此優勢會隨著訓練 token 預算增加以及剪枝比例上升而收窄,在我們研究的最高剪枝比例下幾乎消失。 (2) 當改為給予從頭訓練 (training from scratch)整個流程所消耗的完整 token 預算時,較細粒度的剪枝仍能保有優勢,而較粗粒度的結構化剪枝 (structured pruning) 則可以被追平或超越。這意味著父模型所轉移的知識,僅有在細粒度的情況下,是額外的訓練 token 本身所無法完全恢復的。 綜合來看,我們的結果給出了一個明確的建議:當手上握有一個大型預訓練模型,且訓練 token 預算有限時,剪枝優於從頭訓練;當訓練預算不受限時,從頭訓練在較粗粒度的剪枝上具有競爭力,因此一個大型的預訓練父模型並非總是必要的。 我們的程式碼公開於 github.com/zlab-princeton/pruning-vs-scratch。

此論文授權為 arXiv License

非 Creative Commons 授權的論文需登入後方可閱讀翻譯全文

Google 登入後閱讀

原文連結:arXiv