Instruction-Following Pruning for Large Language Models
隨著大型語言模型 (Large Language Models, LLMs) 的快速擴展,結構化剪枝 (Structured Pruning) 已成為一項被廣泛採用的技術,可從較大的模型中學習出更高效、更小的模型,其效能優於從頭開始訓練同等規模的模型。在本文中,我們超越了傳統那種為模型決定一個固定剪枝遮罩 (Pruning Mask) 的靜態剪枝做法,提出一種動態的結構化剪枝方法。在我們的方法中,剪枝遮罩取決於輸入 (input-dependent),並會根據使用者指令 (user instruction) 中描述的資訊動態調整。 我們的方法稱為「指令遵循式剪枝 (Instruction-Following Pruning)」,它引入了一個稀疏遮罩預測器 (sparse mask predictor),以使用者指令作為輸入,並針對給定任務動態選擇最相關的模型參數。為了辨識並啟用 (activate) 有效的參數,我們同時最佳化稀疏遮罩預測器與 LLM,並善用指令遵循資料 (instruction-following data) 與預訓練語料庫 (pre-training corpus)。實驗結果在多種評測基準上展示了我們方法的有效性。例如,我們啟用 3B 參數的模型在數學與程式碼撰寫等領域上,比 3B 稠密模型 (dense model) 高出 5 到 8 個絕對百分點,並可與 9B 模型的效能相媲美。 關鍵詞:Machine Learning, ICML
原文連結:arXiv