Scaling Data-Constrained Language Models
當前擴展語言模型的趨勢,是同時增加參數量與訓練資料集大小。把這個趨勢外推下去,訓練資料集的大小很快就會被網路上可取得的文字資料量所限制。受這個限制驅動,我們研究在資料受限的區間下擴展語言模型。具體來說,我們執行了一大批實驗,變動資料重複的程度與計算預算,規模最高到 9000 億訓練 token 與 90 億參數的模型。我們發現在固定計算預算、資料受限的情況下,用重複資料訓練最多 4 個 epoch,相對於使用全新資料,損失的變化微乎其微。然而重複更多次之後,增加計算所帶來的價值最終會衰減到零。我們提出並實證驗證了一個計算最優性的 scaling law,它把「重複 token 與多餘參數的價值遞減」納入考量。最後,我們實驗了幾種緩解資料稀缺的做法,包括用程式碼資料增強訓練集,以及移除常用的過濾器。我們 400 次訓練所得的模型與資料集都可在 <https://github.com/huggingface/datablations> 免費取得。 圖 1:重複資料時的報酬 (Return) 與配置 (Allocation)。(左):以重複資料擴展的 LLM(42 億參數)其損失以可預測的方式衰減(§6)。(右):要在重複資料時最大化效能,我們的資料受限 scaling law 與實證資料都指出應該訓練更小的模型、跑更多 epoch,這與「假設 Chinchilla scaling law [42] 對重複資料仍成立」所給出的預測相反(§5)。
原文連結:arXiv