Less is Enough: Synthesizing Diverse Data in LLM Feature Space with Sparse Autoencoders
後訓練 (Post-training) 資料的多樣性,對大型語言模型 (Large Language Models, LLMs) 在下游任務上的表現至關重要。許多現有的後訓練資料建構方法,都用文字層面的指標來量化多樣性,捕捉的是語言上的變異,但這類指標對於「真正決定下游表現的任務相關特徵」只能提供很微弱的訊號。在本研究中,我們提出 特徵激活覆蓋率 (Feature Activation Coverage, FAC),在一個可解釋的特徵空間中衡量資料多樣性。以此指標為基礎,我們進一步提出一套由多樣性驅動的資料合成框架,稱為 FAC Synthesis:它先用稀疏自編碼器 (Sparse Autoencoder, SAE) 從種子資料集 (Seed Dataset) 中找出缺失的特徵,再生成能明確體現這些特徵的合成樣本。實驗顯示,我們的方法在指令遵循 (Instruction Following)、毒性偵測 (Toxicity Detection)、獎勵建模 (Reward Modeling) 與行為導向 (Behavior Steering) 等多種任務上,都能同時改善資料多樣性與下游表現。有趣的是,我們發現不同模型家族(即 LLaMA、Mistral 與 Qwen)之間存在一個共享且可解釋的特徵空間,使得跨模型的知識遷移成為可能。本研究為探索 LLM 的資料中心 (Data-centric) 最佳化,提供了一套紮實且實用的方法論。 圖 1:指令遵循資料集的效率前緣 (Efficiency Frontier)(細節見附錄 I.3)。我們的方法只用 2K 筆合成樣本,就在 AlpacaEval 2.0 上取得與 MAGPIE 相當的勝率(MAGPIE 用了 300K 筆樣本)。
原文連結:arXiv