翻轉 TIDE:擴散大型語言模型的跨架構蒸餾

原始論文:Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models 作者:Gongbo Zhang, Wen Wang, Ye Tian, Li Yuan arXiv ID:2604.26951v1 日期:2026-04-29 標籤:Diffusion LLM Knowledge Distillation Cross-Architecture Cross-Tokenizer LLM Code Generation

目錄

摘要

擴散大型語言模型 (Diffusion Large Language Models, dLLMs) 提供了平行解碼 (Parallel Decoding) 與雙向上下文 (Bidirectional Context) 的能力,但目前最先進的 dLLMs 需要數十億參數才能達到具競爭力的表現。雖然現有針對 dLLMs 的蒸餾方法可以在單一架構內減少推理步驟,但尚未有方法處理跨架構知識遷移 (Cross-Architecture Knowledge Transfer)——即教師模型與學生模型在架構、注意力機制 (Attention Mechanism) 與分詞器 (Tokenizer) 上皆有所不同的情境。

我們提出 Tide,這是首個針對 dLLM 跨架構蒸餾的框架,由三個模組化元件組成:(1) Tidal,依據訓練進度與擴散時間步 (Diffusion Timestep) 共同調節蒸餾強度,以反映教師模型隨雜訊變化的可靠度;(2) CompDemo,透過互補遮罩切分 (Complementary Mask Splitting) 豐富教師上下文,以改善高遮罩率下的預測;(3) Reverse Calm,這是一個跨分詞器目標函數,透過反轉區塊級似然匹配 (Chunk-level Likelihood Matching),產生有界梯度與雙端雜訊過濾。將 8B 稠密 (Dense) 教師與 16B MoE 教師蒸餾至 0.6B 學生模型,透過兩條異質管線 (Heterogeneous Pipelines) 在八項基準測試上平均優於基線 1.53 分,其中在程式碼生成上獲得顯著進步——HumanEval 分數達到 48.78,相對於同尺寸自迴歸 (Autoregressive, AR) 基線的 32.3 分。


1. 引言

自迴歸語言模型 (Autoregressive Language Models) 主導著自然語言生成領域 (Vaswani et al., 2017; Yang et al., 2024; 2025),然而擴散語言模型 (Diffusion Language Models) 已逐漸成為一種替代範式 (Paradigm)。早期工作如 D3PM (Austin et al., 2021a) 與 MDLM (Sahoo et al., 2024) 探索了基本的訓練架構。近期工作如 LLaDA (Nie et al., 2025) 與 Dream (Ye et al., 2025) 將模型規模擴展至大型語言模型的等級。例如最近的 LLaDA 2.0 (Bie et al., 2025) 將模型規模擴展至 100B,達到了新的最先進水準。與自迴歸模型相比,dLLMs 透過迭代去噪 (Iterative Denoising) 一個完全遮罩的序列,實現了平行解碼與雙向上下文。然而,具競爭力的 dLLMs 需要 8B-16B 甚至更多參數與計算成本 (Nie et al., 2025; Liu et al., 2025; Bie et al., 2025; Ye et al., 2025),對部署形成了障礙(圖 1)。

圖 1:dLLMs 的跨架構蒸餾。相較於先前保留原始模型大小的步驟蒸餾 (a),Tide 框架 (b) 將異質的 16B MoE 與 8B 稠密教師蒸餾至 0.6B 學生模型。

開發更強小型模型的一個直接方案是知識蒸餾 (Knowledge Distillation) (Hinton et al., 2015),它將大型模型壓縮為較小的模型。針對自迴歸語言模型,諸如 MiniLLM (Gu et al., 2024)、DistiLLM (Ko et al.)、GKD (Agarwal et al., 2024) 與 TAID (Shing et al., 2025) 等方法已相當成熟,包含各種設計,例如新的 Kullback-Leibler 散度損失 (KL Divergence Loss)、利用教師模型的回饋等。然而對 dLLMs 而言,現有方法——CDLM (Kim et al., 2025)、DDD (Hayakawa et al., 2024)、LSD (Fu et al., 2025) 與 SDTT (Deschenaux and Gulcehre, 2024)——皆專注於單一架構內的步驟壓縮,跨架構蒸餾仍未被探索。

此情境引入了三個根本性挑戰:

  1. 時間挑戰:由於訓練過程中時間步的隨機採樣,教師可靠度在擴散過程中劇烈波動,導致時間動態 (Temporal Dynamics) 不一致。
  2. 空間挑戰:高雜訊水準下的嚴重遮罩大幅減少了可用上下文,使教師的原始輸出過於缺乏資訊,難以遷移豐富的空間表徵 (Spatial Representations)。
  3. 詞彙挑戰:不同分詞器詞彙表使得標準的詞元級 (Token-level) 似然目標在數學上不適用。

在本工作中,我們提出 Tide(圖 2),這是首個專為跨架構 dLLM 蒸餾設計的統一框架,旨在全面克服上述時間、空間與詞彙障礙。Tide 並非孤立地處理這些挑戰,而是整合了三個協同元件,協調出一條端到端的學習管線:

  • 排程層級 (Tidal):為解決時間不一致問題,Tidal 沿訓練進度與擴散時間步雙軸動態調制蒸餾強度。它扮演框架的節律器 (Pacemaker),確保學生僅在教師的時間步相依信號高度可靠時才選擇性地學習。
  • 上下文層級 (CompDemo):在此排程過程中運作,CompDemo 克服高雜訊水準下嚴重遮罩造成的上下文稀缺問題。它透過互補遮罩切分豐富教師信號,提供學生以示範條件化的目標 (Demonstration-conditioned Targets),實現穩健的空間知識遷移。
  • 輸出層級 (Reverse Calm):最後,為將豐富的上下文知識映射至學生的輸出空間,Reverse Calm 克服了跨分詞器障礙。透過反轉區塊級似然匹配,它避免了直接詞元映射的不穩定性,達成有界梯度與雙端雜訊過濾。

圖 2:Tide 框架概覽。透過三個模組化元件將知識從大型教師遷移至 0.6B 學生:(1) Tidal 進行雙軸插值,(2) CompDemo 進行互補教師示範,(3) Reverse Calm 進行跨分詞器對齊。

整體而言,這三個模組構成了一個整合框架:Tidal 控制何時跨時間步學習,CompDemo 決定要豐富什麼上下文資訊,Reverse Calm 規範如何將此知識投影至不同的詞彙表。

我們在兩條異質管線上驗證 Tide:(A) 跨分詞器蒸餾——從 16B MoE 教師 (LLaDA2 (Bie et al., 2025)) 蒸餾,與 (B) 共享分詞器蒸餾——從 8B 稠密教師 (WeDLM (Liu et al., 2025)) 蒸餾,兩者皆蒸餾至 0.6B 區塊擴散學生 (BD3LM (Arriola et al., 2025))。最佳配置在八項基準的平均上比未蒸餾基線提升 +1.53(34.20 對 32.67),其中蒸餾後的 dLLMs 在程式碼生成上表現優異(HumanEval 達 48.78,同尺寸 AR 模型僅 32.3)。消融實驗證實每條管線偏好不同策略,驗證了模組化設計的有效性。

我們的主要貢獻為:

  • 我們提出 Tide,這是首個針對 dLLMs 的跨架構知識蒸餾框架,專為克服異質遷移中的挑戰而設計,例如不同的時間步可靠度、不匹配的注意力機制與不同的分詞器。
  • 我們提出三個全新的模組化元件以實現此遷移:Tidal 用於雙軸時間步感知的蒸餾排程、CompDemo 透過互補遮罩豐富教師信號、Reverse Calm 用於穩健的跨分詞器對齊。
  • 跨八項基準與兩條管線的實驗顯示跨架構 dLLM 蒸餾是有效的。消融實驗證實每個元件皆有貢獻,且每條管線偏好不同的配置。

2. 方法

Tide(圖 2)處理的問題是:將大型教師 dLLM $f_T$(參數為 $\theta_T$)蒸餾至較小的學生 dLLM $f_S$(參數為 $\theta_S$),其中教師與學生在基礎模型架構、注意力機制與分詞器詞彙上可能不同。設 $\mathbf{x}=(x_1,\ldots,x_L)$ 表示乾淨的詞元序列,$\mathbf{x}_t$ 表示在擴散時間步 $t \in [\epsilon, 1)$ 時的雜訊版本,其中遮罩集合 $\mathcal{M}$ 內的位置被替換為特殊的 [MASK] 詞元。學生模型被訓練以預測遮罩位置上的乾淨詞元,並由真實標籤 (Ground-truth Labels) 與教師預測的類別詞元分布 (Categorical Token Distribution) 共同指導。

2.1 時間-迭代雙軸 Lambda 調制 (Tidal)

dLLMs 的知識蒸餾遭遇一個自迴歸蒸餾中沒有的獨特挑戰:教師信號的可靠度隨擴散時間步而變化。在低遮罩率時 ($t \approx 0$),教師觀察到幾乎整個序列,產生高度可靠的預測。反之在高遮罩率時 ($t \approx 1$),即使是大型教師模型也主要靠猜測。此外,學生模型吸收教師知識的能力在訓練過程中不斷演進。這兩個現象促使我們採用一種雙軸排程 (Dual-Axis Scheduling),沿擴散時間步與訓練進度兩個軸共同調制蒸餾強度。

軸 1:擴散時間步。 為反映教師的時間步相依可靠度,我們依據當前擴散時間步 $t$ 調制插值係數 (Interpolation Coefficient) $\lambda_t$:

$$\lambda_t = \lambda_{\text{train}} \times (1-t),$$

其中 $\lambda_{\text{train}}$ 表示由訓練進度決定的基準係數(下文定義)。在高雜訊水準下 ($t \approx 1$),$\lambda_t \approx 0$,目標由學生主導,從而避免蒸餾來自教師的不可靠信號。在低雜訊水準下 ($t \approx 0$),$\lambda_t \approx \lambda_{\text{train}}$,學生完全依賴教師。此軸是 dLLMs 獨有的;在 AR 模型中,教師始終可存取完整的左側上下文,使預測一致可靠,因此不需要時間步相依的調制。

軸 2:訓練進度。 基準係數 $\lambda_{\text{train}}$ 在正規化訓練進度 $p \in [0, 1]$ 上遵循餘弦排程 (Cosine Schedule):

$$\lambda_{\text{train}} = \lambda_{\text{init}} + (\lambda_{\max} - \lambda_{\text{init}}) \times \frac{1}{2}(1 - \cos(\pi \cdot p)),$$

其中 $\lambda_{\text{init}}$ 與 $\lambda_{\max}$ 為超參數,預設值通常分別設為 0.1 與 0.9。在訓練初期,$\lambda_{\text{train}} \approx \lambda_{\text{init}}$,確保目標由學生模型主導,以防止表徵崩塌 (Representation Collapse)。隨著訓練進入後期,$\lambda_{\text{train}}$ 趨近 $\lambda_{\max}$,將學習目標轉向全面的教師監督。

TAID (Shing et al., 2025) 曾為 AR 模型提出類似的基於插值的蒸餾方法。然而 TAID 僅沿單一軸(訓練進度)運作,並未考量教師的時間步相依可靠度,而這正是 dLLM 設定特有的問題。我們的時間-迭代雙軸 Lambda 調制 (Time-Iteration Dual-Axis Lambda modulation, Tidal) 透過引入一個全新的擴散時間步軸,將此原則加以延伸。

插值目標與損失。 給定遮罩位置上的學生 logits $\mathbf{s}$ 與教師 logits $\mathbf{t}$,插值目標的公式為:

$$\mathbf{r}_t = \text{softmax}(((1-\lambda_t) \cdot \mathbf{s} + \lambda_t \cdot \mathbf{t})/T),$$

其中 $T$ 表示溫度參數。為防止梯度通過混合目標流動,插值目標 $\mathbf{r}_t$ 從計算圖中分離。因此 Tidal 損失定義為:

$$\mathcal{L}_{\text{TIDAL}} = D_{\text{KL}}(\mathbf{r}_t \,\|\, \text{softmax}(\mathbf{s}/T)) \times T^2.$$

為維持記憶體效率,此損失僅在遮罩位置計算。可選地,可套用中間範圍時間步加權 $w(t) = \exp(-(t-0.5)^2 / (2\sigma^2))$,其中 $\sigma=0.15$,以強調最具資訊量的時間步。

2.2 互補示範 (CompDemo)

在標準的 dLLM 蒸餾中,教師模型接收與學生模型完全相同的遮罩輸入 $\mathbf{x}_t$。在高遮罩率下,有限的上下文導致教師產生雜訊預測,從而降低蒸餾信號的品質。為解決此限制,我們提出互補示範條件化去噪 (Complementary Demonstration-Conditioned Denoising, CompDemo),利用遮罩結構來豐富提供給教師的上下文。此機制是 dLLMs 特有的,在 AR 蒸餾中沒有對應物。

動機。 在 dLLMs 中,教師必須在嚴重遮罩下進行去噪,在高遮罩率下會產生雜訊預測。Shenfeld et al. (2026) 顯示在 AR 設定下,示範條件化的教師能產生更佳的訓練信號。離散擴散提供了一個自然的類比:揭示部分遮罩詞元能將教師移至較低的有效時間步,改善其預測。我們將遮罩位置劃分為兩個互補子集;每個子集作為兩次教師前向傳遞之一的額外上下文,使每個遮罩位置都能受益於豐富的上下文。

遮罩切分。 給定遮罩位置集合 $\mathcal{M}$,我們將其隨機劃分為兩個互補子集 $\mathcal{M}_A$ 與 $\mathcal{M}_B$,使得:

$$\mathcal{M}_A \cup \mathcal{M}_B = \mathcal{M}, \quad \mathcal{M}_A \cap \mathcal{M}_B = \emptyset, \quad |\mathcal{M}_A|/|\mathcal{M}| \approx \rho,$$

其中 $\rho = 0.5$ 表示示範比例 (Demonstration Ratio)。

雙次教師推論。 我們對凍結的教師模型進行兩次前向傳遞:

  • Pass 1:$\mathbf{t}^{(1)} = f_T(\text{揭示 } \mathcal{M}_A, \text{遮罩 } \mathcal{M}_B) \to \mathcal{M}_B$ 上的 logits
  • Pass 2:$\mathbf{t}^{(2)} = f_T(\text{揭示 } \mathcal{M}_B, \text{遮罩 } \mathcal{M}_A) \to \mathcal{M}_A$ 上的 logits

在 Pass 1 中,$\mathcal{M}_A$ 中的位置保留乾淨詞元作為示範上下文,而 $\mathcal{M}_B$ 仍被遮罩;Pass 2 為對稱配置。合併的 logits 為 $\mathbf{t}_{\text{final}}[\mathcal{M}_B] \leftarrow \mathbf{t}^{(1)}[\mathcal{M}_B]$ 與 $\mathbf{t}_{\text{final}}[\mathcal{M}_A] \leftarrow \mathbf{t}^{(2)}[\mathcal{M}_A]$。

成本分析。 CompDemo 將教師的前向傳遞次數加倍,但由於教師被凍結(不需梯度計算),整體訓練時間僅增加約 50%。

2.3 蒸餾目標函數

Tide 支援兩種蒸餾管線,取決於教師與學生模型之間的分詞器相容性。對每條管線,我們設計一個量身打造、考量對齊粒度的目標。

共享分詞器目標 (WeDLM → BD3LM)。 當教師與學生模型共用相同的分詞器家族 (Liu et al., 2025) 時,詞元級的分布可直接比較。我們在詞元級套用 Tidal 損失(章節 2.1)使用 KL 散度,並可結合可選的 CompDemo(章節 2.2):

$$\mathcal{L}_B = \mathcal{L}_{\text{CE}} + w_{\text{tidal}} \cdot \mathcal{L}_{\text{TIDAL}}.$$

跨分詞器目標 (LLaDA2 → BD3LM)。 當教師與學生使用不同分詞器 ($\mathcal{V}_T \neq \mathcal{V}_S$) 時,由於詞彙不對齊,詞元級 KL 散度未定義。為解決此限制,我們提出區塊級近似似然匹配 (Chunk-level Approximate Likelihood Matching, Calm),將 ALM (Minixhofer et al., 2025) 改造至 dLLM 設定。

區塊對齊。 使用 tokenkit (Minixhofer et al., 2024; 2025),我們在位元組層級對齊兩個詞元序列以辨識區塊 (Chunks)——包含每個詞彙表中一或多個完整詞元的最小文字跨度。設 $C$ 表示對齊區塊總數。我們建構二元對齊矩陣 $\mathbf{A}_S \in \{0,1\}^{L_S \times C}$ 與 $\mathbf{A}_T \in \{0,1\}^{L_T \times C}$,當且僅當學生詞元 $i$ 被指派至區塊 $c$ 時 $[\mathbf{A}_S]_{(i,c)} = 1$。由於教師與學生模型使用不同且不相容特殊詞元的對話模板,我們將對齊過程僅限於內容詞元。我們排除模板特定標記,以防止形成虛假的跨分詞器區塊。

區塊級對數機率。 對每個詞元 $x_i$,對數機率計算為 $\log P(x_i) = \text{logits}_{x_i} - \text{logsumexp}(\text{logits})$,以避免實體化完整的 $[b, L, V]$ softmax 矩陣。隨後透過矩陣乘法獲得區塊級對數機率:

$$LP_S = \mathbf{lp}_S \cdot \mathbf{A}_S \in \mathbb{R}^{b \times C}, \quad LP_T = \mathbf{lp}_T \cdot \mathbf{A}_T \in \mathbb{R}^{b \times C},$$

其中 $\mathbf{lp}_S$ 與 $\mathbf{lp}_T$ 表示每詞元對數機率向量。區塊機率隨後透過溫度縮放導出:$p_s^c = \exp(LP_S^c / T)$ 與 $p_t^c = \exp(LP_T^c / T)$。

Forward Calm。 一個自然的基線是在遮罩位置上對區塊機率施加前向(覆蓋模式)二元交叉熵 (Binary Cross-Entropy, BCE) 損失:

$$\mathcal{L}_{\text{Fwd-CALM}} = -[p_t^c \log p_s^c + (1-p_t^c) \log(1-p_s^c)].$$

注意 Calm 操作於純量區塊機率 $p^c \in [0, 1]$ 上,因此 BCE 是適切的損失,且其前向/反向分析與詞元級蒸餾使用的 KL 散度不同。

Forward Calm 目標可進一步與 Tidal 的漸進式課程整合,方法是在區塊機率空間內進行插值:

$$p_{\text{mix}} = (1-\lambda_t) \cdot p_s^c + \lambda_t \cdot p_t^c,$$

$$\mathcal{L}_{\text{CALM-TIDAL}} = -[p_{\text{mix}} \log p_s^c + (1-p_{\text{mix}}) \log(1-p_s^c)].$$

Forward Calm 的限制。 前向 BCE 梯度包含比值 $p_t^c / p_s^c$。當 $p_t^c \to 1$ 但 $p_s^c \to 0$ 時(在不完美的跨分詞器對齊下這很常見),此比值會發散,造成梯度爆炸 (Gradient Explosion)。$1/p_s^c$ 項也會無差別地放大來自不對齊區塊的雜訊。

Reverse Calm。 為解決這些限制,我們提出反向 Calm (Reverse Calm),反轉 BCE 損失的方向:

$$\mathcal{L}_{\text{Rev-CALM}} = -[p_s^c \log p_t^c + (1-p_s^c) \log(1-p_t^c)].$$

交換 $p_s^c$ 與 $p_t^c$ 使梯度係數變為 $\log(p_t^c / (1-p_t^c))$,僅取決於固定的教師且有界。這也提供了雙端雜訊過濾 (Dual-end Noise Filtering):對齊不佳的區塊($p_t^c \approx 0.5$)使係數歸零,而低 $p_s^c$ 透過小的 $\partial p_s^c / \partial \theta$ 抑制雜訊。Reverse Calm 等價於最小化 Bernoulli KL $\text{KL}_{\text{Bern}}(p_s^c \,\|\, p_t^c)$,即純量空間中的尋模 (Mode-seeking) 目標(附錄 C)。由於 Tidal 針對的是前向目標的不穩定性,對 Reverse Calm 而言反而不利,因此不予套用(附錄 C)。

訓練目標。 跨分詞器管線結合交叉熵與蒸餾損失:

$$\mathcal{L}_A = \mathcal{L}_{\text{CE}} + w_{\text{calm}} \cdot \mathcal{L}_{\text{dist}}, \quad \text{其中 } \mathcal{L}_{\text{dist}} \in \{\mathcal{L}_{\text{CALM-TIDAL}}, \mathcal{L}_{\text{Rev-CALM}}\}.$$

兩種損失皆在遮罩位置計算。當啟用 CompDemo 時,教師 logits 替換為合併的雙次傳遞 logits(章節 2.2)。


3. 實驗

3.1 實驗設定

模型。 學生模型為 Qwen3-0.6B-BD3LM,這是一個從 Qwen3-0.6B-Base 初始化的 0.6B 參數區塊擴散語言模型。我們使用兩個異質教師:LLaDA2.0-mini(16B MoE,獨立分詞器)與 WeDLM-8B-Instruct(8B 稠密因果 dLLM)。

訓練細節。 採用學習率 5e-5、10 個 epoch、bfloat16 精度。資料集結合 Tulu-3 SFT Mixture、SmolTalk 與 OpenCoder OPC-SFT Stage 1 與 Stage 2。學生序列長度為 512 詞元,區塊大小為 32。

評估。 使用八項基準:GSM8K、MATH、BBH、MMLU-Pro、HellaSwag、MMLU、HumanEval 與 MBPP。基線包含 Qwen3-0.6B-Base(AR 模型)與未蒸餾的 BD3LM。

3.2 主要結果

表 1:八項基準上的主要結果(BD3LM 基線對比蒸餾變體)

基準 AR BD3LM KL Tide-Cross Tide-Shared CALM Tide-Shared Tide-Cross
GSM8K 59.60 45.56 43.97 45.03 48.98 48.60 49.89 52.24
MATH 32.40 13.08 9.40 9.76 11.16 13.14 12.98 13.20
BBH 41.50 26.32 25.79 26.00 26.79 24.21 26.85 27.37
MMLU-Pro 24.70 13.80 13.19 12.88 14.48 13.47 14.02 14.52
HellaSwag 47.40 39.28 39.78 39.50 40.50 40.42 39.57 39.88
MMLU 52.80 39.15 39.57 39.09 39.92 39.42 39.54 39.59
HumanEval 32.30 46.34 41.46 42.68 48.78 43.90 49.39 48.17
MBPP 36.60 37.80 31.20 31.40 37.80 34.80 38.40 38.60
平均 40.91 32.67 30.55 30.79 33.55 32.25 33.83 34.20

主要發現:

  • 兩條 Tide 管線均一致優於未蒸餾的 BD3LM 基線。 跨分詞器管線達到最高平均 34.20,共享分詞器管線達到 33.55。
  • 每條管線偏好其本身的策略: 跨分詞器管線的本身策略 Tide-Cross 比 Tide-Shared 平均高出 0.37 分;而共享分詞器管線的 Tide-Shared 比 Tide-Cross 高出 2.76 分。
  • 蒸餾的 dLLMs 在程式碼生成上表現優異: 在 HumanEval 上,Tide-Shared 達到 48.78,Tide-Cross 達到 48.17,大幅超越同尺寸自迴歸模型的 32.30 分。

圖 3:相對於 WeDLM 教師在 GSM8K 資料集上的 KL 散度。蒸餾後的學生達成的 KL 散度比未蒸餾基線低 46%(6.69 對 12.44)。

3.3 消融研究

表 2:共享分詞器管線上的元件級消融

基準 基線 移除 Tstep 移除 CompDemo 完整
GSM8K 48.07 48.82 48.90 48.90
MATH 11.74 11.96 11.84 11.68
BBH 26.37 26.51 26.77 26.66
MMLU-Pro 14.12 14.42 13.76 13.76
HellaSwag 40.03 40.35 40.16 40.27
MMLU 39.81 39.84 39.58 39.92
HumanEval 45.73 43.90 44.51 46.95
MBPP 38.60 37.20 38.20 37.00
平均 33.06 32.88 32.97 33.14

完整方法達到最高平均分數 33.14。

  • 時間步軸是影響最大的元件: 移除造成 0.26 平均降幅,主要來自 HumanEval 下降 3.05 分。
  • CompDemo 提供一致的增益: 移除使平均減少 0.17,最顯著的下降出現在 HumanEval(-2.44)與 MMLU(-0.34)。

3.4 推理效率

表 3:推理效率比較(受控設定)

模型 參數量 (B) 峰值記憶體 (GB) 延遲 (秒) 詞元/秒
Distilled (蒸餾後) 0.60 1.4 6.25 41.0
No Distill (未蒸餾) 0.60 1.4 6.08 42.1
Qwen3-0.6B 0.60 1.2 4.99 51.3
WeDLM-8B 8.19 15.5 6.79 37.7
LLaDA2.0-mini 16.26 31.3 32.55 7.8

蒸餾學生模型僅需 1.4 GB 峰值記憶體,相對於 LLaDA2 (31.3 GB) 是 22 倍的減少。

表 4:每項基準的推理速度(詞元/秒)

基準 LLaDA2 WeDLM Qwen3 No Distill Distilled
GSM8K 8.3 38.6 51.4 41.9 40.7
MATH 10.3 38.4 51.1 41.8 40.6
BBH 9.8 38.5 51.1 42.0 40.9
MMLU-Pro 5.6 38.3 51.0 42.2 40.5
HellaSwag 6.8 37.2 51.5 42.4 40.6
MMLU 6.2 37.1 51.4 41.9 41.1
HumanEval 9.8 36.8 51.1 42.5 41.7
MBPP 9.1 37.0 51.8 42.3 41.6
平均 8.2 37.7 51.3 42.1 40.9

蒸餾相對於未蒸餾 BD3LM 僅引入 2.6% 的吞吐量降低(41.0 對 42.1 詞元/秒)。


4. 結論

我們提出 Tide,這是首個針對異質 dLLMs 的跨架構蒸餾框架。實驗顯示:(1) 跨架構蒸餾平均比基線提升 +1.53;(2) 每條管線偏好不同策略(跨分詞器管線偏好 Reverse Calm,共享分詞器管線偏好 Tidal + CompDemo);(3) 蒸餾後的 dLLMs 在 HumanEval 上比同尺寸 AR 模型高出 +16.48 分。


附錄 D:限制與未來工作

本工作的實驗範圍僅限於使用區塊擴散與階梯式注意力 (Staircase Attention) 的 0.6B 參數學生模型。未來工作包含:將學生擴展至 1.3B 或 3B、在替代架構上驗證、以及延伸至連續狀態擴散模型 (Continuous-state Diffusion Models)。

訓練管線目前在 512 詞元上下文視窗內運作,跨分詞器對齊與 CompDemo 在更長序列上的有效性尚待探索。其他延伸方向包含:探索統一的多教師目標,以結合異質教師的互補優勢。


參考文獻

  1. Vaswani et al. Attention is all you need. Advances in neural information processing systems 30, 2017.
  2. Yang et al. Qwen2.5 technical report. arXiv preprint arXiv:2412.15115, 2024.
  3. Austin et al. Structured denoising diffusion models in discrete state-spaces. Advances in neural information processing systems 34, 2021a.
  4. Sahoo et al. Simple and effective masked diffusion language models. Advances in Neural Information Processing Systems 37, 2024.
  5. Nie et al. Large language diffusion models. arXiv preprint arXiv:2502.09992, 2025.
  6. Bie et al. LLaDA2.0: scaling up diffusion language models to 100B. arXiv preprint arXiv:2512.15745, 2025.
  7. Arriola et al. Block diffusion: interpolating between autoregressive and diffusion language models. arXiv preprint arXiv:2503.09573, 2025.
  8. Ye et al. Dream 7B: diffusion large language models. arXiv preprint arXiv:2508.15487, 2025.
  9. Liu et al. WeDLM: reconciling diffusion language models with standard causal attention. arXiv preprint arXiv:2512.22737, 2025.
  10. Hinton et al. Distilling the knowledge in a neural network. arXiv preprint arXiv:1503.02531, 2015.
  11. Gu et al. MiniLLM: knowledge distillation of large language models. The Twelfth International Conference on Learning Representations, 2024.
  12. Ko et al. DistiLLM: towards streamlined distillation for large language models. Forty-first International Conference on Machine Learning.
  13. Agarwal et al. On-policy distillation of language models: learning from self-generated mistakes. The Twelfth International Conference on Learning Representations, 2024.
  14. Shing et al. TAID: temporally adaptive interpolated distillation for efficient knowledge transfer in language models. arXiv preprint arXiv:2501.16937, 2025.
  15. Kim et al. CDLM: consistency diffusion language models for faster sampling. arXiv preprint arXiv:2511.19269, 2025.
  16. Hayakawa et al. DDD: distillation for discrete diffusion models. 2024.
  17. Fu et al. LSD: latent score distillation for diffusion language models. 2025.
  18. Deschenaux and Gulcehre. SDTT: score distillation through time for masked diffusion. 2024.
  19. Minixhofer et al. tokenkit: byte-level tokenizer alignment toolkit. 2024; 2025.
  20. Shenfeld et al. Demonstration-conditioned distillation for autoregressive language models. 2026.

術語對照表

English 繁體中文
Diffusion Large Language Model (dLLM) 擴散大型語言模型
Cross-Architecture Distillation 跨架構蒸餾
Knowledge Distillation 知識蒸餾
Knowledge Transfer 知識遷移
Autoregressive (AR) 自迴歸
Parallel Decoding 平行解碼
Bidirectional Context 雙向上下文
Iterative Denoising 迭代去噪
Tokenizer 分詞器
Vocabulary 詞彙表
Cross-Tokenizer 跨分詞器
Shared-Tokenizer 共享分詞器
Attention Mechanism 注意力機制
Block Diffusion 區塊擴散
Staircase Attention 階梯式注意力
Mixture of Experts (MoE) 混合專家
Diffusion Timestep 擴散時間步
Mask 遮罩
Masked Position 遮罩位置
Mask Splitting 遮罩切分
Complementary Demonstration 互補示範
Demonstration-conditioned 示範條件化
Demonstration Ratio 示範比例
Interpolation Coefficient 插值係數
Cosine Schedule 餘弦排程
Dual-Axis Scheduling 雙軸排程
Training Progress 訓練進度
Representation Collapse 表徵崩塌
Spatial Representation 空間表徵
Temporal Dynamics 時間動態
Categorical Token Distribution 類別詞元分布
Logits logits(保留原文)
Softmax softmax(保留原文)
Temperature 溫度
KL Divergence KL 散度
Kullback-Leibler Divergence Kullback-Leibler 散度
Binary Cross-Entropy (BCE) 二元交叉熵
Cross-Entropy 交叉熵
Mode-Covering 覆蓋模式
Mode-Seeking 尋模
Bernoulli KL Bernoulli KL 散度
Gradient Explosion 梯度爆炸
Bounded Gradients 有界梯度
Dual-end Noise Filtering 雙端雜訊過濾
Chunk-level Likelihood Matching 區塊級似然匹配
Approximate Likelihood Matching (ALM) 近似似然匹配
Chunk Alignment 區塊對齊
Token-level 詞元級
Byte-level 位元組層級
Ground-truth Labels 真實標籤
Heterogeneous Pipeline 異質管線
Pacemaker 節律器
Continuous-state Diffusion Model 連續狀態擴散模型
Throughput 吞吐量
Latency 延遲
Peak Memory 峰值記憶體
Code Generation 程式碼生成
Benchmark 基準測試
Ablation Study 消融研究
← 回到列表
已複製連結