Self-Distilled RLVR:以自我蒸餾改進可驗證獎勵的強化學習

原始論文:Self-Distilled RLVR 作者:Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao, Zheng Lin, Weiping Wang, Jiaqi Wang, Nan Duan arXiv ID:2604.03128v2 日期:2026-04-08 標籤:LLM RLVR Self-Distillation Reasoning RL Multimodal Credit Assignment

目錄

摘要

線上策略蒸餾 (On-policy Distillation, OPD) 在 LLM 社群中已成為一個受歡迎的訓練範式。此範式選擇一個較大的模型作為教師 (Teacher),為每條取樣的軌跡 (Trajectory) 提供密集且細粒度的訊號,相對之下,可驗證獎勵的強化學習 (Reinforcement Learning with Verifiable Rewards, RLVR) 僅能從環境中可驗證的結果取得稀疏訊號。然而,OPD 必須額外維護一個獨立且通常規模更大的教師模型,造成顯著的計算與架構負擔。線上策略自我蒸餾 (On-Policy Self-Distillation, OPSD) 試圖解決此問題,讓單一模型同時扮演教師與學生 (Student),其中教師會以學生無法取得的特權資訊 (Privileged Information) 為條件。

本文證明,僅依賴特權教師所衍生的學習訊號會導致嚴重的資訊洩漏 (Information Leakage) 與長期訓練的不穩定。據此,我們指出自我蒸餾的最佳定位,並提出 RLSD(RLVR with Self-Distillation)。具體而言,我們利用自我蒸餾來取得 token 層級 (Token-level) 的策略差異,藉此決定細粒度的更新幅度;同時繼續採用 RLVR,從環境回饋(如回答正確性)取得可靠的更新方向。這使得 RLSD 能同時兼具 RLVR 與 OPSD 的優點,達到更高的收斂上限與更佳的訓練穩定性。

Figure 1: 在 Qwen3-VL-8B-Instruct 上訓練的效能。(a) OPSD 早期即達到高峰並隨後衰退,而 RLSD 繼承了 GRPO 的訓練穩定性,並達到更高的收斂上限。(b) GRPO 與 RLSD 為 200 訓練步的結果,GRPO (2×timesteps) 為 400 步的結果;RLSD 在 200 步即已超越訓練步數兩倍的 GRPO,展示更快的收斂速度。


1. 引言

近期 LLM 在推理 (Reasoning) 任務上的進展,很大程度上得益於後訓練 (Post-training) 階段中強化學習 (Reinforcement Learning, RL) 的應用。其中,可驗證獎勵的強化學習 (RLVR) 是一個典型代表:模型對提示 (Prompt) 取樣多條候選軌跡,由一個確定性的驗證器 (Verifier) 給予 0/1 獎勵,再以策略梯度 (Policy Gradient) 更新模型。RLVR 對於數學推理、程式碼生成等任務都展現了顯著的成效。

然而,RLVR 的學習訊號是稀疏的 (Sparse):整條軌跡只有一個結果獎勵 (Outcome Reward),且該獎勵在所有 token 上被均勻分配,導致缺乏 token 層級的鑑別力,造成信用分配 (Credit Assignment) 困難。

為了補足訊號密度,社群轉向線上策略蒸餾 (OPD):以一個較強的教師模型對學生取樣的軌跡逐 token 提供分布式 (Distributional) 監督。儘管 OPD 能提供豐富的密集訊號,但它需要一個獨立、且通常較大的教師模型同時駐留於記憶體中,計算與架構成本高昂。

線上策略自我蒸餾 (OPSD) 試圖以同一模型作為教師與學生,其中教師被授予學生在推理時看不到的特權資訊(例如參考解答、驗證後的推理鏈),藉以提供有意義的密集監督。看似精巧,但本文發現 OPSD 在實務上會產生兩個嚴重問題:

  1. 特權資訊洩漏 (Privileged Information Leakage):訓練後的模型在推理時會明確援引那些它根本無法觀察到的「參考解答」。如圖 2 所示,模型輸出中會出現「根據參考解答……」之類的措辭,揭示模型已將不可見的特權資訊以某種形式編碼進參數中。

  2. 長期訓練不穩定:OPSD 的驗證準確率僅在前 10–20 步迅速上升,隨後便單調衰退。這種「先升後降」的曲線意味著 OPSD 無法持續累積進步。

Figure 2: 一個典型範例展示了 OPSD 訓練後模型所表現出的特權資訊洩漏,模型在推理時援引了不可見的參考解答。

我們的關鍵洞見是:當教師條件於學生無法取得的特權資訊 r 時,分布匹配 (Distribution Matching) 目標會變得ill-posed。我們在第 3 節從理論上證明:OPSD 的損失可以分解成「理想目標」加上一個「不可消除的條件互資訊 (Conditional Mutual Information) 殘差」,學生無論容量多大都無法將其消除。優化器在「不可達成」的目標下持續吸收 r 帶來的雜訊,最終學到 x → r 的虛假關聯,這正是洩漏的數學起源。

基於這個診斷,我們提出 RLSD(RLVR with Self-Distillation),不再讓自我蒸餾單獨主導學習方向,而是讓它只負責調整更新幅度:

  • 更新方向 (Direction):完全由環境的可驗證獎勵決定,繼承 RLVR 的可靠性;
  • 更新幅度 (Magnitude):由教師相對於學生的證據比 (Evidence Ratio) $P_T(y_t)/P_S(y_t)$ 來細緻地分配 token 層級信用。

這個解耦讓 RLSD 同時擁有 RLVR 的環境錨定與 OPSD 的密集訊號,但不再受洩漏與不穩定所苦。實驗顯示在五個多模態推理基準上,RLSD 比基底模型平均提升 4.69%,比 GRPO 平均提升 2.32%,並維持訓練穩定性。

本文貢獻:

  1. 我們從理論上證明 OPSD 因資訊不對稱而具有不可消除的互資訊殘差,並由此推導出梯度層級的洩漏機制。
  2. 我們提出 RLSD,將更新方向(由環境獎勵決定)與更新幅度(由教師證據比決定)解耦。
  3. 我們在多個多模態推理基準上驗證了 RLSD 的有效性與穩定性,並提供 token 層級的信用分配可視化。

2. 預備知識

2.1 RLVR 與 GRPO

給定提示 $x$,模型自迴歸地生成回應 $y = (y_1, \ldots, y_T)$。一個確定性驗證器提供二元獎勵 $R(x, y) \in \{0, 1\}$。為了估計優勢 (Advantage),群組相對策略優化 (Group Relative Policy Optimization, GRPO) 對同一提示取樣 $G$ 條軌跡,計算群組相對優勢:

$$ A^{(i)} = \frac{R(x, y^{(i)}) - \mu_G}{\sigma_G} $$

其中 $\mu_G$、$\sigma_G$ 為群組獎勵的均值與標準差。GRPO 的目標函數可寫為:

$$ \mathcal{L}_{\text{GRPO}}(\theta) = \mathbb{E}\left[\frac{1}{G}\sum_{i=1}^{G}\frac{1}{|y^{(i)}|}\sum_{t=1}^{|y^{(i)}|}\min\!\left(\rho_t^{(i)} A^{(i)},\ \mathrm{clip}(\rho_t^{(i)}, 1-\epsilon, 1+\epsilon) A^{(i)}\right)\right] $$

其中 $\rho_t^{(i)}$ 為現策略與舊策略間的重要性取樣比 (Importance Sampling Ratio)。關鍵限制:同一條軌跡的所有 token 共用同一個優勢 $A^{(i)}$,缺乏 token 層級的鑑別力。

2.2 OPD 與 OPSD

線上策略蒸餾類方法(包含 OPD 與 OPSD)皆沿著學生取樣的軌跡,最小化教師與學生之間的逐 token 散度 (Divergence):

$$ \mathcal{L}_{\text{OP(S)D}}(\theta) = \mathbb{E}_{(x, r) \sim \mathcal{S}}\,\mathbb{E}_{\hat{y} \sim P_S(\cdot \mid x)}\!\left[\frac{1}{|\hat{y}|}\sum_{t=1}^{|\hat{y}|} D\!\left(P_T \,\|\, P_S\right)\right] $$

學生分布定義為:

$$ P_S(\cdot \mid y_{<t}) := \pi_\theta(\cdot \mid x, y_{<t}) $$

兩者差別在於教師分布定義:

  • OPD 教師:$P_T(\cdot \mid y_{<t}) := \pi_{\hat{\theta}}(\cdot \mid x, y_{<t})$,其中 $\hat{\theta}$ 為一個獨立的(通常更大的)外部教師模型。
  • OPSD 教師:$P_T(\cdot \mid y_{<t}) := \pi_\theta(\cdot \mid x, r, y_{<t})$,與學生為同一組參數,差別僅在於額外條件於特權資訊 $r$(如參考解答)。

從外觀上看,OPSD 顯得簡潔且高效——免去了維護外部教師的成本——但下一節將揭示,這種「資訊不對稱」的設計會讓目標本身陷入結構性失效。


3. 線上策略自我蒸餾的失效分析

3.1 經驗觀察

我們在多模態推理任務上對 OPSD 進行了訓練,觀察到三個與 OPD 截然不同的現象(見圖 3):

  1. 特權資訊洩漏隨訓練單調增長:模型輸出中明確援引「參考解答」、「正確答案」等不可見資訊的頻率隨步數遞增。
  2. 驗證準確率早期攀升、後期衰退:在 10–20 步內達到峰值,之後持續下滑。
  3. KL 散度停滯:OPD 的教師–學生 KL 會穩定下降;但 OPSD 的 KL 在初期短暫下降後便長期維持在較高水位,無論再如何優化也不再下降。

Figure 3: OPSD 及其消融變體的洩漏率、KL 散度與驗證效能。

3.2 理論分析:資訊不對稱導致目標 ill-posed

我們將上述三個現象統一解釋為一個結構性問題。

定理 1(KL 分解):OPSD 的目標可以分解為

$$ \mathcal{L}_{\text{OPSD}} = \mathcal{L}^* + I(Y_t;\,R \mid X, Y_{<t}) $$

其中:

  • $\mathcal{L}^* = \mathbb{E}_x\!\left[D_{\text{KL}}\!\left(\bar{P}_T(\cdot) \,\|\, P_S(\cdot \mid x)\right)\right]$ 是匹配教師「邊際分布」$\bar{P}_T = \mathbb{E}_r[P_T(\cdot \mid r)]$ 的理想目標;
  • $I(Y_t;\,R \mid X, Y_{<t})$ 是當前 token $Y_t$ 與特權資訊 $R$ 在已給定 $X, Y_{<t}$ 條件下的互資訊。

核心洞見:互資訊項完全由教師的條件分布與 $P(r \mid x)$ 決定,與參數 $\theta$ 無關。換言之,這是一個學生無論如何訓練都無法消除的下界 (Lower Bound)。在學生可行集合 $\mathcal{F} = \{Q : Q(\cdot \mid x, y_{<t}) \text{ 不條件於 } r\}$ 中,全域最優解為 $P_S^* = \bar{P}_T$,此時殘差恰為 $I(Y_t;\,R \mid X, Y_{<t}) > 0$。

為何 KL 停滯? 學生會迅速收斂到教師的邊際分布 $\bar{P}_T$,之後損失便卡在不可消除的殘差項上,再也無法下降——這正是圖 3c 中觀察到的「平台 (Plateau)」現象。

為何發生洩漏? 當目標仍有非零殘差但又無法靠 $\theta$ 縮小時,優化器持續收到的「梯度」其實是把 $r$ 的雜訊吸收進參數的力矩。學生無法直接條件於 $r$,唯一的途徑就是學會「從輸入 $x$ 推測 $r$」的統計關聯——也就是把 $x \to r$ 的對應編碼進 $\theta$。這正是洩漏的數學起源。

相對的,在 OPD 中,外部教師並不條件於學生看不到的資訊,因此互資訊殘差不會出現。

3.3 梯度結構:每樣本分解

命題 1(每樣本梯度分解):對於特定的 $r$,由 log-derivative trick 推得的每樣本梯度可分解為:

$$ g(\theta;\,r) = \underbrace{-\sum_v \bar{P}_T(v)\, \nabla_\theta \log P_S(v)}_{g^*(\theta):\ \text{邊際匹配}} + \underbrace{-\sum_v \left[P_T(v \mid r) - \bar{P}_T(v)\right]\, \nabla_\theta \log P_S(v)}_{\delta(\theta;\,r):\ r\text{-specific 偏差}} $$

其中:

(i) $\mathbb{E}_r[\delta(\theta;\,r)] = 0$(期望為零);

(ii) $\mathbb{E}_r\!\left[\|\delta(\theta;\,r)\|^2\right] = \sum_v \mathrm{Var}_r[P_T(v \mid r)] \cdot \|\nabla_\theta \log P_S(v)\|^2$。

偏差項的變異數會隨著 $I(Y_t;\,R \mid X)$ 單調增長。

兩階段訓練動態 (Two-Phase Training Dynamics):

  • 早期:$P_S$ 距離 $\bar{P}_T$ 較遠,$\|g^*(\theta)\| \gg \|\delta(\theta;\,r)\|$,邊際匹配項主導,驗證準確率快速上升。
  • 後期:$P_S$ 接近 $\bar{P}_T$ 後 $\|g^*(\theta)\|$ 趨近於零,但 $\|\delta(\theta;\,r)\|$ 仍受互資訊下界保護而不會消失。偏差項主導後續更新,路徑相依的雜訊累積會把模型推向編碼 $x \to r$ 關聯的參數區域,觸發自我增強的退化。

3.4 洩漏頻寬的對照實驗

我們進一步測試了三種 OPSD 變體,考察「教師 $r$ 進入梯度方向」的不同頻寬:

  • 完整 OPSD:對所有詞彙位置以 $P_T(v \mid r)$ 加權——頻寬最廣。
  • 教師 Top-1:只把目標縮成 $\arg\max_v P_T(v \mid r)$——頻寬最窄但 $r$ 的注入最集中。
  • 學生 Top-1:限制支撐集為 $\arg\max_v P_S(v)$——中等頻寬。

理論預測這三種變體都應該出現洩漏,因為梯度方向都仍依賴 $r$。實驗結果(圖 3a)證實了預測:三者的洩漏率皆隨步數單調上升,其中「教師 Top-1」由於 $r$ 的注入最集中、最劇烈,反而表現出最嚴重的洩漏。


4. RLSD 方法

Figure 4: RLSD 方法概覽。

4.1 設計原則

第 3 節的分析顯示,OPSD 的問題不在「教師訊號本身有用與否」,而在讓教師訊號決定方向。我們的設計原則是:

方向(direction)由環境獎勵決定,幅度(magnitude)由教師證據比調整。

證據比 $P_T(y_t)/P_S(y_t)$ 衡量「特權資訊把對 $y_t$ 的信念修正了多少」,本質上是 token 層級的信用分配訊號;只要不讓它影響「往哪個方向更新」,就能保留它的細粒度資訊而不引入洩漏。

4.2 RLSD 的構造

步驟 1:特權資訊增益 (Privileged Information Gain)

$$ \Delta_t = \mathrm{sg}\!\left(\log P_T(y_t) - \log P_S(y_t)\right) $$

其中 $\mathrm{sg}(\cdot)$ 為 stop-gradient。$\Delta_t > 0$ 表示 $r$ 支持該 token;$\Delta_t < 0$ 表示 $r$ 不支持。stop-gradient 確保 $\Delta_t$ 純粹作為加權,不引入額外梯度通道。

步驟 2:方向感知的證據再加權 (Direction-Aware Evidence Reweighting)

$$ w_t = \exp\!\left(\mathrm{sign}(A) \cdot \Delta_t\right) = \left(\frac{P_T(y_t)}{P_S(y_t)}\right)^{\mathrm{sign}(A)} $$

  • 當 $A > 0$(軌跡正確):$w_t = P_T/P_S$,將更多正向信用集中到「特權資訊支持的 token」。
  • 當 $A < 0$(軌跡錯誤):$w_t = P_S/P_T$,將更多負向責備加在「特權資訊不支持的 token」,而對被支持的 token 減輕懲罰。

由於 $\exp(\cdot) > 0$ 恆正,加權只會調整相對幅度而不會翻轉符號——強化或懲罰的決定權仍完全屬於環境獎勵。

步驟 3:裁剪後的信用分配 (Clipped Credit Assignment)

$$ \hat{A}_t = A \cdot \mathrm{clip}\!\left(w_t, 1-\epsilon_w, 1+\epsilon_w\right) $$

裁剪界限了 token 層級的信用偏離,類似 PPO/GRPO 中的重要性比裁剪,扮演信賴域 (Trust Region) 的角色。

最終目標函數:

$$ \mathcal{L}_{\text{RLSD}}(\theta) = \mathbb{E}\!\left\{\frac{1}{G}\sum_{i=1}^{G}\frac{1}{|y^{(i)}|}\sum_{t=1}^{|y^{(i)}|}\min\!\left[w_t A^{(i)},\ \mathrm{clip}(w_t, 1-\epsilon_w, 1+\epsilon_w) A^{(i)}\right]\right\} $$

4.3 與 GRPO 的整合

RLSD 是 GRPO 的「即插即用 (Drop-in)」替換:把 GRPO 中對所有 token 共用的均勻優勢,換成由 $w_t$ 重新加權的 token 層級優勢。每條回應只需多做一次教師前向傳播 (Forward Pass) 以取得 $P_T(y_t)$,相對於 rollout 生成的代價可忽略不計。

4.4 訓練範式比較

下表(Table 1)對比了主要的後訓練範式:

方法 Trajectory 效率 洩漏風險 訊號 方向來源
SFT 離線策略 (Off-policy) 高 N/A 豐富 教師
RLVR (GRPO) 線上策略 (On-policy) 高 N/A 弱 環境
OPD 線上策略 低 N/A 豐富 教師
OPSD 線上策略 高 嚴重 豐富 教師
RLSD(本文) 線上策略 高 N/A 豐富 環境

RLSD 是唯一同時兼具「線上策略 + 高效率 + 環境錨定 + 豐富訊號 + 無洩漏風險」的設定。


5. 實驗

5.1 設定

訓練資料:採用 MMFineReason-123K 的難度過濾子集,僅保留 Qwen3-VL-4B-Thinking 在 4 次 rollout 全部失敗的樣本,以確保訓練集中於模型尚未掌握的困難案例。

評估基準:五個多模態推理基準

  • MMMU:大學程度的跨學科多模態理解與推理。
  • MathVista:視覺脈絡下的數學推理。
  • MathVision:競賽等級的視覺數學題。
  • ZeroBench:對前沿多模態模型的壓力測試。
  • WeMath:分難度結構化的數學題。

基底模型:Qwen3-VL-8B-Instruct。

訓練設定:批次大小 256,每個提示取樣 8 條 rollout(溫度 1.0)。最大上下文長度 8192(提示 4096、回應 4096)。GRPO 類方法學習率 $1\times 10^{-6}$;OPSD/SDPO 類方法學習率 $1\times 10^{-5}$。裁剪參數 $\epsilon_{\text{low}} = 0.2$、$\epsilon_{\text{high}} = 0.28$。實驗在 4 個節點、每節點 8 張 NVIDIA H200 GPU 上完成。

比較方法:Base LLM(無後訓練)、GRPO、OPSD、SDPO(自我蒸餾搭配環境回饋)、GRPO+OPSD(兩者結合)、RLSD(本文)。

5.2 主要結果

下表呈現 Table 2 在五個基準上的準確率(%):

方法 MMMU MathVista MathVision ZeroBench WeMath Avg.
Base LLM 62.44 73.80 47.37 19.76 54.10 51.49
GRPO 65.11 76.20 48.82 22.60 56.57 53.86
OPSD 63.82 75.10 47.53 21.06 54.95 52.49
SDPO 65.11 74.00 47.27 25.15 52.19 52.74
GRPO+OPSD 63.22 75.90 48.52 22.16 54.76 52.91
RLSD(本文) 67.22 78.10 52.73 24.85 58.00 56.18

關鍵觀察:

  • RLSD 平均較基底模型提升 4.69%,較 GRPO 提升 2.32%。
  • OPSD 在多數基準上反而低於 GRPO,與我們在第 3 節觀察到的後期衰退一致。
  • 數學領域提升最為顯著:MathVision +3.91%、MathVista +1.9%(相對於 GRPO)。

5.3 訓練動態

Figure 5: 多模態推理任務上的訓練動態。

從訓練曲線(圖 5)可以觀察:

  1. 更陡的早期上升:RLSD 比 GRPO 更快收斂,比 OPSD 更穩定,沒有後期衰退。
  2. 保持較高的策略熵 (Entropy):避免均勻獎勵把所有 token 位置一起壓縮,保留探索能力。
  3. 裁剪機制持續啟動:訓練中裁剪率穩定維持在 3–6%,扮演信賴域約束的角色,避免單一 token 的極端權重破壞訓練。

5.4 質性分析:Token 層級信用熱圖

[Figure 6: Token 層級信用熱圖(RLSD 下兩個多模態推理範例)。上:在正確軌跡中,較大的信用集中在關鍵的計數與減法步驟。下:在錯誤軌跡中,最強的責備被分配到誤讀的 bar-model 關係與導出的錯誤答案。]

熱圖顯示 RLSD 並未把獎勵均勻地散佈在整條序列上,而是把信用集中於「決定推理對錯」的關鍵 token,這種集中度正是密集訊號相對於稀疏訊號的價值所在。


6. 相關工作

RLVR 中的信用分配:許多工作試圖把序列層級的稀疏獎勵轉成 token 或步驟層級的密集訊號,包括過程獎勵模型 (Process Reward Model, PRM)、步驟層級的價值估計、以及利用模型內部代理(熵、不確定性、注意力動態)的方法(Lightman et al., 2024; Wang et al., 2024b; Luo et al., 2024; Xie et al., 2025; Li et al., 2026 等)。RLSD 與這些工作不同,它無需訓練輔助網路,僅以一次教師前向便得到 token 層級的細粒度訊號。

線上策略蒸餾:包含使用外部教師的 OPD(Agarwal et al., 2024; Lu & Thinking Machines Lab, 2025)、自我蒸餾 OPSD(Zhao et al., 2026; Hübotter et al., 2026),以及 context-conditioned teaching、推理壓縮等方向。本文揭露了 OPSD 在資訊不對稱下的結構性失效,並指出自我蒸餾的合理位置。

特權資訊蒸餾:與本文同期的若干工作也注意到教師–學生間的不對稱問題,並提出不同的緩解方案。


7. 結論

本文揭示了線上策略自我蒸餾 (OPSD) 在資訊不對稱下的本質困境:教師若條件於學生不可見的特權資訊 $r$,分布匹配目標便存在不可消除的條件互資訊殘差,導致 KL 停滯、特權資訊洩漏與長期訓練不穩定。從梯度結構出發,我們進一步證明 OPSD 的更新會在訓練後期被 $r$-specific 偏差主導,自我增強地把 $x \to r$ 的虛假關聯編碼進參數。

基於此診斷,我們提出 RLSD,將「方向」與「幅度」解耦:環境的可驗證獎勵獨佔強化或懲罰的方向決策,而教師證據比 $P_T(y_t)/P_S(y_t)$ 僅作為 token 層級的相對幅度調整。RLSD 同時保留了 RLVR 的環境錨定可靠性與 OPSD 的密集訊號豐富性,在五個多模態推理基準上以 4.69%(vs. base)/ 2.32%(vs. GRPO)的平均提升證實其有效性與穩定性。

侷限性:本文版本主要驗證於多模態推理任務。作者表示在文字推理、影片理解與其他模型家族上的初步驗證亦觀察到一致的提升,將於後續版本中呈現。


參考文獻

  1. Shao et al. (2024). DeepSeekMath: Pushing the limits of mathematical reasoning in open language models. arXiv:2402.03300
  2. DeepSeek-AI et al. (2025). DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning. arXiv:2501.12948
  3. Kimi Team et al. (2026a). Kimi K2.5: Visual agentic intelligence. arXiv:2602.02276
  4. Agarwal et al. (2024). On-policy distillation of language models: Learning from self-generated mistakes. In Proceedings of ICLR 2024.
  5. Lu & Thinking Machines Lab (2025). On-policy distillation. Thinking Machines Lab: Connectionism.
  6. Core Team et al. (2026b). MIMO-V2-Flash technical report. arXiv:2601.02780
  7. Zhao et al. (2026). Self-distilled reasoner: On-policy self-distillation for large language models. arXiv:2601.18734
  8. Hübotter et al. (2026). Reinforcement learning via self-distillation. arXiv:2601.20802
  9. Schulman et al. (2017). Proximal policy optimization algorithms. arXiv:1707.06347
  10. Xie et al. (2025). Unlocking exploration in RLVR: Uncertainty-aware advantage shaping for deeper reasoning. arXiv:2510.10649
  11. Li et al. (2026). Outcome-grounded advantage reshaping for fine-grained credit assignment in mathematical reasoning. arXiv:2601.07408
  12. Kingma & Ba (2017). Adam: A method for stochastic optimization. arXiv:1412.6980
  13. Lin et al. (2026). MMFineReason: Closing the multimodal reasoning gap via open data-centric methods. arXiv:2601.21821
  14. Yue et al. (2024). MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert AGI. arXiv:2311.16502
  15. Lu et al. (2024). MathVista: Evaluating mathematical reasoning of foundation models in visual contexts. arXiv:2310.02255
  16. Wang et al. (2024a). Measuring multimodal mathematical reasoning with Math-Vision dataset. arXiv:2402.14804
  17. Roberts et al. (2025). ZeroBench: An impossible visual benchmark for contemporary large multimodal models. arXiv:2502.09696
  18. Qiao et al. (2024). WE-Math: Does your large multimodal model achieve human-like mathematical reasoning? arXiv:2407.01284
  19. Bai et al. (2025). Qwen3-VL technical report. arXiv:2511.21631
  20. Sheng et al. (2025). HybridFlow: A flexible and efficient RLHF framework. In Proceedings of EuroSys 2025.
  21. Zheng et al. (2025). EasyR1: An efficient, scalable, multi-modality RL training framework. GitHub repository.
  22. Lightman et al. (2024). Let's verify step by step. In Proceedings of ICLR 2024.
  23. Wang et al. (2024b). Math-Shepherd: Verify and reinforce LLMs step-by-step without human annotations. In Proceedings of ACL 2024.
  24. Yang et al. (2025a). Test-time prompt intervention. arXiv:2508.02511
  25. Luo et al. (2024). Improve mathematical reasoning in language models by automated process supervision. arXiv:2406.06592

術語對照表

英文 中文
On-policy Distillation (OPD) 線上策略蒸餾
On-Policy Self-Distillation (OPSD) 線上策略自我蒸餾
Reinforcement Learning with Verifiable Rewards (RLVR) 可驗證獎勵的強化學習
Group Relative Policy Optimization (GRPO) 群組相對策略優化
Privileged Information 特權資訊
Privileged Information Leakage 特權資訊洩漏
Information Asymmetry 資訊不對稱
Credit Assignment 信用分配
Token-level token 層級
Trajectory 軌跡
Distribution Matching 分布匹配
Conditional Mutual Information 條件互資訊
Evidence Ratio 證據比
Policy Gradient 策略梯度
Importance Sampling Ratio 重要性取樣比
Advantage 優勢
Outcome Reward 結果獎勵
Verifier 驗證器
Teacher 教師(模型)
Student 學生(模型)
Direction 更新方向
Magnitude 更新幅度
Stop-gradient stop-gradient(停止梯度)
Process Reward Model (PRM) 過程獎勵模型
Trust Region 信賴域
Two-Phase Training Dynamics 兩階段訓練動態
Plateau 平台(停滯)
Forward Pass 前向傳播
Drop-in 即插即用
Off-policy 離線策略
On-policy 線上策略
Lower Bound 下界
Sparse 稀疏
Post-training 後訓練
Reasoning 推理
Rollout rollout(取樣展開)
Entropy 熵
Ill-posed 病態(無良定)
← 回到列表
已複製連結