讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: Knowledge Distillation 6 篇 × 清除
2609.24974v1 arXiv License Google

Harness-Zero:透過代理人即Harness進行Harness蒸餾

Harness-Zero: Harness Distillation via Agent-as-Harness

Ye, Haoran、Lu, Yuxing、Dong, Haonan、Su, Zhaochen、Song, Guojie

LLMKnowledge DistillationAgentHarnessLLM-as-JudgeSynthetic DataSelf-Evolution
Liang-Hsun Huang 許願
2604.14191v1 CC BY 4.0

Attention to Mamba:跨架構蒸餾的配方

Attention to Mamba A Recipe for Cross-Architecture Distillation

Abhinav Moudgil, Ningyuan Huang, Eeshan Gunesh Dhekane, Pau Rodríguez, Luca Zappella, Federico Danie...

MambaKnowledge DistillationCross-ArchitectureLinear AttentionHedgehogSSMLLM
Teds Lin 許願
2604.26951v1 CC BY 4.0

翻轉 TIDE:擴散大型語言模型的跨架構蒸餾

Turning the TIDE Cross-Architecture Distillation for Diffusion Large Language Models

Gongbo Zhang, Wen Wang, Ye Tian, Li Yuan

Diffusion LLMKnowledge DistillationCross-ArchitectureCross-TokenizerLLMCode Generation
Liang-Hsun Huang 許願
2604.14164v1 CC BY 4.0 Alibaba / Qwen Team

如何微調推理模型?師生合作框架合成學生一致的 SFT 資料

How to Fine-Tune a Reasoning Model A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data

Zixian Huang, Kaichen Yang, Xu Huang, Feiyang Hao, Qiming Ge, Bowen Li, He Du, Kai Chen, Qipeng Guo

LLMReasoningSFTKnowledge DistillationCatastrophic Forgetting資料合成
Teds Lin 許願
2601.19897v1 CC BY 4.0

自蒸餾實現持續學習

Self-Distillation Enables Continual Learning

Idan Shenfeld, Mehul Damani, Jonas Hübotter, Pulkit Agrawal

LLMContinual LearningKnowledge DistillationOn-Policy LearningInverse RL災難性遺忘
kerg kerg 許願
2604.13010v1 CC BY 4.0 Alibaba / Qwen Team

Lightning OPD:利用離線同策略蒸餾實現大型推理模型的高效後訓練

Lightning OPD Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation

Yecheng Wu, Song Han, Han Cai

LLMKnowledge DistillationPost-TrainingOn-PolicyReasoning訓練效率
Teds Lin 許願