讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: Post-training 4 篇 × 清除
2602.10388v4 arXiv License Alibaba / Qwen Team

少即足夠:用稀疏自編碼器在 LLM 特徵空間中合成多樣化資料

Less is Enough: Synthesizing Diverse Data in LLM Feature Space with Sparse Autoencoders

Zhongzhi Li, Xuansheng Wu(University of Georgia)、Yijiang Li(UC San Diego)、Lijie Hu(MBZUAI)、Ninghao L...

LLMSparse Autoencoder合成資料Post-training資料多樣性可解釋性SFT
Liang-Hsun Huang 許願
2604.13010v1 CC BY 4.0 Alibaba / Qwen Team

Lightning OPD:利用離線同策略蒸餾實現大型推理模型的高效後訓練

Lightning OPD Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation

Yecheng Wu, Song Han, Han Cai

LLMKnowledge DistillationPost-TrainingOn-PolicyReasoning訓練效率
Teds Lin 許願
2604.07941v1 arXiv License

大型語言模型後訓練:離策略與在策略學習的統一視角

Large Language Model Post-Training A Unified View of Off-Policy and On-Policy Learning

Shiwan Zhao, Zhihu Wang, Xuyang Zhao, Jiaming Zhou, Caiyue Xu, Chenfei Liu, Liting Zhang, Yuhang Jia...

LLMPost-TrainingRLHFSFTPreference OptimizationDistillation綜述
Teds Lin 許願
2604.06628v1 CC BY 4.0 Shanghai Artificial Intelligence Laboratory;Shanghai Jiao Tong University;University of Science and Technology of China

重新思考推理 SFT 中的泛化:對最佳化、資料與模型能力的條件式分析

Rethinking Generalization in Reasoning SFT

Qihan Ren, Peng Wang, Ruikun Cai, Shuai Shao, Dadi Guo, Yuejin Xie, Yafu Li, Quanshi Zhang, Xia Hu, ...

SFTReasoningLong CoTGeneralizationPost-trainingLLMOptimization Dynamics
Teds Lin 許願