讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: SFT 6 篇 × 清除
2602.10388v4 arXiv License Alibaba / Qwen Team

少即足夠:用稀疏自編碼器在 LLM 特徵空間中合成多樣化資料

Less is Enough: Synthesizing Diverse Data in LLM Feature Space with Sparse Autoencoders

Zhongzhi Li, Xuansheng Wu(University of Georgia)、Yijiang Li(UC San Diego)、Lijie Hu(MBZUAI)、Ninghao L...

LLMSparse Autoencoder合成資料Post-training資料多樣性可解釋性SFT
Liang-Hsun Huang 許願
2605.13301v1 CC BY 4.0

透過簡單且統一的擴展實現金牌級奧林匹亞推理

Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling

Yafu Li, Runzhe Zhan, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Zhilin Wang, Jiacheng Chen, Futing Wan...

LLMReasoningRLVRSFTTest-time Scaling數學推理Olympiad
Teds Lin 許願
2506.04178v2 CC BY 4.0 Alibaba / Qwen Team

OpenThoughts:推理模型的資料配方

OpenThoughts Data Recipes for Reasoning Models

Etash Guha, et al.

LLMReasoningData RecipeSFTOpen DatasetDistillationBenchmark
Thomas Liang 許願
2604.14164v1 CC BY 4.0 Alibaba / Qwen Team

如何微調推理模型?師生合作框架合成學生一致的 SFT 資料

How to Fine-Tune a Reasoning Model A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data

Zixian Huang, Kaichen Yang, Xu Huang, Feiyang Hao, Qiming Ge, Bowen Li, He Du, Kai Chen, Qipeng Guo

LLMReasoningSFTKnowledge DistillationCatastrophic Forgetting資料合成
Teds Lin 許願
2604.07941v1 arXiv License

大型語言模型後訓練:離策略與在策略學習的統一視角

Large Language Model Post-Training A Unified View of Off-Policy and On-Policy Learning

Shiwan Zhao, Zhihu Wang, Xuyang Zhao, Jiaming Zhou, Caiyue Xu, Chenfei Liu, Liting Zhang, Yuhang Jia...

LLMPost-TrainingRLHFSFTPreference OptimizationDistillation綜述
Teds Lin 許願
2604.06628v1 CC BY 4.0 Shanghai Artificial Intelligence Laboratory;Shanghai Jiao Tong University;University of Science and Technology of China

重新思考推理 SFT 中的泛化:對最佳化、資料與模型能力的條件式分析

Rethinking Generalization in Reasoning SFT

Qihan Ren, Peng Wang, Ruikun Cai, Shuai Shao, Dadi Guo, Yuejin Xie, Yafu Li, Quanshi Zhang, Xia Hu, ...

SFTReasoningLong CoTGeneralizationPost-trainingLLMOptimization Dynamics
Teds Lin 許願