Less is Enough: Synthesizing Diverse Data in LLM Feature Space with Sparse Autoencoders
Lightning OPD Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation
Large Language Model Post-Training A Unified View of Off-Policy and On-Policy Learning
Rethinking Generalization in Reasoning SFT