Less is Enough: Synthesizing Diverse Data in LLM Feature Space with Sparse Autoencoders
Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling
OpenThoughts Data Recipes for Reasoning Models
How to Fine-Tune a Reasoning Model A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data
Large Language Model Post-Training A Unified View of Off-Policy and On-Policy Learning
Rethinking Generalization in Reasoning SFT