MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement
MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention
On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
Training LLM Agents for Spontaneous Reward-Free Self-Evolution via World Knowledge Exploration
LongAct Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning