hf-XiaomiMiMo-MiMo-V2.6-Flash-RL
MIT License
MIT
MiMo-V2.6:將強化學習擴展至自我改進
MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement
LLM-Core Xiaomi
Reinforcement LearningSelf-ImprovementMoELong ContextMixed-Task Agentic RLReward Hacking Defense
Liang-Hsun Huang 許願