XiaomiのMiMoチームは、MiMo-V2.6がオープンソースモデルチームによって実施された史上最大規模の単一強化学習トレーニングの一つとなる可能性があるとしている。計算リソースの制約にもかかわらず、チームは数十人の人員を長期間にわたって投入し、RLスケーリングの推進に取り組んだ。コードなどの検証可能なタスクにはMixRLトレーニングを活用し、複雑または検証が難しいシナリオについてはMOPDを通じて能力を統合している。 エージェント強化学習の研究を支援するため、チームはMiMoのRL軌跡から蒸留されたQwenモデル、7,000の多様な環境、そして完全なRLトレーニングフレームワークを公開した。XiaomiはMiMo-V2.6を出発点と位置づけ、持続的に自己改善するインテリジェントシステムを開発するために、時間、計算リソース、研究開発リソースへの継続的な投資を約束した。