Команда MiMo компании Xiaomi заявляет, что MiMo-V2.6 может оказаться одним из самых масштабных отдельных циклов обучения с подкреплением, когда-либо проведённых командой разработчиков моделей с открытым исходным кодом. Несмотря на ограничения вычислительных мощностей, команда в течение длительного периода выделяла десятки специалистов для развития масштабирования RL, применяя обучение MixRL для проверяемых задач, таких как код, и объединяя возможности моделей через MOPD для сложных или трудноподдающихся проверке сценариев. Для поддержки исследований в области обучения агентов с подкреплением команда выпустила модель Qwen, дистиллированную из RL-траекторий MiMo, 7 000 разнообразных сред и полноценный фреймворк RL-обучения. В Xiaomi назвали MiMo-V2.6 отправной точкой и заявили о намерении и дальше инвестировать время, вычислительные мощности и ресурсы в НИОКР для создания устойчивых самосовершенствующихся интеллектуальных систем.