L'équipe MiMo de Xiaomi affirme que MiMo-V2.6 pourrait représenter l'une des plus importantes campagnes d'entraînement uniques par apprentissage par renforcement jamais menées par une équipe développant un modèle open source. Malgré des contraintes de puissance de calcul, l'équipe a mobilisé des dizaines de collaborateurs sur une période prolongée afin de faire progresser la mise à l'échelle du RL (apprentissage par renforcement), en utilisant l'entraînement MixRL pour les tâches vérifiables comme le code et en fusionnant les capacités via MOPD pour les scénarios complexes ou difficiles à vérifier.
Pour soutenir la recherche sur l'apprentissage par renforcement des agents, l'équipe a publié un modèle Qwen distillé à partir des trajectoires RL de MiMo, 7 000 environnements variés et un cadre d'entraînement RL complet. Xiaomi a présenté MiMo-V2.6 comme un point de départ et s'est engagé à poursuivre ses investissements en temps, en puissance de calcul et en ressources de R&D afin de développer des systèmes intelligents durables capables de s'améliorer par eux-mêmes.
Xiaomi affirme que MiMo-V2.6 a réalisé l'un des plus grands entraînements RL open source
Avertissement : Le contenu proposé sur Phemex News est à titre informatif uniquement. Nous ne garantissons pas la qualité, l'exactitude ou l'exhaustivité des informations provenant d'articles tiers. Ce contenu ne constitue pas un conseil financier ou d'investissement. Nous vous recommandons vivement d'effectuer vos propres recherches et de consulter un conseiller financier qualifié avant toute décision d'investissement.
