Das MiMo-Team von Xiaomi erklärt, dass MiMo-V2.6 möglicherweise einer der größten einzelnen Reinforcement-Learning-Trainingsläufe ist, die jemals von einem Open-Source-Modellteam durchgeführt wurden. Trotz Rechenkapazitätsbeschränkungen widmete das Team über einen längeren Zeitraum Dutzende Mitarbeiter der Weiterentwicklung des RL-Scalings und setzte MixRL-Training für überprüfbare Aufgaben wie Code ein, während Fähigkeiten über MOPD für komplexe oder schwer überprüfbare Szenarien zusammengeführt wurden.
Um die Reinforcement-Learning-Forschung für Agenten zu unterstützen, veröffentlichte das Team ein Qwen-Modell, das aus MiMo-RL-Trajektorien destilliert wurde, 7.000 vielfältige Umgebungen sowie ein vollständiges RL-Trainingsframework. Xiaomi bezeichnete MiMo-V2.6 als Ausgangspunkt und verpflichtete sich, weiterhin Zeit, Rechenleistung und F&E-Ressourcen zu investieren, um nachhaltige, sich selbst verbessernde intelligente Systeme zu entwickeln.
Xiaomi behauptet, MiMo-V2.6 habe einen der größten Open-Source-RL-Trainingsläufe durchgeführt
Haftungsausschluss: Die auf Phemex News bereitgestellten Inhalte dienen nur zu Informationszwecken.Wir garantieren nicht die Qualität, Genauigkeit oder Vollständigkeit der Informationen aus Drittquellen.Die Inhalte auf dieser Seite stellen keine Finanz- oder Anlageberatung dar.Wir empfehlen dringend, eigene Recherchen durchzuführen und einen qualifizierten Finanzberater zu konsultieren, bevor Sie Anlageentscheidungen treffen.
