XiaomiのMiMoチームは、MiMo-V2.6がオープンソースモデルチームによって実施された史上最大規模の単一強化学習トレーニングの一つとなる可能性があるとしている。計算リソースの制約にもかかわらず、チームは数十人の人員を長期間にわたって投入し、RLスケーリングの推進に取り組んだ。コードなどの検証可能なタスクにはMixRLトレーニングを活用し、複雑または検証が難しいシナリオについてはMOPDを通じて能力を統合している。
エージェント強化学習の研究を支援するため、チームはMiMoのRL軌跡から蒸留されたQwenモデル、7,000の多様な環境、そして完全なRLトレーニングフレームワークを公開した。XiaomiはMiMo-V2.6を出発点と位置づけ、持続的に自己改善するインテリジェントシステムを開発するために、時間、計算リソース、研究開発リソースへの継続的な投資を約束した。
Xiaomi、MiMo-V2.6が最大級のオープンソース強化学習トレーニングを実施したと主張
免責事項: Phemexニュースで提供されるコンテンツは、あくまで情報提供を目的としたものであり、第三者の記事から取得した情報の正確性・完全性・信頼性について保証するものではありません。本コンテンツは金融または投資の助言を目的としたものではなく、投資に関する最終判断はご自身での調査と、信頼できる専門家への相談を踏まえて行ってください。
