Команда MiMo компании Xiaomi заявляет, что MiMo-V2.6 может оказаться одним из самых масштабных отдельных циклов обучения с подкреплением, когда-либо проведённых командой разработчиков моделей с открытым исходным кодом. Несмотря на ограничения вычислительных мощностей, команда в течение длительного периода выделяла десятки специалистов для развития масштабирования RL, применяя обучение MixRL для проверяемых задач, таких как код, и объединяя возможности моделей через MOPD для сложных или трудноподдающихся проверке сценариев.
Для поддержки исследований в области обучения агентов с подкреплением команда выпустила модель Qwen, дистиллированную из RL-траекторий MiMo, 7 000 разнообразных сред и полноценный фреймворк RL-обучения. В Xiaomi назвали MiMo-V2.6 отправной точкой и заявили о намерении и дальше инвестировать время, вычислительные мощности и ресурсы в НИОКР для создания устойчивых самосовершенствующихся интеллектуальных систем.
Xiaomi заявила, что MiMo-V2.6 прошёл одну из крупнейших RL-тренировок с открытым исходным кодом
Отказ от ответственности: Контент, представленный на сайте Phemex News, предназначен исключительно для информационных целей.Мы не гарантируем качество, точность и полноту информации, полученной из статей третьих лиц.Содержание этой страницы не является финансовым или инвестиционным советом.Мы настоятельно рекомендуем вам провести собственное исследование и проконсультироваться с квалифицированным финансовым консультантом, прежде чем принимать какие-либо инвестиционные решения.
