Xiaomi'nin MiMo ekibi, MiMo-V2.6'nın açık kaynaklı bir model ekibi tarafından bugüne kadar gerçekleştirilen en büyük tekil pekiştirmeli öğrenme (reinforcement learning) eğitim çalışmalarından birini temsil edebileceğini belirtiyor. Ekip, hesaplama gücü kısıtlamalarına rağmen, RL ölçeklendirmesini ilerletmek için uzun bir süre boyunca onlarca personel görevlendirdi; kod gibi doğrulanabilir görevler için MixRL eğitimini kullandı ve karmaşık ya da doğrulanması zor senaryolar için yetenekleri MOPD aracılığıyla birleştirdi.
Ajan (agent) tabanlı pekiştirmeli öğrenme araştırmalarını desteklemek amacıyla ekip, MiMo RL yörüngelerinden damıtılmış bir Qwen modeli, 7.000 çeşitli ortam ve eksiksiz bir RL eğitim çerçevesi yayınladı. Xiaomi, MiMo-V2.6'yı bir başlangıç noktası olarak tanımladı ve sürdürülebilir, kendini geliştiren zeki sistemler geliştirmek için zaman, hesaplama gücü ve Ar-Ge kaynaklarına yatırıma devam etme taahhüdünde bulundu.
Xiaomi, MiMo-V2.6 ile En Büyük Açık Kaynaklı RL Eğitimlerinden Birinin Gerçekleştirildiğini İddia Ediyor
Sorumluluk Reddi: Phemex Haberler'de sunulan içerik yalnızca bilgilendirme amaçlıdır. Üçüncü taraf makalelerden alınan bilgilerin kalitesi, doğruluğu veya eksiksizliğini garanti etmiyoruz. Bu sayfadaki içerik finansal veya yatırım tavsiyesi niteliği taşımaz. Yatırım kararları vermeden önce kendi araştırmanızı yapmanızı ve nitelikli bir finans danışmanına başvurmanızı şiddetle tavsiye ederiz.
