A equipe MiMo da Xiaomi afirma que o MiMo-V2.6 pode representar uma das maiores execuções únicas de treinamento por aprendizado por reforço já realizadas por uma equipe de modelos de código aberto. Apesar das restrições de computação, a equipe dedicou dezenas de profissionais ao longo de um período prolongado para avançar o escalonamento de RL, utilizando o treinamento MixRL para tarefas verificáveis, como código, e mesclando capacidades por meio do MOPD para cenários complexos ou de difícil verificação.
Para apoiar a pesquisa em aprendizado por reforço para agentes, a equipe lançou um modelo Qwen destilado a partir das trajetórias de RL do MiMo, 7.000 ambientes diversos e um framework completo de treinamento de RL. A Xiaomi descreveu o MiMo-V2.6 como um ponto de partida e comprometeu-se a continuar investindo tempo, computação e recursos de P&D para desenvolver sistemas inteligentes autoaperfeiçoáveis e sustentáveis.
Xiaomi afirma que o MiMo-V2.6 realizou uma das maiores execuções de treinamento de RL de código aberto
Aviso Legal: O conteúdo disponibilizado no Phemex News é apenas para fins informativos. Não garantimos a qualidade, precisão ou integridade das informações provenientes de artigos de terceiros. Este conteúdo não constitui aconselhamento financeiro ou de investimento. Recomendamos fortemente que você realize suas próprias pesquisas e consulte um consultor financeiro qualificado antes de tomar decisões de investimento.
