El equipo MiMo de Xiaomi afirma que MiMo-V2.6 podría representar uno de los entrenamientos individuales de aprendizaje por refuerzo más grandes jamás realizados por un equipo de modelos de código abierto. A pesar de las limitaciones de cómputo, el equipo dedicó a decenas de profesionales durante un período prolongado para impulsar el escalado del aprendizaje por refuerzo (RL), empleando el entrenamiento MixRL para tareas verificables como el código y fusionando capacidades mediante MOPD para escenarios complejos o difíciles de verificar.
Para respaldar la investigación del aprendizaje por refuerzo para agentes, el equipo publicó un modelo Qwen destilado a partir de las trayectorias de RL de MiMo, 7.000 entornos diversos y un marco completo de entrenamiento de RL. Xiaomi describió MiMo-V2.6 como un punto de partida y se comprometió a seguir invirtiendo tiempo, capacidad de cómputo y recursos de I+D para desarrollar sistemas inteligentes sostenibles capaces de mejorarse a sí mismos.
Xiaomi afirma que MiMo-V2.6 realizó uno de los mayores entrenamientos de RL de código abierto
Aviso legal: El contenido de Phemex News es únicamente informativo.No garantizamos la calidad, precisión ni integridad de la información procedente de artículos de terceros.El contenido de esta página no constituye asesoramiento financiero ni de inversión.Le recomendamos encarecidamente que realice su propia investigación y consulte con un asesor financiero cualificado antes de tomar cualquier decisión de inversión.
