Nhóm MiMo của Xiaomi cho biết MiMo-V2.6 có thể là một trong những đợt huấn luyện học tăng cường đơn lẻ quy mô lớn nhất từng được một nhóm phát triển mô hình mã nguồn mở thực hiện. Bất chấp những hạn chế về năng lực tính toán, nhóm đã huy động hàng chục nhân sự trong một thời gian dài để thúc đẩy việc mở rộng quy mô học tăng cường (RL), sử dụng phương pháp huấn luyện MixRL cho các tác vụ có thể kiểm chứng như viết mã, đồng thời hợp nhất các năng lực thông qua MOPD cho những kịch bản phức tạp hoặc khó kiểm chứng.
Để hỗ trợ nghiên cứu học tăng cường cho tác nhân (agent), nhóm đã phát hành một mô hình Qwen được chưng cất từ các quỹ đạo RL của MiMo, 7.000 môi trường đa dạng cùng một khung huấn luyện RL hoàn chỉnh. Xiaomi mô tả MiMo-V2.6 là điểm khởi đầu và cam kết tiếp tục đầu tư thời gian, năng lực tính toán cũng như các nguồn lực nghiên cứu và phát triển nhằm xây dựng những hệ thống thông minh có khả năng tự cải thiện một cách bền vững.
Xiaomi tuyên bố MiMo-V2.6 đã thực hiện một trong những đợt huấn luyện RL mã nguồn mở quy mô lớn nhất
Tuyên bố miễn trừ trách nhiệm: Nội dung được cung cấp trên Phemex News chỉ nhằm mục đích cung cấp thông tin.Chúng tôi không đảm bảo chất lượng, độ chính xác hoặc tính đầy đủ của thông tin có nguồn từ các bài viết của bên thứ ba.Nội dung trên trang này không cấu thành lời khuyên về tài chính hoặc đầu tư.Chúng tôi đặc biệt khuyến khích bạn tự tiến hành nghiên cứu và tham khảo ý kiến của cố vấn tài chính đủ tiêu chuẩn trước khi đưa ra bất kỳ quyết định đầu tư nào.
