Xiaomi lanzó oficialmente y abrió el código fuente de la serie Xiaomi MiMo-V2.6, que representa un paso clave en la exploración del camino de la RSI (mejora recursiva autónoma). Esta serie se basa en tareas complejas verificables, escalando a gran escala la capacidad de cálculo de aprendizaje reforzado (RL), lo que permite que los modelos continúen expandiendo sus límites de inteligencia a través de una constante exploración y retroalimentación. La serie MiMo-V2.6 incluye dos modelos multimodales nativos: Pro y Flash. Gracias a la expansión de la capacidad de cálculo de RL, el MiMo-V2.6-Pro alcanzó una puntuación de 46 en el Índice de Inteligencia Analítica (AA), superando a Kimi K3 y Qwen 3.8 Max, convirtiéndose en el modelo abierto más potente hasta ahora;
sin embargo, en comparación con los modelos cerrados más potentes, como Claude Fable 5.1 y GPT-6 Astra, aún existe cierta brecha.
La serie MiMo-V2.6 mantiene el precio de la serie V2.5 en cuanto a la API, manteniendo el costo constante mientras se mejora la inteligencia, lo que impulsa aún más la frontera de Pareto entre "inteligencia y costo". El MiMo-V2.6-Pro estableció un nuevo récord de relación calidad-precio para modelos nacionales: bajo el mismo nivel de inteligencia, su precio es solo entre 1/20 y 1/60 del de los modelos extranjeros.
La serie MiMo-V2.6 muestra un desempeño destacado en el entrenamiento de aprendizaje reforzado
Durante la fase de entrenamiento de RL, el MiMo-V2.6 podría ser uno de los modelos abiertos nacionales
Con el aumento del tamaño del entrenamiento, Xiaomi congeló el MoE Router para inhibir el desplazamiento de carga de expertos, y estableció una línea de defensa contra el Reward Hacking que cubre el diseño de recompensas, evaluación adversarial, detección de anomalías y validación cruzada de validadores. Para apoyar el aprendizaje por refuerzo de agentes para tareas mixtas a gran escala, el equipo diseñó una representación unificada de trayectorias y un mecanismo de penalización, que apoya la interacción de alta concurrencia de varios marcos de agentes inteligentes, desacopló la capa de control y la capa de datos para apoyar la migración de grandes volúmenes de trayectorias, mantuvo la proporción de muestras de cada tarea en lotes mixtos, y optimizó la eficiencia y consistencia de los motores de entrenamiento e inferencia.
Xiaomi ya ha abierto fuente los resultados técnicos y recursos complementarios, incluyendo informes técnicos completos, entornos de entrenamiento y código de RL.
MiMo-V2.6 integra la capacidad de razonamiento espacial 3D, percepción multimodal y operación de computación (CUA), ampliando aún más los límites de lo que puede alcanzar la programación, permitiendo extender las tareas de programación impulsadas por lenguaje natural a la construcción de un "Vibe World" orientado al mundo interactivo. En juegos de mundo abierto 3D, tras la entrada del usuario de imágenes, videos o texto, MiMo-V2.6 descompone la demanda en múltiples tareas, que son completadas colaborativamente por varios agentes inteligentes, construyendo la escena 3D del juego, escribiendo la lógica de interacción y validando visualmente, corrigiendo constantemente según los resultados de renderizado, para finalmente generar un mundo interactivo operable que corresponda a la intención del usuario.
En la modelación 3D de Blender, MiMo-V2.6 puede completar la modelación 3D de objetos y escenas en
MiMo-V2.6-Pro creó una obra de música de cámara que incluye aproximadamente diez instrumentos según los requisitos, luego generó la partitura y la convirtió automáticamente en MIDI.
Xiaomi ha abierto completamente la fuente de MiMo-V2.6-Pro, los pesos del modelo Flash y el informe técnico, y simultáneamente ha liberado los recursos de investigación relacionados con MiMo-V2.6-Distill-Qwen-9B y su conjunto RL. Los contenidos abiertos incluyen: más de 7k entornos de tareas RL de alta calidad, que cubren tareas de agentes inteligentes en cuatro categorías: ingeniería de software, reproducción de vulnerabilidades, trabajo basado en conocimiento y desarrollo de diseño web; marco de entrenamiento RL de extremo a extremo basado en verl, uni-agent y mini-swe-agent; y un Harness liviano y combinable, con la liberación de mini-harnesses extremadamente simples.
En cuanto al uso, el cliente de escritorio MiMo Desktop y el plan de suscripción de miembros están ahora disponibles, y la serie MiMo-V2.6 está ya en la plataforma abierta Xiaomi MiMo. Los precios de las API se mantienen sin cambios. MiMo-V2.6-Pro ofrece en la plataforma abierta una opción de modo UltraSpeed de alta velocidad, que proporciona una velocidad de salida máxima de 20 veces.
Leer el artículo original en techritual.com (chino tradicional) →
The TechRitual editorial desk in Hong Kong. Articles on TechRitual World are translated from the Traditional Chinese originals on techritual.com.

