El Centro de Investigación y Desarrollo de Inteligencia Artificial Generativa de Hong Kong (HKGAI) anunció el 18 de septiembre de 2026 el lanzamiento del modelo de música de código abierto YuE2. El equipo afirma que es el primer modelo de música de código abierto del mundo que unifica la creación, las versiones cover y la edición mediante "planificación simbólica"; el mismo día, alcanzó el puesto número 4 en Trending de todo Hugging Face (Trending Score 595), siendo el único modelo de música entre los cinco primeros de la lista. En 9 días desde su lanzamiento, el modelo principal oficial registró 11.626 descargas; sumando los paquetes para ComfyUI, las versiones GGUF/cuantizadas de la comunidad y la cadena de herramientas, el ecosistema acumula aproximadamente 179.000 descargas.
HKGAI se fundó en octubre de 2023, con el apoyo de la plataforma AIR@InnoHK, centrada en inteligencia artificial y robótica, y está liderada por la Universidad de Ciencia y Tecnología de Hong Kong. Su investigación abarca áreas como el lenguaje, la visión y el audio. YuE2 se considera un hito importante del centro en la generación de audio; el comunicado también utiliza la metáfora del "momento DeepSeek de la industria musical" para describir el impulso de un modelo de código abierto que alcanza o incluso supera a algunos sistemas comerciales cerrados.
WildSongBench: la puntuación compuesta best-of-8 supera a varios modelos comerciales
El基准 de evaluación WildSongBench realizó una evaluación automática con 192 prompts (12 de septiembre de 2026). La tabla muestra que YuE2 (best-of-8) alcanza un SongBench Avg de 6,9632, liderando provisionalmente la clasificación; la puntuación de YuE2 en una sola pasada es 6,7316. Entre los modelos comparados se encuentran Mureka 9 (6,9377), Suno v5 (6,8721), Suno v5.5 (6,7150) y Suno v6 (6,5562), mientras que la generación anterior YuE 1 obtuvo 4,9165. No lidera en todos los demás indicadores: por ejemplo, Suno v5 tiene el MuLan más alto (0,5428), LeVo 2 tiene el AudioBox PQ más alto (8,3966), y Suno v4.5 tiene el PER más bajo (5,80 %).
| Sistema | SongBench Avg ↑ | AudioBox PQ ↑ | MuLan ↑ | PER ↓ |
|---|---|---|---|---|
| YuE2 (best-of-8) | 6,9632 | 8,2714 | 0,5051 | 9,79 % |
| Mureka 9 | 6,9377 | 8,0226 | 0,4394 | 11,69 % |
| Suno v5 | 6,8721 | 8,1698 | 0,5428 | 8,10 % |
| YuE2 | 6,7316 | 8,2598 | 0,5068 | 8,44 % |
| Suno v6 | 6,5562 | 8,1296 | 0,4916 | 7,58 % |
| YuE 1 | 4,9165 | 7,8683 | 0,2623 | 36,38 % |


Caja blanca controlable: la planificación simbólica se separa del renderizado acústico
YuE2 separa la "planificación simbólica" del "renderizado acústico" y utiliza un diseño de mezcla de expertos (MoE) para mejorar la controlabilidad: el experto AR predice de forma autorregresiva, con atención causal, la partitura ABC y el esqueleto semántico; el experto NAR predice el espacio latente acústico mediante flow matching; finalmente, un decodificador VAE genera audio estéreo a 48 kHz. A diferencia del muestreo de caja negra del tipo "un prompt y se obtiene audio", los creadores pueden intervenir en cada paso; por ejemplo, ajustar una sola nota sin necesidad de regenerar toda la canción, o cambiar el estilo manteniendo la melodía original.

La demostración oficial utiliza la canción pop en mandarín 《末班車》 (Último tren) para realizar nueve rondas de edición conversacional, incluyendo rearmonización, reorquestación, incorporación de la melodía de 《小星星》 (Estrellita), desarrollo de variaciones y reescritura de la letra, transformándola finalmente en una arreglo completo de jazz en inglés; cada paso se corresponde con una partitura y un audio verificables, en lugar de otra generación aleatoria sin relación con la anterior.
Seis idiomas, sesenta géneros, ecosistema local de código abierto
En cuanto a capacidades, YuE2 es compatible con seis idiomas, entre ellos chino, inglés, japonés, coreano, ruso y español, y abarca más de 60 géneros musicales (incluidos City Pop, heavy metal, jazz, flamenco, etc.). Los pesos del modelo son de código abierto y se pueden descargar de forma gratuita (solo para uso no comercial), y pueden ejecutarse localmente en una sola tarjeta de consumo. Para licencias comerciales, es necesario consultar por separado. El equipo también ha publicado como código abierto herramientas de transcripción musical, modelos de comprensión musical y benchmarks de evaluación, conformando una cadena de herramientas que conecta «transcripción—creación—edición—evaluación». Punto de entrada del proyecto: GitHub multimodal-art-projection/YuE.
- Pesos de código abierto (uso no comercial) y ejecución local en una sola tarjeta
- Creación, covers y edición unificados en un flujo de planificación simbólica
- Publicación simultánea como código abierto de la herramienta de transcripción, el modelo de comprensión y el benchmark de evaluación
Leer el artículo original en techritual.com (chino tradicional) →
The TechRitual editorial desk in Hong Kong. Articles on TechRitual World are translated from the Traditional Chinese originals on techritual.com.

