O Centro de I&D de Inteligência Artificial Generativa de Hong Kong (HKGAI) anunciou, a 18 de setembro de 2026, o lançamento do modelo de música de grande escala de código aberto YuE2. A equipa afirma que é o primeiro modelo de música de grande escala de código aberto do mundo que unifica criação, cover e edição através de "planeamento simbólico"; no mesmo dia, ficou em 4.º lugar na lista de Tendências do Hugging Face a nível global (Trending Score 595), sendo o único modelo de música no top cinco da lista. Nove dias após o lançamento, o modelo principal oficial registou 11.626 descarregamentos; incluindo o encapsulamento para ComfyUI, as versões GGUF/quantizadas da comunidade e a cadeia de ferramentas, o ecossistema acumulou cerca de 179 mil descarregamentos.
O HKGAI foi fundado em outubro de 2023, financiado pela plataforma AIR@InnoHK — focada em inteligência artificial e robótica — e liderado pela Universidade de Ciência e Tecnologia de Hong Kong, com investigação que abrange linguagem, visão e áudio, entre outras áreas. O YuE2 é considerado um marco importante do centro na geração de áudio; o comunicado oficial recorre também à metáfora "momento DeepSeek da música" para descrever o ímpeto de um modelo de código aberto que iguala ou até supera alguns sistemas comerciais fechados.
WildSongBench: pontuação combinada best-of-8 supera vários modelos comerciais
A基準 de avaliação WildSongBench realizou uma avaliação automática com 192 conjuntos de prompts (12 de setembro de 2026). A tabela mostra que o YuE2 (best-of-8) atinge uma SongBench Avg de 6,9632, ocupando provisoriamente o primeiro lugar; uma única passagem do YuE2 obtém 6,7316. Como comparação incluem-se Mureka 9 (6,9377), Suno v5 (6,8721), Suno v5.5 (6,7150), Suno v6 (6,5562), enquanto a geração anterior YuE 1 regista 4,9165. Os restantes indicadores não são todos liderados pelo YuE2: por exemplo, o Suno v5 tem o MuLan mais elevado (0,5428), o LeVo 2 tem o AudioBox PQ mais elevado (8,3966) e o Suno v4.5 tem o PER mais baixo (5,80%).
| Sistema | SongBench Avg ↑ | AudioBox PQ ↑ | MuLan ↑ | PER ↓ |
|---|---|---|---|---|
| YuE2 (best-of-8) | 6.9632 | 8.2714 | 0.5051 | 9.79% |
| Mureka 9 | 6.9377 | 8.0226 | 0.4394 | 11.69% |
| Suno v5 | 6.8721 | 8.1698 | 0.5428 | 8.10% |
| YuE2 | 6.7316 | 8.2598 | 0.5068 | 8.44% |
| Suno v6 | 6.5562 | 8.1296 | 0.4916 | 7.58% |
| YuE 1 | 4.9165 | 7.8683 | 0.2623 | 36.38% |


Caixa-branca controlável: planeamento simbólico separado da renderização acústica
O YuE2 separa o "planeamento simbólico" da "renderização acústica", aumentando a controlabilidade através de um design de mistura de especialistas (MoE): o especialista AR prevê, de forma autorregressiva com atenção causal, partituras em notação ABC e esqueletos semânticos; o especialista NAR prevê latentes acústicos através de flow matching; por fim, um VAE descodifica a saída para estéreo a 48 kHz. Ao contrário da amostragem de caixa-preta do tipo "prompt de entrada, áudio de saída", os criadores podem intervir em cada etapa — por exemplo, ajustar uma única nota sem refazer a música inteira, ou mudar de estilo preservando a melodia original.

A demonstração oficial utilizou a canção pop em mandarim «末班車» como objeto de nove rondas de edição conversacional, incluindo reformulação da harmonia, rearranjo, incorporação da melodia de «Twinkle Twinkle Little Star», desenvolvimento de variações e reescrita da letra, acabando por se transformar numa versão de jazz em inglês com estrutura completa; cada passo corresponde a uma partitura e áudio verificáveis, em vez de mais uma geração aleatória sem ligação às anteriores.
Seis idiomas, sessenta géneros, ecossistema open-source local
Em termos de capacidades, o YuE2 suporta seis idiomas, incluindo chinês, inglês, japonês, coreano, russo e espanhol, abrangendo mais de 60 géneros musicais (incluindo City Pop, heavy metal, jazz, flamenco, entre outros). Os pesos são disponibilizados em código aberto para descarregamento gratuito (apenas para uso não comercial), podendo ser executados localmente numa única placa gráfica de consumo; a licença comercial requer contacto adicional. A equipa também disponibiliza em código aberto ferramentas de transcrição, modelos de compreensão musical e benchmarks de avaliação, formando uma cadeia de ferramentas que liga "transcrição – criação – edição – avaliação". Entrada do projeto: GitHub multimodal-art-projection/YuE.
- Pesos em código aberto (não comercial) + execução local numa única placa gráfica
- Criação / cover / edição unificadas num fluxo de planeamento simbólico
- Disponibilização simultânea em código aberto das ferramentas de transcrição, modelos de compreensão e benchmarks de avaliação
Ler o artigo original em techritual.com (chinês tradicional) →
The TechRitual editorial desk in Hong Kong. Articles on TechRitual World are translated from the Traditional Chinese originals on techritual.com.

