HKGAI stellt YuE2 vor: Open-Source-Musikmodell übertrifft Suno in WildSongBench-Benchmark

·von TechRitual Editorial·Nachrichten
HKGAI stellt YuE2 vor: Open-Source-Musikmodell übertrifft Suno in WildSongBench-Benchmark
✏️ Redaktionsrecherche| TechRitual World Redaktion

Das Hongkonger Forschungs- und Entwicklungszentrum für generative künstliche Intelligenz (HKGAI) hat am 18. September 2026 die Veröffentlichung des Open-Source-Musikgroßmodells YuE2 bekannt gegeben. Das Team bezeichnet es als das weltweit erste Open-Source-Musikgroßmodell, das Erstellung, Cover und Bearbeitung durch „symbolische Planung" vereint; am selben Tag erreichte es auf Hugging Face Platz 4 der Trending-Charts der gesamten Plattform (Trending Score 595) und ist das einzige Musikmodell in den Top 5. Innerhalb von 9 Tagen nach Veröffentlichung verzeichnete das offizielle Hauptmodell 11.626 Downloads; zusammen mit der ComfyUI-Verpackung, Community-GGUF-/Quantisierungsversionen und der Toolchain summiert sich das Ökosystem auf rund 179.000 Downloads.

HKGAI wurde im Oktober 2023 gegründet, wird durch die auf KI und Robotik fokussierte Plattform AIR@InnoHK finanziert und von der Hong Kong University of Science and Technology geleitet; die Forschung und Entwicklung deckt die Bereiche Sprache, Vision und Audio ab. YuE2 wird als wichtiger Meilenstein des Zentrums in der Audio-Generierung betrachtet; die Pressemitteilung zieht zudem den Vergleich mit einem „DeepSeek-Moment der Musikwelt" heran und beschreibt damit den Trend, dass Open-Source-Modelle zu einigen kommerziellen Closed-Source-Systemen aufschließen oder diese sogar übertreffen.

WildSongBench: Best-of-8-Gesamtwert übertrifft mehrere kommerzielle Modelle

Das Bewertungs-Benchmark WildSongBench führt eine automatische Evaluierung mit 192 Prompts durch (12. September 2026). Die Tabelle zeigt, dass YuE2 (best-of-8) mit einem SongBench Avg von 6,9632 vorläufig den Spitzenplatz belegt; ein einzelner YuE2-Lauf erreicht 6,7316. Zum Vergleich: Mureka 9 (6,9377), Suno v5 (6,8721), Suno v5.5 (6,7150), Suno v6 (6,5562), während der Vorgänger YuE 1 bei 4,9165 liegt. Bei den übrigen Metriken führt YuE2 nicht durchgehend: So erreicht Suno v5 den höchsten MuLan-Wert (0,5428), LeVo 2 das höchste AudioBox PQ (8,3966) und Suno v4.5 das niedrigste PER (5,80 %).

SystemSongBench Avg ↑AudioBox PQ ↑MuLan ↑PER ↓
YuE2 (best-of-8)6,96328,27140,50519,79 %
Mureka 96,93778,02260,439411,69 %
Suno v56,87218,16980,54288,10 %
YuE26,73168,25980,50688,44 %
Suno v66,55628,12960,49167,58 %
YuE 14,91657,86830,262336,38 %
Ausgewählte WildSongBench-Ergebnisse (12.09.2026); YuE2 best-of-8 führt vorläufig im SongBench Avg.
Songqualitätsindex gegenüber Text-Alignment-Index: YuE2 / YuE2 (Bo8) liegen im Pareto-optimalen Bereich und distanzieren YuE1 deutlich.

White-Box-Kontrolle: Symbolische Planung und akustisches Rendering getrennt

YuE2 trennt „symbolische Planung (symbolic planning)" von „akustischem Rendering (acoustic rendering)" und erhöht durch ein Mixture-of-Experts-Design (MoE) die Kontrollierbarkeit: Ein AR-Experte prognostiziert mit kausaler Aufmerksamkeit autoregressiv ABC-Noten und semantische Skelette; ein NAR-Experte prognostiziert per Flow Matching akustische Latents; anschließend werden diese durch einen VAE zu 48-kHz-Stereo-Audio dekodiert. Im Gegensatz zur „Prompt rein, Audio raus"-Blackbox-Sampling-Methode können Kreative in jedem Schritt eingreifen – etwa eine einzelne Note feinjustieren, ohne das gesamte Stück neu zu erzeugen, oder den Stil ändern und dabei die Originalmelodie beibehalten.

YuE2-Architektur: Der AR-Experte übernimmt Notation/Semantik, der NAR-Experte das akustische Flow, abschließend dekodiert ein VAE zu 48 kHz.

Die offizielle Demonstration nimmt den mandarin-pop-Song „末班車" (Letzter Zug) als Ausgangspunkt für neun Runden dialogbasierter Bearbeitung, darunter Neukomposition der Harmonien, Arrangementänderung, Einbindung der Melodie von „Twinkle Twinkle Little Star", Entwicklung von Variationen und Umschreiben des Textes, woraus am Ende ein strukturell vollständiges englisches Jazz-Arrangement wird; jeder Schritt lässt sich anhand von Noten und Audio nachvollziehen, anstatt eine weitere voneinander unabhängige Zufallsgenerierung darzustellen.

Sechs Sprachen, sechzig Genres, lokales Open-Source-Ökosystem

In Bezug auf die Fähigkeiten unterstützt YuE2 sechs Sprachen, darunter Chinesisch, Englisch, Japanisch, Koreanisch, Russisch und Spanisch, und deckt über 60 Genres ab (darunter City Pop, Heavy Metal, Jazz, Flamenco usw.). Die Gewichte sind als Open Source kostenlos verfügbar (nur für nicht-kommerzielle Nutzung) und können auf einer einzelnen Consumer-Grafikkarte lokal ausgeführt werden; für eine kommerzielle Lizenz ist eine separate Anfrage erforderlich. Das Team stellt gleichzeitig Open-Source-Tools für die Transkription, ein Musikverständnismodell sowie einen Evaluierungs-Benchmark bereit und schließt damit die Werkzeugkette „Transkription – Komposition – Bearbeitung – Evaluierung". Projektseite: GitHub multimodal-art-projection/YuE.

  • Open-Source-Gewichte (nicht-kommerziell) + lokaler Betrieb auf einer einzelnen Grafikkarte
  • Komposition / Cover / Bearbeitung in einem einheitlichen symbolischen Planungsprozess
  • Transkription, Verständnismodell und Evaluierungs-Benchmark gleichzeitig als Open Source veröffentlicht

Originalartikel auf techritual.com lesen (traditionelles Chinesisch)

T
Über den Autor
TechRitual Editorial

The TechRitual editorial desk in Hong Kong. Articles on TechRitual World are translated from the Traditional Chinese originals on techritual.com.