香港 HKGAI 發佈 YuE2 開源音樂生成模型:白盒架構實現高保真可控音訊創作

BlueSky

AI 摘要

  • HKGAI 正式發佈開源音樂大模型 YuE2,在國際評測基準 WildSongBench 的綜合成績超越多款商業閉源產品。
  • 模型採用混合專家架構將樂譜規劃與聲學渲染分離,支援創作者針對單一音符與旋律進行局部微調。
  • 該模型支援 6 種語言與逾 60 種曲風,並可於單張消費級顯示卡在本地端完成部署與推論。

香港生成式人工智能研發中心(HKGAI)正式對外發佈開源音樂大模型「YuE2」。該模型採用結合「符號規劃」與「聲學渲染」的架構設計,在國際音樂評測基準「WildSongBench」的綜合成績中,超越多款主流商業閉源模型,並於開源模型社群 HuggingFace 登上全站熱門排行榜第四位,成為前五名中唯一的音樂類生成模型。

根據官方公佈數據,YuE2 在開放下載 9 天內,官方主模型下載次數已突破 1 萬次;若合計周邊工具鏈及相關封裝包,整個生態圈累積下載量達到 17.9 萬次。此發佈展示了該研發機構在音訊生成與開源領域的研發進展。

採用 MoE 白盒架構:分離符號規劃與聲學渲染

技術架構層面,YuE2 採用具備透明度的「白盒」設計邏輯,透過混合專家(Mixture of Experts, MoE)機制,將音樂生成過程明確劃分為兩大核心階段:

  • 符號規劃階段:由自回歸專家模型預測標準 ABC 格式樂譜,構建出音樂結構與旋律骨架。
  • 聲學渲染階段:透過流匹配(Flow Matching)技術預測對應的聲學特徵,最終經由變分自動編碼器(VAE)解碼器還原為 48kHz 高保真立體聲音訊。

傳統音樂生成模型多半依賴黑盒端到端渲染,創作者難以介入細節調整。YuE2 的分段架構設計讓使用者能夠在生成流程中實施調控;當創作者需要微調單一音符或特定樂句時,無需重新生成整首樂曲,亦可在更換曲風時保留既有旋律骨架。

支援多語言與本地端部署規格

YuE2 支援中、英、日、韓、俄及西班牙語等 6 種語言,並涵蓋超過 60 種音樂流派。該模型目前開放免費非商業用途授權下載,具備較高的運算資源效益,使用者僅需配備單張消費級顯示卡,即可於個人電腦本地端部署運行,有助於保障創作數據的隱私性。

規格項目技術參數與支援範疇
輸出音訊規格48kHz 高保真立體聲(Stereo)
中間符號格式ABC 樂譜格式(由自回歸專家預測)
核心架構混合專家(MoE)結合流匹配(Flow Matching)與 VAE 解碼
語言支援中文、英文、日文、韓文、俄文、西班牙文(共 6 種)
風格支援涵蓋逾 60 種音樂流派
硬體門檻單張消費級顯示卡(支援本地端部署)

開源生態工具鏈與專業應用定位

業界將 YuE2 視為音訊生成開源化的重要進展,主要反映在三項特點:效能指標追平商業閉源模型、具備較高資源效益以降低運算成本,以及支援白盒調控以強化創作主導權。除了基礎生成模型,HKGAI 同步開源了轉譜工具、音樂理解模型及評測基準工具,進一步擴展針對專業編曲與音樂創作的軟體生態體系。

Reference Link : ezone.hk

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles