![]()
AI音樂這兩年火得很快,打開任何一個音樂平臺,AI生成的歌單已經多到刷不完。聽得多了你會發現一個問題,這些歌聽起來都挺像那么回事,卻又總覺得差點意思。
旋律從頭到尾擠得滿滿當當,沒有一個小節舍得停下來喘口氣。人聲像被伴奏活活埋掉的配角,怎么都冒不出來。段落之間一個力度撐到底,前一段還在深情款款,后一段突然不知道拐到哪兒去了。情緒斷層、結構割裂,像是把幾首不同歌的片段硬拼在了一起。
這倒不是哪家產品的問題,整個行業的路子多少都有點偏。很長時間里,行業里把堆滿編配當成了完成度,多層樂器一疊,第一耳確實熱鬧,但經不起細聽。熱鬧底下空落落的,什么都沒說出來。這種AI味兒太重的歌,很難直接拿去做商用發行。
7月19日,昆侖萬維天工AI在2026世界人工智能大會上發布了新一代音樂生成底座Mureka V9.5,同時推出了基于這個底座的O3反思式音樂推理方案,以及一個全新的創作Agent體驗。
V9.5的方向很明確,做更克制、更真實、更貼合創作意圖的音樂,說白了就是更有人味兒、更少AI味兒。O3的思路是用test-time scaling讓音樂思考從一次性規劃變成持續推演,寫一段回頭看一段,不對就改。創作Agent則是把定稿改成了版本化管理,創作不再是一錘子買賣。
![]()
Mureka V9.5發布現場
Mureka V9.5官方視頻
一、不是堆編配,是給音樂留出呼吸空間
Mureka的技術路線叫MusiCoT,核心思路是讓模型在生成音頻之前先形成一套音樂思維,從全曲結構到局部細節,粗到細地組織創作,而不是逐幀瞎蒙。
V9.5在這個基礎上往前推了一步,它開始思考一首真實的歌到底是怎么成立的。編配不用時刻拉滿,聲部得學會呼吸,情緒推進得有留白,所有聲音上的選擇都該為創作意圖服務。它不再追求第一耳讓你覺得好厲害,而是在一個更真實的音樂框架里,把Prompt控制、人聲表現、音質和情緒表達做扎實。
(AI 自動分析畫面的場景、動作和情緒,創作更貼合內容的配樂)
我們回頭掃了一遍樣本,一致的感覺是,它聽起來更克制、更真實,也更不像AI寫的。
歌曲《夜色緩緩》
定位:中文流行,對標國內流行市場,情緒捕捉準確
提示詞:以柔和鋼琴、中文流行,氛圍合成器和漸進式弦樂構建電影感情緒,男聲貼近演唱,細膩、克制,從低聲訴說逐漸走向情感釋放。整體像雨夜里未說出口的告別,憂傷但溫柔,不煽情卻充滿力量。 Featuring soft piano, Chinese pop influences, atmospheric synth layers, and gradual strings to create a cinematic emotional atmosphere. Intimate male vocals with delicate, restrained delivery, building from quiet storytelling to emotional release. Like an unspoken goodbye on a rainy night, melancholic yet tender, powerful without being dramatic.
歌曲《Melted Chrome 2》分版
定位:一首標準的西海岸G-Funk,風格極佳,對小眾曲風的捕捉,風格極致表達,對合成器和地域文化理解,理解曲風的風格表達,音效選取的有特點,編曲層層遞進
提示詞: 迷幻西海岸 G-Funk 街頭說唱。深沉滑動的合成器低音、Moog 哨音、Talkbox 氛圍、溫暖 Rhodes、哇音吉他與復古磁帶質感,配合松弛靠后的鼓點和沙啞男聲,營造低底盤夜間巡游般的迷幻街頭氛圍。 Psychedelic West Coast G-Funk street rap, featuring deep sliding synth bass, a melted Moog whistle lead, talkbox haze, warm Rhodes, muted wah guitar, warped cassette textures, and a lazy behind-the-beat groove. Raw raspy male vocals deliver relaxed, human street storytelling over a smoky lowrider night-cruise atmosphere, with no trap hi-hats, drill patterns, or EDM drops.
傳統AI音樂的習慣做法是默認疊多層樂器、持續填充旋律,覺得這樣才有完成感。V9.5把配器邏輯整個翻了過來,聲部怎么進怎么出、樂器什么時候上什么時候撤、強弱動態怎么走,全部看提示詞的情緒和曲風來定。無效聲部主動砍掉,給主旋律和人聲騰位置,給情緒轉折留白。它在學真人編曲那種輕重交替、張弛有度的習慣。
(僅需上傳一張照片與一小段清晰人聲,即可快速生成專屬 Character)
數據上顯示,同一輪100首樣本的盲測里,V9.5在旋律、人聲、音質和編配上都有提升,指令精準度從6.92提到了7.62。
![]()
具體到四個評測維度:第一,編配上它更克制,不把配器密度等同于音樂質量,為主旋律、人聲和情緒變化留出了呼吸空間。第二,音樂框架上它更真實,聲部進入、段落推進與動態關系更接近真實創作,減少了模板化和復雜堆疊感。第三,人聲表現良品率達到61.0%,情緒、唱腔和伴奏之間的關系更自然,聽起來更可信。第四,意圖優先于炫技這一點尤其明顯,97.0%的控制良品率和95.7%的曲風完全體現比例,說明復雜度更多被用于服務Prompt,而不是掩蓋音樂判斷。
一句話總結,V9.5的任務是把歌做得更自然。
二、不是生成得更多,是想得更深
如果說V9.5解決的是聽起來像不像人做的,O3解決的就是想得夠不夠深。
O3跑在V9.5之上,用test-time scaling把MusiCoT的推理過程拉長了。從能看到的層面來說,它不是簡單地把生成拉長或者算更久,而是讓模型在生成過程中持續問自己:當前這段旋律還在為整首歌服務嗎?編配是不是又把主唱淹了?情緒是不是透支了?結構有沒有跑偏?多出來的算力,被用來回頭看和自己改,讓音樂思維一步步收斂,而不是一次決定后一條道走到黑。
具體來說,這種反思式推理覆蓋四個能力。首先,全曲目標不丟,MusiCoT先定好結構、情緒和表達方向,后面每一步判斷都回到這個全局目標,不是走一步看一步。其次,生成中持續審視,模型不光判斷局部好不好聽,還檢查當前選擇有沒有破壞整首歌的一致性。再次,發現偏差后自己改,旋律、編配、人聲或情緒跑偏了,后續決策會重新校準,有點像創作者寫完一段回頭聽,覺得不對,刪了重來。最后是成本,更高的推理成本換的不是算力炫耀,而是審視、修正和收斂的空間。
這套機制能有效,前提是底座先有了真實感。V9.5提供了一個更克制、更自然的基底,O3不需要從一個充滿AI堆疊感的結果開始補救,而是在一個已經不錯的底子上打磨。
歌曲《誤差》
定位:更擬真的音色,編曲可以理解提示詞的感覺
提示詞: Minimal Electronic / Cosmic Pop。晶瑩合成器脈沖、低頻氛圍無人聲與極簡電子紋理,描繪一座漂浮在沉睡星球軌道上的空間站,冰冷、空曠、遙遠。整體像隔著舷窗凝望深空,緩慢、克制、沉思,充滿失重感與未知感。 Minimal Electronic / Cosmic Pop,Featuring crystal-like synth pulses, soft sub drones, minimal electronic textures, and vast spatial reverb. A cold and distant soundscape inspired by a drifting orbital station, creating a feeling of weightlessness, isolation, and quiet contemplation.
歌曲《Still in the Room》
定位:更穩定的編曲,完整的編曲,模型可以完整的捕捉曲風。
提示詞:Dream Pop。混響吉他、漂浮感男聲與柔和氛圍合成器營造朦朧夢境質感,溫暖貝斯和松弛鼓組支撐空間感,整體像私人房間里的夜晚獨處,迷離、內省、溫柔而有距離感。 Prompt:Dream Pop, featuring reverb-rich guitars, floating male vocals, soft atmospheric pads, warm bass, and restrained drums. A hazy and intimate soundscape with a private studio feeling, blending dreamy textures, emotional distance, and gentle melodic hooks.
方向性數據也支持這個判斷。此前一輪100首實驗中,推理擴展把聽感良品率從35%提到了43%,綜合可用率從35%提到39%。這說明更充分的音樂CoT加test-time scaling這條路有繼續提升質量的潛力。
![]()
(評測范圍:100 首歌曲樣本。數字來自同一輪候選對照;“更有人味、更少 AI 味”來自評審對樣本的回掃歸因,是對音樂形態、編配克制和真實感的綜合判斷,不是由單一數值直接定義。)
當然,這個結果是基于前期底座的,只是用來驗證技術方向,不代表新版V9.5下的最終O3指標。
V9.5負責把歌做得更自然,O3負責交付前多看多想多修一遍。兩個組合在一起,實現的是一件事,從一次性生成跨到完整思考打磨,把復盤、修正、收斂的流程嵌進模型生成的每一步。
三、從0到1到行業登頂,一條自主可控的技術路線
Mureka V9.5的克制和真實感不是這一代突然冒出來的。
Mureka是昆侖萬維天工Skywork AI自研的,國內最早實現端到端落地的通用AI音樂大模型。從2年前開始投入,2024年初初代產品SkyMusic 1.0內測,打通了文本轉歌曲、多樂器伴奏、人聲合成的完整閉環,完成從0到1的落地,也開啟了國內通用AI音樂工業化的探索。
一年后,Mureka V6加O1正式發布,全球首次落地MusiCoT音樂思維鏈框架,顛覆了逐幀生成的邏輯,先規劃全曲結構再填充細節。同步推出的初代推理增強O系列支持10種語言詞曲生成,覆蓋流行、搖滾、爵士、電子等全品類,上線后迅速積累了全球數百萬創作者用戶。到2025年底的V7.6加O2迭代,重點優化了人聲質感、混音聲場和提示詞理解精度,大幅降低了模板化編曲問題,同時開放完整API生態,服務全球數千家企業開發者,落地短視頻、游戲、播客、影視配樂等商用場景。
真正的轉折出現在2026年初。Mureka V8在國際權威AI音樂評測榜單拿下人聲、器樂雙榜第一,綜合實力超越Suno、Udio、Google Lyria等海外主流競品,完成了從可用到可直接商用發布的質變。MusiCoT體系全面成熟,同步與太合音樂等頭部音樂集團達成產業戰略合作。同年3月V9亮相,進一步收緊編配邏輯,弱化過度堆疊的AI聽覺特征,優化曲風辨識度和用戶意圖匹配度,為V9.5的真實感底座打下了基礎。
到7月V9.5加O3組合登場,放棄堆砌聲部制造飽滿感的老路子,重構真實音樂創作的底層邏輯。O3全新的反思式推理架構落地,試圖從根上解決AI音樂結構割裂、情緒斷層、表達失真的老問題。
橫向對比的話,早期競品大多靠加厚配器、密集聲部來制造豐富感,旋律擁擠、人聲被蓋、段落無留白這些毛病很常見。Mureka整條路線一直堅持模擬人類音樂人的創作邏輯,先全局結構,再局部細節。V9.5和O3的組合把這條路線的優勢進一步拉開了。
歷史同口徑評測數據顯示,Mureka系列在整體聽感、成品音質、綜合可用率上長期領先海外競品Suno V5.5,之前只在復雜提示詞精準度上有點小差距,V9.5已經把這塊短板補齊了,曲風還原和提示詞匹配都做到了同輪第一。
![]()
(歷史競品對照)
四、從“定稿創作”走向“版本化工作流”
很長一段時間里,全球AI音樂行業的競爭焦點都停在聲音多的層面上。Mureka V9.5加O3的組合給出了另一種答案:AI音樂的核心競爭力不是聲音多,而是像人一樣思考、創作、打磨。
對不同的人來說,這件事的意義不一樣。對普通創作者,輸入一段文字就能拿到人聲自然、編曲有層次、情緒完整的歌,不需要后期花大量時間刪多余聲部、修僵硬人聲。對專業音樂人,V9.5的克制基底適合做創作草稿、副歌靈感、配樂基底,O3的自我修正功能可以省掉反復試聽調整的功夫。對企業客戶,更高的綜合可用率、穩定的音頻健康度、精準的風格還原,短視頻、游戲、影視、有聲內容批量配樂的門檻和成本都在往下走。
但最值得關注的,其實是創作Agent帶來的工作流變化。傳統音樂創作和多數AI音樂工具,還是生成一首歌然后定稿的邏輯,創作本質上是個低頻、高成本、看運氣的事。
(一次對話,靈活調用所用能力)
Mureka對創作的理解發生了根本變化,創作不再是寫出一首歌,而是在版本空間里做選擇、做判斷、做迭代。
產品層面,這個理念落地成三個空間。探索空間,同一創意快速出多個版本,打開可能性。控制空間,在旋律、人聲、結構等維度上局部保留和替換,精確到段。執行空間,Studio把操作DAW變成指揮創作,門檻降了,上限升了。創作者可以把更多時間花在審美決策上,而不是反復試錯。
![]()
創作 Agent 界面
從更大的視角看,Mureka已經不是一個單一模型或功能,而是在長成一個平臺。
內容形態是AI原生的,作品可以版本化、可以二創、可以持續進化,這跟傳統音樂平臺承載的內容形態天然不同。雙邊價值同時成立,對創作者提供效率、上限和工作流,對普通用戶提供表達、參與和關系連接。商業模型也是三條線并行,訂閱、創作工具Studio、B端分發加API。
![]()
AI 重塑視頻、游戲、音樂與全球文娛圓桌論壇照片
這次WAIC上,昆侖萬維除了Mureka V9.5,還同步發布了Matrix-3.5世界模型和Riemann-1.0 底層底座,這次發布是昆侖萬維在“4+3”AGI戰略下的關鍵動作,即以四大SOTA模型為技術底座,支撐AI短劇、AI音樂、AI游戲三大AI原生平臺經濟體。
在同期舉行的AI重塑視頻、游戲、音樂與全球文娛圓桌論壇上,自己的AI音樂創作體驗:“我今天早上還讓Mureka V9.5生成兩首歌,很不錯。一首是參照楊宗緯的《空白格》生成的抒情歌,另一首是模仿顏人中的風格,寫了一首關于中年危機的歌。詞寫得挺觸動人心的。”
隨后,王珞丹也談到了她與音樂人朋友的交流經歷:“我有個做音樂的朋友,他跟我分享了一個很有意思的案例。他在編曲環節把任務交給了AI軟件,結果生成了兩個完全不同的版本。他讓我盲選,問我更喜歡哪一個。我選完之后,他才告訴我,我喜歡的那個版本其實是AI做的。”
從音樂到語言到多模態,一個完整的AI Native平臺正在成形。Mureka是這個平臺上的音樂基礎設施,也是目前感知度最高的入口之一。
Mureka的長線目標非常明確,不把AI當成快速生成音樂的捷徑工具,而是打造一套原生的AI多模態創作基礎設施,讓AI成為音樂人真正的創作伙伴。
未來AI音樂的競爭,最終比的也許不是誰家模型最大,誰能率先建起一套真正理解音樂審美、能持續自我進化、把好聽變成可控系統能力的創作基礎設施,誰就拿到了下一張門票。Mureka V9.5加O3加創作Agent這一套組合拳,像是在回應這個行業正在發生的變化。(本文首發于鈦媒體APP)
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.