7月20日,阿里巴巴發布語音合成大模型Qwen-Audio-3.0-TTS,在細粒度標簽控制、freestyle指令遵循、多語種與方言覆蓋以及復雜聲學魯棒性等方面系統性提升,包含面向實時交互的Flash版本(首包延時300ms級別)和面向高質量生成的Plus版本,讓合成語音從“能說話”走向“會表達”。目前,在全球第三方榜單Artificial Analysis,Qwen-Audio-3.0-TTS-Plus登頂,其預覽版Fun-Realtime-TTS也曾在一個月前登頂該榜單。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.