7月20日消息,阿里千問正式發布語音合成大模型Qwen-Audio-3.0-TTS。新模型包含面向實時交互的Flash版本(首包延時300ms級別)和面向高質量生成的Plus版本。
據了解,新模型在細粒度標簽控制、freestyle 指令遵循、多語種與方言覆蓋以及復雜聲學魯棒性等方面實現系統性提升,讓合成語音從“能說話”走向“會表達”。
此外,該模型支持在文本中嵌入結構化標簽,可對語氣、情緒進行精準調控。并配備精品音色庫,單次語音合成可達3分鐘,覆蓋16種語言以及20種方言。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.