![]()
智東西
作者 茄子
編輯 程茜
智東西7月15日消息,今天上午,阿里云正式發布實時語音交互對話模型Qwen-Audio-3.0-Realtime,還一并推出了Plus和Flash版本。
千問稱,該模型在保持毫秒級時延響應的基礎上,進一步增強了工具調用、多輪對話、情感表達和實時交互能力。比如,在路線規劃場景中,用戶無需明確發出“幫我查一下”之類的指令,只需告知自己的時間安排和需求,Qwen-Audio-3.0-Realtime便能理解上下文,自主判斷何時調用地圖工具。
同時,如果用戶安排里有喝咖啡,該模型可以自動篩選附近評分高的咖啡館,并在獲取信息后繼續完成路線和時間規劃。
//oss.zhidx.com/uploads/2026/07/6a57514573c09_6a575145627a7_6a5751456277b_語音計劃.m4a
▲Qwen-Audio-3.0-Realtime幫助用戶進行路線規劃
相比傳統語音助手需要依賴明確指令觸發工具調用,該模型不僅能聽懂用戶表達、理解任務目標、判斷調用工具的時機,還能將工具查找的信息無縫融入后續對話。
根據官方基準測試,在語音問答基準VoiceBench中,用書面化標準提示詞和口語化提示詞提問,Qwen-Audio-3.0-Realtime Plus版本得分分別為92.5和90.5,差距僅2.0分,這意味著該模型能扛住真人說話的隨意性。在S2S語音指令遵循公開基準VStyle上,該模型取得SOTA成績。
今年5月,該模型的Preview版本Fun-Realtime-Audiochat在“語音推理能力”和“對話流暢度”兩項指標上分別以97.6%和97.8%登頂Artificial Analysis,超過GPT-Realtime-2(High)。
在價格方面,該模型按token計費,輸入音頻、輸出文本和輸出語音統一折算token,輸入價格分別為Plus版5元/百萬token、Flash版3元/百萬token,輸出價格分別為Plus版40元/百萬token、Flash版30元/百萬token。
![]()
▲Qwen-Audio-3.0-Realtime Plus和Flash版本價格(智東西制圖)
千問稱,Qwen-Audio-3.0-Realtime能在壓低時延的同時不掉智商,核心技術支撐來自在線策略蒸餾和多教師蒸餾框架。該模型的研究團隊將文本大模型的完整推理能力蒸餾至語音模型,同時通過多教師蒸餾策略確保該模型在口語、問答與推理、工具調用和音頻理解四條主線上不偏科。
該模型目前可通過阿里云百煉調用API進行體驗。
體驗地址:
Qwen-Audio-3.0-Realtime-Plus:
https://bailian.console.aliyun.com/cn-beijing/?spm=a2c4g.11186623.0.0.4ab7695bvInrXr#/model-market/detail/qwen-audio-3.0-realtime-plus?serviceSite=asia-pacific-china
Qwen-Audio-3.0-Realtime-Flash:
https://bailian.console.aliyun.com/cn-beijing/?spm=a2c4g.11186623.0.0.4ab7695bvInrXr&tab=model#/model-market/detail/qwen-audio-3.0-realtime-flash?serviceSite=asia-pacific-china
一、Agent能力升級:支持自主調用工具、情緒表達和可打斷實時對話
千問通過多個官方案例展示了Qwen-Audio-3.0-Realtime在自主調用工具、情感交互以及可打斷實時對話等方面的能力。
過去,語音模型存在“能聊天不能辦事”的問題,需要用戶明顯說出“幫我打開XX”才能觸發工具,并且切回閑聊后容易出現上下文斷裂。千問稱,Qwen-Audio-3.0-Realtime無需明確指令即可自行調用外部工具,并且調用結果還會自動融入對話記憶,一次調用的結果會被記住,后面幾輪追問都能接著用。
例如,用戶先問“附近有什么川菜館”,再追問“評分4.5以上的哪家最近”,該模型會自動銜接地圖工具上一次的返回結果繼續檢索。
在共情能力方面,Qwen-Audio-3.0-Realtime去掉了傳統語音助手的機械感,可根據對話語境動態調整語氣、節奏、音調與情感。比如,與該模型分享開心或難過的事時,Qwen-Audio-3.0-Realtime可以根據用戶的語氣和心情輸出并與用戶進行對話。
//oss.zhidx.com/uploads/2026/07/6a57533bde51d_6a57533bdab25_6a57533bdaae7_情感.m4a
▲Qwen-Audio-3.0-Realtime回答用戶情感問題
千問稱,Qwen-Audio-3.0-Realtime在溝通流暢度方面也進行了提升,在官方測評中,它可以根據用戶說的話調整自己的回答,被用戶打斷后也能根據用戶的新問題進行回答。
比如讓該模型安排旅游攻略,在與它交流的過程中,用戶可以隨時轉換問題,不需要等它輸出完,并且,它可以及時跟上用戶思維進行連貫的對話。
//oss.zhidx.com/uploads/2026/07/6a5753504464c_6a5753503cccc_6a5753503cc9d_計劃旅游.m4a
▲Qwen-Audio-3.0-Realtime被打斷后也能流暢對話
二、口語化輸入不掉分,Qwen-Audio-3.0-Realtime多項基準測試領先
據阿里云官方公布的數據,Qwen-Audio-3.0-Realtime在多項公開基準測試中表現穩定:
在語音問答基準VoiceBench中,首先以書面化標準提示詞進行提問,接著以口語化提示詞對該模型提問,Qwen-Audio-3.0-Realtime Plus版本得分分別為92.5和90.5,差距僅2.0分,這說明,語音模型越來越能適應真人說話的隨機性。
在更難的多輪音頻對話挑戰AudioMultiChallenge基準測試中,該模型Flash版本回答標準和口語化提示詞提問得分分別為43.6和38.1,差距僅5.5分。
在專門考察“AI說得像不像人”的S2S語音指令遵循公開基準VStyle上,該模型取得SOTA成績,達到當前公開模型在這項測試上的最高水平
![]()
▲Qwen-Audio-3.0-Realtime在VStyle上取得SOTA成績(圖源:千問)
今年5月,該模型的Preview版本Fun-Realtime-Audiochat在“語音推理能力”指標上曾以97.6%登頂Artificial Analysis,超過GPT-Realtime-2(High)。
![]()
▲Qwen-Audio-3.0-Realtime Preview版本5月登頂Artificial Analysis(圖源:千問)
在對話流暢度指標上Preview版本也以97.8%超過GPT-Realtime-2(High)的96.1%,在Artificial Analysis上排名第一。
![]()
▲Qwen-Audio-3.0-Realtime Preview版本對話流暢度指標上排名第一(圖源:千問)
三、在線策略蒸餾+多教師蒸餾,讓語音模型“又快又聰明”
千問團隊稱,Qwen-Audio-3.0-Realtime的能力提升主要來自于2項策略。一是在線策略蒸餾(On-Policy Distillation),研究團隊將文本大模型的推理能力蒸餾至語音模型,使得該語音模型在生成回答時,還能被文本大模型實時糾正。
二是多教師蒸餾策略,研究團隊采用四位專攻不同方向的教師:口語多輪偏好教師負責口語化表達與指令遵循;通用教師負責基礎問答與推理;Agentic教師負責工具調用與復雜任務;音頻理解教師負責副語言與音頻語義信息,從而確保該模型在四條主線上均不偏科。
與傳統語音助手不同,Qwen-Audio-3.0-Realtime無需明確指令即可自行調用外部工具,調用結果自動融入對話記憶,一次調用的結果后面幾輪追問都能接著用。
此外,Qwen-Audio-3.0-Realtime內置“多模態感知的雙工控制”子模型,通過分析音頻信號、語義內容與說話人聲紋特征來判斷交互節奏。
該子模型可以使Qwen-Audio-3.0-Realtime在餐廳、開放工區等嘈雜環境中,不會被背景噪聲誤打斷;在多人討論中也能鎖定主對話對象;還在多說話人切換時根據語義線索自然過渡。API預留了audio_prompt字段,用戶可上傳音頻樣本鎖定特定聲紋。
結語:實時語音模型競爭從“低時延”走向“高智商”
在此之前,實時語音模型通常需要在響應速度和推理深度之間做取舍,要么壓時延掉智商,要么保智商犧牲實時性。Qwen-Audio-3.0-Realtime則通過在線策略蒸餾和多教師蒸餾,提升了回答的速度和質量。
語音模型的競爭正在從“誰說得快”轉向“誰聊得像真人”。毫秒級響應是基礎,能自行調用工具、邊說邊聽、隨語境調整語氣,或許是語音模型下一階段的發展方向。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.