![]()
來源 |Tech星球
文| 王琳
騰訊首席科學家姚順雨,交出了一份比Hy3 preview更令人滿意的成績單。
7月6日,繼騰訊混元Hy3 preview(預覽版)發布兩個半月后,Hy3 正式版亮相。作為姚順雨加入騰訊后首個重量級產品,Hy3沒有卷萬億參數,而是選擇了一個更現實的路線。它采用MoE架構,總參數295B、激活參數21B,支持256K上下文,是一個快慢思考融合模型。
在定價上,Hy3堅持普惠路線,輸入1元/百萬token,輸出4元/百萬token。這個價格,相比GPT-5.4標準版輸入為$2.50/百萬token,輸出為$15.00/百萬token,Hy3 的價格可以說是“白菜價”;和被用戶調侃“便宜到只收電費”的Deepseek -v4 flash在高峰期價格相當。
在官方描述中,Hy3以更小的參數達到追平甚至優于其他模型的能力。比如,編程能力上,Hy3略高于GLM5.1和Deepseek -v4 flash,工作智能體方向,ClawEval pass3得68.5,超過DeepSeek V4 Pro的62.4和Qwen 3.7 Max的65.2。
但一些用戶體驗后發現,受限于上下文長度,在復雜長程任務時容易出現遺忘的現象。模型發布后,7月7日開盤,騰訊市值盤中漲近6%,總市值重新站上4萬億港元。
一改往日落后的形象,這是騰訊首次在模型領域實現反超。目前,國產模型的更新一次版本的速度平均在兩個月。如果考慮到騰訊在姚順雨到來后重建團隊和技術路線后,Hy3僅僅用了不到半年時間就追趕上了行業主流節奏。
不止模型領域,在產品側,騰訊也有了遙遙領先的辦公類AI助手WorkBuddy。一位騰訊員工告訴Tech星球,Hy3和WorkBuddy大大提高了內部士氣。
Hy3發布的第二天,據雷峰網報道,騰訊即將迎來混元多模態模型負責人,OpenAI研究科學家田永龍即將加入混元團隊,而田是姚順雨在OpenAI的前同事。這意味著騰訊補齊了模型能力的最后一塊拼圖。
種種跡象表明,或許,騰訊的AI焦慮還沒有徹底緩解,但這起碼是好的開端。
Hy3 摸到第一梯隊門檻
Hy3發布后,已經兩個月沒有在“X平臺”賬號更新內容的姚順雨發布了一條推文。他表示,從Hy2-Hy3 preview-Hy3,不到半年,又一次巨大的飛躍。這不僅是模型推理或智能體能力的飛躍,更是抗幻覺、可靠性以及產品體驗的飛躍,并稱為團隊感到自豪。
![]()
對比此前的Hy2和Hy3 Preview,Hy3進步明顯。尤其是Benchmark(AI基準測試)的BrowseComp榜單上,Hy3得分達到84.2%。BrowseComp是測試AI是否能真正辦事的Agent能力,目前行業平均得分只有62%。
![]()
在基于真實產品的內部評測中,Hy3的幻覺率從12.5%降至5.4%,常識錯誤率從25.4%降至12.7%,這意味著Hy3較大程度上改善了“張冠李戴”、無中生有、邏輯矛盾等問題。
以經典邏輯陷阱“你面前有10個雞蛋,打碎了2個,煎了2個,吃了2個,請問還剩幾個雞蛋?”為例子,Hy3已經可以正確題目的意思,避開陷阱,得到“剩余8個雞蛋”的正確答案。
![]()
再來看256K的上下文。
給Hy3一份題為《2026“人工智能+”行業發展藍皮書》的報告,要求其回答下面的問題:根據報告,2025年中國人工智能核心產業規模達到了多少億元?2026年3月,中國日均詞元(Token)調用量突破了什么規模?
經過2分鐘思考,Hy3給出正確答案和答案在報告中的具體位置。
![]()
為了進一步考驗模型的能力,我們增加了一個需要跨章節總結的題,要求以下問題:人工智能正從哪三個層面引發系統性變革?請分別概括這三個層面的核心觀點。
![]()
可以看到,Hy3完整總結出了三個層面的觀點,并指出了觀點涵蓋的章節。
官方測評顯示,能力表現上,Hy3以較小尺寸首次比肩參數規模2到5倍的旗艦模型。在內部270位專家基于真實工作的盲測中,Hy3以2.67分(滿分4分)優于GLM 5.1的2.51分。
在編程、搜索、工作、上下文等智能體方向,搜索智能體方向表現最強,BrowseComp得分84.2,追平GPT-5.5的84.4;工作智能體方向,ClawEval pass3得68.5,超過DeepSeek V4 Pro的62.4和Qwen 3.7 Max的65.2。
在編程能力上,Hy3略高于GLM5.1和Deepseek -v4 flash,離GLM5.2仍有一定差距,但已經摸到了第一梯隊門檻。
![]()
開源的本地AI聊天應用atomic.chat在“X平臺”上發布了自己的測試視頻,分別給Hy3、Gemini 3.5、GLM-5.2、DeepSeek-V4布置了同一個任務:構建三個獨立的HTML5 Canvas場景,并演示真實的物理效果。任務包括:保齡球全中,球瓶四散;空氣曲棍球,激烈攻防后得分;臺球開球,球堆炸開。
![]()
結果顯示,騰訊的Hy3在上述三個任務中都達到了Gemini的水平:碰撞干凈利落,球反彈真實,球瓶像真正的全中一樣被擊倒,沒有任何卡頓或漂浮現象,但價格卻只有Gemini 3.5的1/35。
GLM在純編碼任務上確實很強,但一旦任務偏離簡潔代碼的范疇,效果并不好,保齡球被打倒后靜止在原地,并沒有按照慣性持續滾動一段時間。DeepSeek消耗的代幣最多(5萬,幾乎是Hy3的兩倍),但最終交出的場景卻是最弱的。
產品全線發力,元寶員工調至WorkBuddy
除去基礎大模型,騰訊今年在產品側也開始頻繁出牌。
今年3月,桌面端辦公智能體迎來一波爆發。易觀分析數據提到,當月頭部產品月訪問量合計超過2000萬次,騰訊WorkBuddy以885萬排在第一。Tech星球此前曾報道該團隊人員規模已經超過了100人,最新的情況是很多元寶產品部的員工也被調到了WorkBuddy。
由于調用量的增多,騰訊調整了對WorkBuddy的收費標準,原專業版升級為標準版,月費從58元提升至99元;同時新增199元/月高級版與999元/月旗艦版,并按照不同檔位開放模型能力、自動任務數量、云存儲空間和積分額度。
不過,一位云代理商告訴Tech星球,WorkBuddy現在更多是培養用戶習慣的階段。他現在主要是運營賬號,科普并積累一些潛在的用戶,自己并沒有商業化的KPI。一份流傳的報告顯示,WorkBuddy2026年的目標是致力于成為中國最大的企業AI辦公訂閱產品。
騰訊還有兩個重量級的Agent產品即將上線,目前這兩個產品都已開啟灰測。
一個是企業微信針對辦公場景的Agent產品大圓,定位為“長在企業微信工作流里”的助理。據悉,大圓可以直接閱讀企微里已經有的群聊、文檔、會議、郵件、日程,自己理解用戶想干嘛,再結合當下的界面給出答案,而不需要用戶反復陳述需求。
和其他Agent產品更大的區別是企業微信還掌握著企業經營數據,這意味著大圓未來好可以針對企業經營提效。
一位灰測用戶告訴Tech星球,因為只有企業微信能實現獲取上下文長度的能力,所以體驗還好,但是缺乏亮點,如果讓CLI(命令行)能抓取到所有群聊、文檔、會議信息的話,WorkBuddy的表現應該會更好。
“企業微信的產品能力不是強項,現在的大圓可能已經是非常激進了”,他補充道。
另外一個是微信針對生活場景的Agent產品小微。此前,據媒體報道,小微計劃今年第三季度正式向全體用戶推出。微信的生態無可比擬,但關鍵的問題在于商業模式如何落地。
當14億用戶的推理需求上來后,需要支付的成本巨大。高盛曾經做過預測,以每百萬Token推理成本0.15美元計算,若“小微”全面推廣,其新增的推理成本將占到騰訊2026年第四季度調整后營業利潤的5%至17%。
砸錢、挖人、接業務,騰訊出擊AI下半場
騰訊在大模型領域的戰略意志最明顯的體現是資源投入上。
今年早些時候,騰訊總裁劉熾平表示:“2026年我們肯定會持續加大對AI的投入,去年我們在AI新產品上投入了180億元,今年至少翻倍。”
事實上正是如此。一位AI領域獵頭告訴Tech星球,去年騰訊曾以3倍薪資大規模挖字節seed團隊的開發者。
今年第一季度,騰訊反映經營活動所產生的現金凈額為1014億元,資本開支付款為370億元(主要用于支持公司AI相關的投入),也就是說,騰訊每賺10元經營現金,就有近4元用于AI。
反應到具體業務上,剛剛推出的Hy3擴大了 RL(強化學習)算力規模,說白了就是投入了更多的計算資源(如GPU/TPU、CPU集群、內存等)來運行強化學習算法。
大規模投入背后,AI競爭的規則也在發生變化。如果說上半場是比拼“誰GPU多、數據多”,那現在是已經進入“拼誰反饋機制設計得好、誰能在真實場景中持續進化”的下半場。
基于自身的場景優勢,騰訊正在實現模型和產品雙向互補。Hy3 Preview發布后,包括WorkBuddy、元寶、CodeBuddy、Marvis等許多產品都接入了,如今Hy3也是如此,據悉目前近50個業務在接入隊列中。
騰訊曾在第一季度財報電話會披露,混元Hy3 Preview已接入131款騰訊產品,當前Token調用量較混元二至少提升10倍。
事實上,在騰訊官方發布的Hy3介紹里,能明顯看到元寶、Marvis、QQ瀏覽器等多個個業務線對Hy3的具體評價。這意味著在模型發布前,Hy3就已經在內部做了大量測試。
砸錢、接業務、挖人才,騰訊正以前所未有的投入追趕大模型浪潮,且成果顯著。但它需要向外界證明自己具備持久領先并超越的能力。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.