【TechWeb】Arena平臺于2026年7月20日發(fā)布了最新一期(統(tǒng)計周期:7月13日-19日)大模型排行榜。本周榜單迎來大規(guī)模新模型集中入榜,其中國產(chǎn)模型表現(xiàn)亮眼:Kimi K3不僅首次躋身綜合榜前十,更直接登頂前端開發(fā)榜榜首,在細分能力上實現(xiàn)了對多數(shù)海外頭部模型的反超,標志著國產(chǎn)大模型在特定工程場景已形成領先優(yōu)勢。
![]()
綜合榜:Claude Fable 5蟬聯(lián),Kimi K3躋身第一梯隊邊緣
綜合榜頭部競爭激烈,第一名由 claude-fable-5 以1507分的ELO分數(shù)占據(jù),Anthropic旗下多款思考版本模型(如 claude-opus-4-7-thinking 等)集中占據(jù)了Top 5的席位,彼此分差在15分以內(nèi),屬于并列第一梯隊。
本周最大亮點是國產(chǎn)模型Kimi K3以1486分的ELO分數(shù)排名第9位,首次闖入綜合榜Top 10。其分數(shù)與第8名的 gemini-3-pro、第10名的 gpt-5.6-sol-xhigh 完全一致,表明其已穩(wěn)居全球第一梯隊的邊緣位置。
代碼榜:Anthropic模型包攬前列,Kimi K3挺進前十
代碼榜榜首發(fā)生變動,claude-opus-4-7-thinking 以1553分升至第一,將此前居首的 claude-fable-5 擠至第二(1551分),兩者僅差2分,屬于并列第一梯隊。Anthropic的思考模型幾乎包攬了前7名,統(tǒng)治力依然強勁。
國產(chǎn)模型Kimi K3同樣首次進入代碼榜Top 10,排名第10位,ELO 1529分,與第9名模型僅差1分,表現(xiàn)已十分接近第一梯隊。
前端開發(fā)榜:Kimi K3強勢登頂,國產(chǎn)能力領跑全球
前端開發(fā)榜呈現(xiàn)出前所未有的格局。Kimi K3以1679分的高分直接位居第一名,大幅領先第二名 claude-fable-5 的1631分,分差達48分,優(yōu)勢明顯。其在前端領域的實力不僅體現(xiàn)在總分上,更在品牌與營銷、基于參考的設計、數(shù)據(jù)與分析、消費產(chǎn)品、模擬、內(nèi)容創(chuàng)建工具6個細分領域均排名第一,僅在游戲領域位列第二。
第四名同樣由國產(chǎn)模型 glm-5.2 (max) 以1587分拿下,超越了多款Claude、OpenAI的旗艦模型。這意味著,國產(chǎn)大模型在前端開發(fā)這一細分場景的能力已經(jīng)走在了全球最前列。
智能體榜:Claude Fable 5(High)居首,國產(chǎn)模型GLM 5.2(Max)入局前十
智能體榜本周全部是新入榜模型。第一名是 Claude Fable 5 (High),凈提升度13.94%,并擁有30.65%的最高好評/差評比,工具幻覺率僅1.33%。第二名 GPT 5.6 Sol (xHigh) 的可控性數(shù)值最高,達到17.26%。
國產(chǎn)模型 GLM 5.2 (Max) 也殺入榜單Top 10,位列第9,凈提升度為6.24%。其Bash恢復速度僅4.45,遠好于頭部平均水平,在命令出錯后能快速恢復,表現(xiàn)突出。
AI生圖與視頻榜:格局穩(wěn)定,國產(chǎn)模型占據(jù)重要席位
AI生圖榜格局穩(wěn)定,OpenAI的 gpt-image-2 (medium) 以1385分穩(wěn)居第一。字節(jié)跳動的 seedream-5.0-pro 作為最高排名的國產(chǎn)模型位列第11位(ELO 1231分),緊隨多款海外頭部生圖模型之后。
AI視頻榜方面,谷歌 gemini-omni-flash 位列榜首。字節(jié)跳動的 dreamina-seedance-2.0-720p 穩(wěn)居第二名,ELO分數(shù)1482分,表現(xiàn)遠超多數(shù)海外視頻生成模型。同時阿里的 happyhorse-1.0 也拿下第4位,國產(chǎn)力量在AI視頻生成第一梯隊已占據(jù)重要席位。
總結(jié):國產(chǎn)大模型實現(xiàn)關鍵性跨越,從追趕走向定義前沿
本周Arena榜單的核心看點是國產(chǎn)模型的多點突破。Kimi K3在綜合榜、代碼榜、前端開發(fā)榜的集體表現(xiàn),特別是前端開發(fā)榜的登頂,證明國產(chǎn)大模型不僅在通用能力上追平了國際第一梯隊,在特定工程類任務場景已經(jīng)形成了明確的領先優(yōu)勢。同時,字節(jié)跳動、阿里巴巴、智譜AI等廠商的多款模型也在代碼、生圖、視頻、智能體等多個榜單的前半?yún)^(qū)站穩(wěn)腳跟,梯隊完整度進一步提升。
隨著用戶評測數(shù)據(jù)的積累,下周部分新入榜模型的排名和分數(shù)可能出現(xiàn)小幅變動,后續(xù)能否有更多國產(chǎn)模型在細分榜單拿下榜首,值得持續(xù)關注。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.