- 克雷西 發自 凹非寺
量子位 | 公眾號 QbitAI
泄露了一路的Opus 5,剛正式登場就被網友玩瘋了。
今天凌晨,Anthropic正式把這款新模型放了出來。
![]()
多項硬核評測上,它追平甚至反超了Fable 5,價格卻只有一半。
Frontier-Bench上,它反超了包括Fable 5在內的所有對手,性能是上一代Opus 4.8的兩倍還多。
CursorBench最高努力設置下,也貼近定價兩倍的Fable 5峰值成績,只差0.5%。
![]()
官方給出的demo里,有一個能實時顯示氣流路徑的風洞,氣流怎么繞過去看得清清楚楚。
![]()
還有一張能360度旋轉的3D細胞結構圖,連內質網上密密麻麻的核糖體都畫了出來。
![]()
更耐人尋味的是,為了配上這代模型的判斷力,Anthropic把自己給Claude Code寫的系統提示詞刪掉了八成,成績卻沒掉。
之前泄露的時候有網友感嘆Opus 5簡直就像fable 6,現在Opus 5正式發布之后,有人更贊同這個說法了。
![]()
網友已開啟瘋玩模式
Opus 5上線不過半天,網友們就已經開啟了瘋玩模式,接下來就來看看網友們都整出了什么活。
博主am.will本來覺得Opus 5不過是一個便宜版Fable,測完直接改口,說自己「大錯特錯」。
他只用了5倍Max訂閱額度的27%,就讓Opus 5搭出了他見過最好的一個Rocket League克隆版,游戲能玩,代碼還開源在了評論區。
![]()
類似的反差,也出現在另一段動畫演示里。
博主OmedTheVibeCoder做完測完一個競技場對決的畫面,評價從「以為會接近」變成「根本不是接近,是完全甩開了它」。
開頭看到的「就是fable 6」的評價,正是看了這個結果說出來的。
![]()
后來他有放出了和其他模型的對比,并補充說自己「差點從椅子上摔下來」,因為Opus 5 Max直接打破了他原來的測試標準。
他表示,這已經不像是代碼生成的畫面,倒像是把提示詞丟進了圖像生成器,出來的卻是一整張能走進去的地圖。
![]()
另一位博主Alex Ermolov搭建的是滑雪場景,他給出的結論是「和Fable 5打平,甩開我測過的所有其他模型」,第一遍生成就沒有明顯穿模,滑行物理也對。
![]()
Minecraft復刻測試里,Chetaslua更是把這次生成稱為「迄今為止最好的一次創作」。
![]()
把它接入到Unity,就像給游戲開了掛一樣。
![]()
Opus 5對物理規律也拿捏的很精準,在這個連環機關場景當中,每個緩解都和真實規律嚴絲合縫。
![]()
Noema則給了Opus 5一個「狠」提示詞,要求只用一個HTML文件,做出一整條從1945年變化到2055年的街區,建筑、車輛、店鋪、人群、燈光和音效全部跟著年份走。
即使effort從max降到high,Opus 5的結果也把Fable 5、GPT-5.6 Sol都甩在了后面,Noema給的評價只有三個單詞,「是個怪物」。
![]()
還有阿波羅任務的點火升空場景,從火箭噴焰到實時刷新的遙測數據,幾乎全靠程序生成,沒有拼現成素材庫。
![]()
CAD設計上,網友也是直接給它封神,表示它在很多機械設計任務當中表現超越了fable。
![]()
教育場景上,開發者Matt Shumer給@AlphaSchool做了個實時AI家教原型。
Opus 5負責對話和方向判斷,配合一個專門訓練的小型世界模型做實時渲染,雖然還很粗糙,已經能一邊講分數概念一邊在畫板上同步畫圖。
![]()
另外我自己也試著讓Opus 5(Low Effort)寫了一個三羧酸循環過程的3D網頁動畫演示。
它的核心思路是只描述化學過程,把幾何計算交給程序完成。
具體來說,Opus 5針對每幕反應只寫原子清單與鍵表,每根鍵帶有反應前后兩個鍵級,由此同時定義底物與產物。
三維坐標交則由幾何優化器現場求解,按元素和鍵級取標準鍵長,按配位數推雜化得到鍵角,再加上非鍵排斥與平面性約束迭代收斂。
產物構型則以底物坐標為起點再優化一次,使動畫只保留必要位移,離去的小分子則自動被推開飛散。
最后,Opus 5將代碼單獨抽出,校驗鍵長與鍵角,確認無誤后再用Three.js渲染成球與圓柱。
最終交付的成果不僅正確體現反應過程,鍵長、鍵角等物質的真實結構信息,也都是按照實際渲染的。
![]()
atomic.chat則用三個破壞場景的題目,做了一次更細的橫向對比,并且比較了成本。
同樣是龍卷風卷起整片場地、重錘砸樓、卡車壓塌桁架橋這三道題,Opus 5花0.508美元全部做對,Fable 5花的錢幾乎是Opus 5的兩倍,龍卷風卷不起地面上的東西,樓在錘子碰到之前自己就塌了,橋直接炸成一堆木棍。
GPT 5.6最便宜,0.14美元,但錘子壓根沒碰到樓,同期的Kimi K3和GPT 5.6水平相當。
![]()
之前Opus 5泄露時,有人懷疑它雖然單價低但token燒太多,綜合下來并不比fable便宜,現在看來可能只是個例。
更硬核的自檢流程
博主Victor M做了一次更硬核的自檢演示,題目是照著波音747的公開數據,用代碼在瀏覽器里重建出一架能轉能看的3D模型。
Fable 5用42分鐘交了活,4個文件、約1000行代碼,搭了一套Puppeteer渲染管線,跑了17輪渲染,檢查了54張截圖,驗證方式只靠肉眼看圖對不對。
Opus 5花了71分鐘,寫出20個模塊、約4000行代碼,換成Playwright渲染管線,25套鏡頭預設,還多寫了一個測量腳本。
而它驗證的方式,是從渲染出來的畫面里提取正射輪廓,算出翼展、軸距、機翼前緣掃掠角等14項具體指標,逐項去和波音747-400的公開數據核對公差。
它還做了幾件Fable 5沒做的事,前43分鐘只渲染沒貼皮的素模,確認輪廓過關了才上涂裝,中途加了一個調試參數,能單獨渲染某個子部件方便排查問題,最后把6個視角拼成一張聯系表一次看完,不用一張張翻截圖。
Victor M的結論是,Fable 5交貨快了大概40%,尺寸表也更好讀,但它用的是和Opus 5一樣的747-400真實數據,卻從沒拿建好的模型反過來量過這些數據對不對。
![]()
之所以把這個例子單獨拿出來說,是因為Opus 5這種「自己驗證自己」的勁頭,在Anthropic官方給的案例里同樣能看到。
![]()
比如Frontier-Bench有一道題,給Opus 5一張機械零件的圖紙,要求它寫代碼,用FreeCAD把零件重建成3D模型,卻不給任何直接看圖的方式。
它索性自己寫了一套計算機視覺管道,從像素里提取幾何數據,把零件重建了出來,而且反復成功,同樣的設定下,其他模型試了五次都沒做出來。
還有一個開源包管理器的真實bug,社區提交的補丁只處理了表面癥狀,Opus 5順藤摸瓜找到了底層原因,把邊緣情況一起修了。
另外,一位量化交易工程師用它給新交易所搭實時行情源,之前的模型全部做不出來,Opus 5發現沒有實時數據可以驗證,干脆自己搭了一套測試環境,專門檢查代碼解析交易所數據對不對。
一半價格咬住fable 5
看完這些demo,再來通過數據感受一下Opus 5的性價比。
價格上,Opus 5和前一代的Opus 4.8相比是提質不加價,依然是每百萬token輸入5美元、輸出25美元,只要Fable 5的一半。
同時Opus 5也照舊配備了Fast模式,和之前一樣是兩倍價格換2.5倍速度。
比起價格,Opus 5在跑分上的贏面更讓人意外。
![]()
Frontier-Bench v0.1這類硬核編程任務上,它拿到43.3%,把Fable 5的33.7%甩開一截,是自家上一代Opus 4.8(21.1%)的兩倍還多。
Opus 5贏面最大的一項是ARC-AGI-3,專測那種模型壓根沒見過的全新問題。
它拿到30.2%,隔壁GPT-5.6 Sol只有7.8%,差了將近四倍,比上一代Opus 4.8更是翻了近20倍。
![]()
還有專門用來為難頂尖模型的高難度測試Human's Last Exam,不開工具的時候,Opus 5的得分是56.3%,和Fable 5的56.5%差距極小,而如果開啟工具,Opus 5的成績就會漲到64.7%,反超Fable 5的63.9%。
![]()
網頁搜索、編程智能體指數、深度搜索問答這幾項,Opus 5也都小幅領先,BrowseComp 90.8%對87.4%,AA Coding Agent Index 66.7%對65.8%,DeepSearchQA 95%對94.7%。
還有一個小插曲是,A社先前的一版通告里,在FrontierCode榜單上,把得分更低的Opus標成了獲勝者,不過現在這個bug已經修正了。
![]()
電腦操作和業務流程這兩項,差距拉得更大,OSWorld 2.0上的成績是70.6%對66.1%。
而且,官方說Opus 5在這項測試里,只花了不到fable 5三分之一的成本。
![]()
之前在Opus 5泄露風波中頻繁出現的cursor,其聯創評價,Opus 5用Opus的價格實現了接近fable的性能。
![]()
除了官方通告里的那些數字,Opus 5也在今年的IMO 2026競賽中取得了滿分成績,而且沒有用任何外部工具。
![]()
另外,Opus 5也不像fable 5那么的守口如瓶了,其預計觸發攔截的頻率比后者降了約85%。
![]()
之前fable 5近乎變態的安全護欄確實讓人感到頭疼,現在有了Opus,或許就能緩解了。
CC系統提示詞也改了
Opus 5發布的同一天,Anthropic工程師Thariq寫了一篇文章,講他們怎么給Claude Code這類產品設計上下文。
文章里最扎眼的一條是,Claude Code的系統提示詞被刪掉了超過80%,編碼評測成績卻沒有任何下降。
這80%的刪減,就是專門針對Opus 5、Fable 5這代模型做的。
![]()
能刪掉這么多,前提是模型的判斷力已經追上來了,過去靠規則硬堵的地方,現在可以放手交給模型自己判斷。
最典型的一條規則是「默認不寫注釋」。
早期模型判斷力不夠,團隊怕它注釋寫得又多又亂,只能定死這條規則,但用戶自己想要詳細注釋的時候,這條規則反而幫了倒忙。
現在這條規則被換成了「寫代碼時貼合周圍代碼的風格,匹配注釋密度、命名和習慣」,判斷權交還給了模型。
![]()
類似的邏輯也用在了工具設計上。
過去團隊靠給例子來教模型怎么用工具,但例子越多,模型可選的路徑反而被框得越死。
現在,團隊反過來在工具接口本身上花心思,比如Todo工具只留「待處理」「進行中」「已完成」幾個狀態,模型自己就能判斷該怎么用,不需要額外舉例。
![]()
判斷力上來了,上下文本身也不用一次性堆給模型。
系統提示詞從一開始就把所有場景的說明塞進去,改成了「漸進式披露」,把代碼審查這類不常用的說明單獨拆成一個技能文件,模型判斷需要時才自己去調用。
記憶也不例外,以前靠用戶手動把信息寫進CLAUDE.md,現在Claude能自己判斷哪些信息值得記下來,直接存成記憶。
這些變化背后是同一個判斷,規則、例子、記憶,本來都是給判斷力不夠的模型搭的腳手架,現在腳手架被一根根拆掉,因為模型自己就能接得住。
One More Thing
Opus 5發布之后,馬斯克也來蹭了波熱鬧。
他放了一張FrontierCode的性價比截圖,表示只有Grok 4.5和Opus 5處于帕累托前沿,也就是多目標優化問題中所有“最優權衡解”構成的一條邊界線。
![]()
按他的說法,Grok 4.5雖然表現不及Opus 5,但價格便宜,是同等性能下最低價的模型之一。
[1]https://www.anthropic.com/news/claude-opus-5
[2]https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.