![]()
7月25日凌晨1點(diǎn),Anthropic 發(fā)布了 Claude Opus 5。如果只看名字,你會(huì)以為它是 Opus 4.8 的繼任者,Anthropic 產(chǎn)品線中比 Sonnet 強(qiáng)但比 Fable 弱的中間型號(hào)。
但一看數(shù)據(jù)就會(huì)發(fā)現(xiàn),這款定價(jià) $5/$25(每百萬(wàn)輸入/輸出 token)的模型,在編程、自主搜索、計(jì)算機(jī)使用、企業(yè)業(yè)務(wù)流程等多個(gè)關(guān)鍵基準(zhǔn)測(cè)試上,把定價(jià) $10/$50 的 Fable 5 給超了。而它的成本,只有 Fable 5 的一半。
Anthropic 在官方公告里表示:“Opus 5 comes close to the frontier intelligence of Claude Fable 5 at half the price”,意思是接近 Fable 5 的智能,價(jià)格減半。但他們自己發(fā)布的基準(zhǔn)測(cè)試圖表顯示,Opus 5 在至少四項(xiàng)核心評(píng)測(cè)中明確領(lǐng)先 Fable 5,而且是在更低的成本下做到的。
被“次旗艦”反超的“旗艦”
先看編程能力。Frontier-Bench v0.1 是當(dāng)前最直接映射企業(yè)開發(fā)團(tuán)隊(duì)實(shí)際工作的基準(zhǔn)測(cè)試之一,讓模型自己在終端里寫代碼、跑代碼、調(diào)試多文件變更。Opus 5 拿到了 43.3%,F(xiàn)able 5 是 33.7%。將近 10 個(gè)百分點(diǎn)的差距,在編程評(píng)測(cè)里屬于碾壓級(jí)別。Opus 4.8 在這個(gè)測(cè)試上是 21.1%,Opus 5 直接翻了一倍多。
在 CursorBench 3.2 上,Opus 5 在最高推理強(qiáng)度下達(dá)到 Fable 5 峰值成績(jī)的 94.5%,單次任務(wù)成本只有一半。Anthropic 還宣稱,在 high、xhigh 和 max 三個(gè)推理等級(jí)上,Opus 5 在同成本下的性能都超過了所有其他模型。Cognition(Devin 背后的公司)CEO Scott Wu 在 FrontierCode 1.1 評(píng)測(cè)后確認(rèn):“Claude Opus 5 在調(diào)試和根因分析方面以一半成本達(dá)到了接近 Fable 級(jí)別的性能。”
在自主搜索(Agentic Search)上,Opus 5 拿到 90.8%,F(xiàn)able 5 是 87.4%。十次搜索有九次以上能獨(dú)立搞定。計(jì)算機(jī)使用(OSWorld 2.0)上,Opus 5 在約三分之一成本下就超過了 Fable 5 的最優(yōu)成績(jī)。企業(yè)業(yè)務(wù)流程自動(dòng)化(Business Workflows)方面,Opus 5 拿到 26%,F(xiàn)able 5 只有 17.4%。
科學(xué)領(lǐng)域同樣不弱。Opus 5 在有機(jī)化學(xué)任務(wù)上比 Opus 4.8 高出 10.2 個(gè)百分點(diǎn)(包括從光譜數(shù)據(jù)推斷分子結(jié)構(gòu)),在蛋白質(zhì)相關(guān)任務(wù)上高出 7.7 個(gè)百分點(diǎn)(包括預(yù)測(cè)序列變異對(duì)功能的影響)。在號(hào)稱“人類最后考試”的 Humanity's Last Exam 上,開啟工具后 Opus 5 拿到 64.7%,F(xiàn)able 5 是 63.9%(不開工具時(shí)分別為 56.3% 和 56.5%),差距不到一個(gè)百分點(diǎn)。
但真正讓整個(gè) AI 研究圈停下滾動(dòng)的,是 ARC-AGI 3 的成績(jī)。
ARC-AGI 3 是 Fran?ois Chollet 設(shè)計(jì)來(lái)衡量“流體智能”的基準(zhǔn)。它不是讓模型回憶訓(xùn)練數(shù)據(jù)里見過的東西,而是把它扔進(jìn)完全陌生的交互式環(huán)境里,沒有指令、沒有規(guī)則說(shuō)明、沒有目標(biāo)提示,靠試錯(cuò)自己摸索。人類能完成 100% 的任務(wù)。今年 3 月 ARC Prize Foundation 發(fā)布這個(gè)基準(zhǔn)時(shí),最強(qiáng) AI 模型的得分是 0.37%(Gemini 3.1 Pro)。到 Opus 5 發(fā)布前,公開最強(qiáng)成績(jī)是 GPT-5.6 Sol 在最大推理強(qiáng)度下的 7.8%。Opus 4.8 只有 1.5%。
Opus 5 拿到了 30.2%。是 GPT-5.6 Sol 的近四倍,Opus 4.8 的二十倍。
![]()
這個(gè)數(shù)字的意義遠(yuǎn)超任何編程或搜索基準(zhǔn)。ARC-AGI 3 獎(jiǎng)勵(lì)的不是“做過類似的事所以能做”,而是“從沒訓(xùn)練過也能做”。30.2% 意味著 Opus 5 確實(shí)在通過交互來(lái)推導(dǎo)陌生的規(guī)則體系,而不只是模式匹配。Vellum AI 的基準(zhǔn)分析文章直言:“這個(gè)數(shù)字讓所有人都停下了滾動(dòng)。”
它不只是分?jǐn)?shù)高
基準(zhǔn)數(shù)字告訴我們 Opus 5 考了多少分。但 Anthropic 公布的案例告訴了我們是它怎么考到這些分的。
Anthropic 公布了一個(gè) 3D 建模任務(wù),只給模型一張機(jī)械零件的設(shè)計(jì)圖紙,要求它自主編寫代碼重建完整的 FreeCAD 3D 模型。在 Opus 5 之前,沒有任何模型能完成這個(gè)任務(wù),即使人工提前搭好開發(fā)框架、給出詳細(xì)方案,模型依然會(huì)出錯(cuò)。Opus 5 不僅完成了全過程自主閉環(huán),還自己搭建了配套的測(cè)試工具,逐一校驗(yàn)代碼的數(shù)據(jù)解析邏輯,反復(fù)核查修正問題,直到通過驗(yàn)證。
在沒有任何人工干預(yù)的情況下,自主完成了一個(gè)完整的工程驗(yàn)證循環(huán),設(shè)定目標(biāo)、規(guī)劃步驟、編寫代碼、測(cè)試輸出、發(fā)現(xiàn)錯(cuò)誤、回溯修正、再次測(cè)試、通過。
Zapier CEO Wade Foster 透露,團(tuán)隊(duì)用 Opus 5 處理客戶健康度原始表格,要求 AI 獨(dú)立完成全套客戶流失預(yù)防流程,包括標(biāo)記高風(fēng)險(xiǎn)賬戶、通知對(duì)應(yīng)負(fù)責(zé)人、整理運(yùn)營(yíng)報(bào)告。“以前的模型沒有能完整跑通這條流程的,”Foster 說(shuō),“Opus 5 做到了 100% 完整交付。”
Box CTO Ben Kus 給出了量化對(duì)比:Opus 5 在專業(yè)企業(yè)內(nèi)容處理上整體比 Opus 4.8 提升 8%,數(shù)據(jù)分析工作流提升 11%,盡職調(diào)查提升 17%。一家金融建模團(tuán)隊(duì)的評(píng)估負(fù)責(zé)人 Richard Pham 測(cè)出了準(zhǔn)確率高 9 個(gè)百分點(diǎn),同時(shí)周轉(zhuǎn)次數(shù)少三分之一、耗時(shí)少 60%。法律 AI 團(tuán)隊(duì) Applied Research 負(fù)責(zé)人 Niko Grupen 發(fā)現(xiàn) Opus 5 在保持質(zhì)量的同時(shí),平均比 Opus 4.8 在最高推理強(qiáng)度下少生成了 26% 的 token。
更少的 token、更少的交互輪次、更少的人盯著屏幕。這就是 Opus 5 對(duì)“性價(jià)比”的真正定義。
沒人預(yù)料到的 30.2%
回到 ARC-AGI 3。這個(gè)數(shù)字的沖擊力需要放在時(shí)間線上理解。
今年 3 月,Gemini 3.1 Pro 以 0.37% 領(lǐng)先。到 Opus 5 發(fā)布前,公開最強(qiáng)成績(jī)是 GPT-5.6 Sol 在最大推理強(qiáng)度下的 7.8%。Opus 4.8 掛在 1.5%。Opus 5 發(fā)布當(dāng)天直接拉到 30.2%。Anthropic 在公告中說(shuō) Opus 5 的成績(jī)是“次優(yōu)模型的三倍”,這個(gè)表述甚至可能是保守的,因?yàn)?GPT-5.6 Sol 的 7.8% 是在最大推理強(qiáng)度設(shè)置的極端資源消耗下拿到的,而 Opus 5 在標(biāo)準(zhǔn)推理設(shè)置下就做到了 30.2%。
ARC-AGI 3 它測(cè)的是遇到完全沒見過的問題時(shí)的應(yīng)變能力,Chollet 設(shè)計(jì)的邏輯是,把模型扔進(jìn)一個(gè)沒有任何參考框架的新世界,看它能不能靠自己理解規(guī)則、制定策略、達(dá)成目標(biāo)。這才是“通用智能”的真正含義。不是知識(shí)面有多廣,而是面對(duì)未知時(shí)的適應(yīng)速度有多快。
30.2% 意味著 Opus 5 在三分之一的情況下能獨(dú)立完成人類能完成的任務(wù),而這些任務(wù)是它絕對(duì)沒有在訓(xùn)練數(shù)據(jù)里遇到過同類題型的。AI 從“超強(qiáng)模式匹配器”向“自主推理系統(tǒng)”的轉(zhuǎn)變,正在被量化驗(yàn)證,而不是停留在口號(hào)層面。
但更值得追問的是,為什么 Anthropic 要發(fā)布一款在核心指標(biāo)上碾壓自家“旗艦”的模型,還只賣一半的價(jià)格?
這需要看一圈 Opus 5 周圍的定價(jià)坐標(biāo)。
![]()
再回頭看看 Fable 5 的 $10/$50。這個(gè)定價(jià)在 2026 年 7 月的市場(chǎng)上像一座孤島,周圍的海平面每天都在上漲。Fable 5 在 6 月 9 日發(fā)布時(shí),它的“神話級(jí)”(Mythos-class)性能確實(shí)值這個(gè)溢價(jià)。但僅僅 45 天后,Opus 5 就用不到一半的價(jià)格,在用戶最關(guān)心的場(chǎng)景里拿出了更好的成績(jī)。
Anthropic 面臨的困境是,F(xiàn)able 5 的定價(jià)正在被市場(chǎng)拋棄,而競(jìng)爭(zhēng)對(duì)手,尤其是 Kimi K3 的開源攻勢(shì),正在從下方蠶食。繼續(xù)守著 Fable 5 的高價(jià)策略,等于把高頻使用場(chǎng)景(編程、搜索、辦公自動(dòng)化)的客戶拱手讓人。Anthropic 的選擇是,與其等競(jìng)爭(zhēng)對(duì)手來(lái)拆,不如自己先拆。用 Opus 5 把旗艦級(jí)能力注入中端產(chǎn)品線,在性價(jià)比戰(zhàn)場(chǎng)正面迎戰(zhàn),同時(shí)讓 Fable 5 繼續(xù)守住“極致推理”的利基市場(chǎng)。
Opus 5 的商業(yè)使命可以概括為一句話,證明 Anthropic 還能收前沿溢價(jià)。而 Anthropic 給出的回答是,不收了。或者說(shuō),前沿溢價(jià)的門檻被自己抬高了。你得先在 $5/$25 這個(gè)價(jià)格點(diǎn)上拿出比 Fable 5 更強(qiáng)的編程和推理能力,才有資格談“溢價(jià)”。
大模型定價(jià)的邏輯,已經(jīng)不太一樣了
Opus 5 的發(fā)布,本質(zhì)上宣告了大模型行業(yè)“越貴越強(qiáng)”定價(jià)范式的終結(jié)。
過去兩年,行業(yè)默認(rèn)的邏輯是,更強(qiáng)的模型需要更大的參數(shù)、更多的訓(xùn)練算力、更高的推理成本,所以必然更貴。Fable 5 的 $10/$50 定價(jià)就是這條邏輯鏈的終極產(chǎn)物。我比任何人都強(qiáng),所以我可以收最貴的錢。但 Opus 5 用數(shù)據(jù)證明了一件事,更強(qiáng)的推理架構(gòu)和更高效的訓(xùn)練方法,可以讓模型在價(jià)格不變甚至更低的情況下,性能跳升一個(gè)量級(jí)。
Opus 5 的定價(jià)和 Opus 4.8 完全相同($5/$25),但 Frontier-Bench 得分從 21.1% 跳到了 43.3%,ARC-AGI 3 從 1.5% 跳到了 30.2%。同樣的價(jià)格,推理能力提升了一個(gè)量級(jí)。這不是邊際改善,是范式躍遷。
“旗艦”這個(gè)詞本身的含義正在被重新定義。當(dāng)一款 $5/$25 的模型能在你每天實(shí)際使用的場(chǎng)景里跑贏 $10/$50 的模型,“旗艦”就從一個(gè)能力標(biāo)簽變成了一個(gè)價(jià)格標(biāo)簽,而價(jià)格標(biāo)簽是最容易被競(jìng)爭(zhēng)對(duì)手撕掉的。
這給整個(gè)行業(yè)傳遞了一個(gè)清晰的信號(hào):如果你今天的旗艦?zāi)P筒荒茉谛噬铣掷m(xù)拉開代差,明天就會(huì)有一個(gè)價(jià)格只有你一半的模型在功能上超越你。Anthropic 今天自己動(dòng)手拆掉了自己的價(jià)格金字塔,意味著它已經(jīng)預(yù)判到了這個(gè)趨勢(shì)不可逆轉(zhuǎn),選擇主動(dòng)引領(lǐng)而不是被動(dòng)防守。
對(duì)于企業(yè)用戶來(lái)說(shuō),Opus 5 是 2026 年迄今為止最值得認(rèn)真評(píng)估的 AI 投入。在編程輔助(尤其是 Claude Code 和 Cursor 等 IDE 場(chǎng)景)、自動(dòng)化辦公(Zapier 等平臺(tái))、數(shù)據(jù)分析、科學(xué)研究等高頻使用場(chǎng)景中,$5/$25 的定價(jià)結(jié)合超越 Fable 5 的性能,構(gòu)成了當(dāng)前市場(chǎng)上最清晰的性價(jià)比錨點(diǎn)。
但真正的變量在 7 月 27 日,Kimi K3 開源全部權(quán)重。當(dāng)一個(gè) 2.8T 參數(shù)的模型可以免費(fèi)部署、自由修改,且性能已經(jīng)逼近前沿,整個(gè)行業(yè)的定價(jià)地板將再次被擊穿。Opus 5 證明了“可以更便宜地做得更好”,而 Kimi K3 即將證明“可以幾乎免費(fèi)地做得差不多”。兩條線同時(shí)推進(jìn),留給任何一家 AI 公司維持高溢價(jià)的窗口期,正在以天為單位收窄。
當(dāng)一家公司開始用中端型號(hào)的價(jià)格賣旗艦級(jí)別的性能,這表明與其等對(duì)手來(lái)拆你的定價(jià),不如自己先把牌桌掀了。
(本文首發(fā)鈦媒體APP,作者 | AGI-Signal,編輯 | 秦聰慧)
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.