出品 | 網(wǎng)易智能
作者 | 小小
編輯 | 王鳳枝
DeepSeek又一次引發(fā)海外開發(fā)者熱議,連馬斯克都在X上關(guān)注了它。
![]()
7月31日,DeepSeek正式開放V4 Flash API公測。官方公布的測試結(jié)果顯示,新版本在多個智能體基準(zhǔn)測試中大幅超過此前的V4-Pro Preview。
![]()
真正讓開發(fā)者興奮的,并不只是一次科技圈圍觀,而是DeepSeek V4 Flash走出的路線:
在保持2840億總參數(shù)規(guī)模、單Token激活130億參數(shù)和100萬Token上下文窗口的基礎(chǔ)上,通過后訓(xùn)練優(yōu)化提升智能體與代碼能力。
更關(guān)鍵的是,它把這種能力壓到了一個極低的價(jià)格區(qū)間。
V4 Flash每百萬未命中緩存輸入Token僅1塊錢,輸出Token 2塊錢;緩存命中輸入成本更低至2分錢。 海外開發(fā)者實(shí)測中,單次任務(wù)調(diào)用成本甚至低至0.0005美元,與部分競品拉開了數(shù)量級差距。
這也是DeepSeek V4 Flash真正引發(fā)關(guān)注的原因:
它不只是又一個"便宜能用"的模型,而是在嘗試證明,接近前沿水平的智能體能力,也可以用遠(yuǎn)低于傳統(tǒng)旗艦?zāi)P偷某杀具\(yùn)行。
官方同時(shí)明確表示,本次更新僅升級DeepSeek-V4-Flash API,V4 Pro API與客戶端維持不變,V4 Pro正式版即將發(fā)布。
![]()
當(dāng)OpenAI、Anthropic等頭部實(shí)驗(yàn)室仍在圍繞更強(qiáng)模型和更高算力投入競爭時(shí),DeepSeek正在重新提出另一個問題:
前沿智能,究竟應(yīng)該賣多少錢?
01馬斯克關(guān)注之后,海外社區(qū)為何熱議
"馬斯克需要親自試試V4 Flash。它就像魔法一樣。"
這句話最初來自X上的開發(fā)者討論。
隨著這句話傳播,網(wǎng)友發(fā)現(xiàn),埃隆·馬斯克真的關(guān)注了DeepSeek官方賬號。這一細(xì)節(jié)迅速在海外社區(qū)引發(fā)討論。
有網(wǎng)友認(rèn)為,馬斯克與DeepSeek在推動AI技術(shù)發(fā)展、探索科學(xué)突破方面存在一些共同點(diǎn);也有人開始猜測未來可能出現(xiàn)合作。
當(dāng)然,更多開發(fā)者選擇用玩笑回應(yīng)。有人調(diào)侃下一代編程模型Composer 3.5可能會基于DeepSeek構(gòu)建;還有網(wǎng)友直接調(diào)侃Grok:
"我猜他要買下DeepSeek。你說呢Grok,你的爹要給你買個小弟弟嗎?"
這些玩笑背后,是海外開發(fā)者對V4 Flash的真實(shí)興趣:他們關(guān)注的不是一次社交媒體熱搜,而是這個模型是否正在改變AI開發(fā)的成本結(jié)構(gòu)。
02基準(zhǔn)壓測:官方數(shù)據(jù)與第三方驗(yàn)證怎么說
評估一次后訓(xùn)練的成效,最直接的辦法就是看標(biāo)準(zhǔn)化測試集上的量化表現(xiàn)。
官方公布的基準(zhǔn)測試中,V4 Flash在模擬真實(shí)命令行環(huán)境操作的Terminal Bench 2.1(82.7分)、網(wǎng)絡(luò)安全攻防Cybergym(76.7分)以及復(fù)雜API協(xié)同Toolathlon Verified(70.3分)等智能體場景中均表現(xiàn)上佳。
而在代碼工程化與復(fù)雜軟件重構(gòu)領(lǐng)域(如NL2Repo與DeepSWE),它同樣取得了較好成績,甚至在其內(nèi)部的全棧難題測試集(DSBench-Hard)中拿下59.6分。
![]()
官方解釋稱,這套代碼智能體表現(xiàn)是在最大努力級別與特定采樣參數(shù)下跑出的。這種"小體積、高智商"的突破,直接打破了傳統(tǒng)大模型"參數(shù)越龐大、智能體表現(xiàn)才越強(qiáng)"的固有認(rèn)知。
第三方權(quán)威測評機(jī)構(gòu)的交叉驗(yàn)證,進(jìn)一步補(bǔ)充了該模型的表現(xiàn)細(xì)節(jié)。
測評機(jī)構(gòu)Artificial Analysis在Intelligence Index智能指數(shù)測試中給予V4 Flash 50分的成績,這一分?jǐn)?shù)比上代模型提升10分,領(lǐng)先V4 Pro預(yù)覽版6分,甚至追平了Gemini 3.6 Flash,并與GPT-5.6 Luna、GLM-5.2等模型接近。
![]()
在運(yùn)行效率與輸出質(zhì)量方面,Artificial Analysis的測試表明,V4 Flash跑完整個智能指數(shù)消耗了2.06億個輸出Token,相比前代的2.34億個下降12%。
同時(shí),該模型在AA-Omniscience事實(shí)準(zhǔn)確率與抗幻覺評估中的表現(xiàn)提升了12個百分點(diǎn),展現(xiàn)出更好的上下文理解能力。
![]()
在評估真實(shí)世界智能體任務(wù)的GDPval-AA v2中,V4 Flash拿下1559的Elo評級,在開源權(quán)重模型中僅次于Kimi K3,超越了GLM-5.2。
而在Arena.ai前端代碼競技場中,DeepSeek-V4-Flash-High拿下1586分,位列競技場第七名、開源模型第三名,較前代提升154分。
結(jié)合其首token延遲(TTFT)與吞吐量(TPS)表現(xiàn),憑借98% 的緩存折扣,V4 Flash單任務(wù)執(zhí)行成本比打折后的GPT-5.6 Luna還低60%。
Arena.ai評價(jià)指出,V4 Flash在前端代碼與智能體領(lǐng)域重新塑造了"價(jià)格—質(zhì)量"層面的帕累托前沿。
![]()
03開發(fā)者工程實(shí)測:150倍價(jià)差下的極致性價(jià)比
隨著公測展開,開發(fā)者社區(qū)涌現(xiàn)出大量實(shí)操壓測,V4 Flash在真實(shí)Terminal智能體、Canvas前端渲染以及跨模型工作流中的表現(xiàn)被多角度呈現(xiàn)。
在最直觀的極限性價(jià)比層面,科技分析師 @RoundtableSpace在對比發(fā)布時(shí)間僅相隔七天的Opus 5時(shí)觀察到,盡管Opus 5能一次完成復(fù)雜任務(wù),而DeepSeek需要經(jīng)過三次迭代嘗試,但Opus輸出了長達(dá)3000行代碼,DeepSeek用約900行精簡代碼就達(dá)到了目的,且單次嘗試成本僅約1美分。
![]()
科技博主 @SciTechera也援引數(shù)據(jù)進(jìn)一步驗(yàn)證,在Terminal-Bench 2.1上,V4 Flash完成單個基準(zhǔn)任務(wù)的估計(jì)花費(fèi)僅為0.03美元, 相比高價(jià)旗艦?zāi)P驼宫F(xiàn)出了極強(qiáng)的成本壓制。
而當(dāng)脫離極端高價(jià)模型、轉(zhuǎn)而對比同預(yù)算檔位的競品時(shí),V4 Flash依然保持了品質(zhì)上的小幅領(lǐng)先。
在前瞻性的前端與動態(tài)交互測試中,開發(fā)者 @stevibe將降價(jià)后的OpenAI GPT-5.6 Luna與V4 Flash放在一起對比。
在3D魔方旋轉(zhuǎn)測試中,DeepSeek的貼紙與旋轉(zhuǎn)表現(xiàn)流暢,而Luna出現(xiàn)了貼紙位置錯位的問題;在煙花爆破綻放效果中,Luna出現(xiàn)較明顯的卡頓;而在筆寫"Hello"草書的動態(tài)渲染上,Luna直接渲染為靜態(tài)圖像,DeepSeek則完成了動態(tài)草書軌跡。
@stevibe認(rèn)為,在相同的預(yù)算檔位下,DeepSeek的綜合渲染表現(xiàn)略勝一籌。
![]()
除了直接對抗,面對V4 Flash暫未原生接入視覺輸入的短板,開發(fā)者們探索出了具有實(shí)操價(jià)值的"跨模型組合"工作流。
前端開發(fā)者 @hqmank在重建3D地球儀表板測試中,先讓Kimi K3讀取參考圖像并提取布局與顏色規(guī)范,再將結(jié)構(gòu)化文本轉(zhuǎn)交給V4 Flash進(jìn)行代碼生成。實(shí)測結(jié)果顯示,布局與間距被較好還原,而整體輸出成本遠(yuǎn)低于完全調(diào)用頂級多模態(tài)模型。
![]()
這種靈活的生態(tài)配合,最終落腳于工業(yè)級智能體開發(fā)的成本賬單上。
Bold Metrics CTO摩根·林頓(Morgan Linton)在VulcanBench測試后指出,V4 Flash在中等努力水平(Medium Effort)下的表現(xiàn)極其穩(wěn)定,成功擊敗了Grok 4.5、Fable 和ChatGPT。
對于需要成千上萬次API 調(diào)用的工業(yè)級智能體工作流而言,這種極低的價(jià)格讓大批量自動化試錯第一次具備了財(cái)務(wù)可行性。
![]()
大模型測評團(tuán)隊(duì) @CommandCodeAI 在相同的游戲設(shè)計(jì)提示詞測試中發(fā)現(xiàn),Kimi K3與GLM 5.2表現(xiàn)出色,單次調(diào)用花費(fèi)分別為0.0740美元和0.0480美元;而DeepSeek V4 Flash 雖在邊緣細(xì)節(jié)上略顯粗糙,但單次調(diào)用的實(shí)際賬單僅為0.0005美元,便宜了整整150倍。
![]()
硬件與模型設(shè)計(jì)師 @bookwormengr 體驗(yàn)后感嘆,V4 Flash 在如此小巧的體積和極低成本下展現(xiàn)出的知識密度簡直如同"巫術(shù)", 雖然UI 和視覺交互體驗(yàn)上仍可向月之暗面借鑒,但其底層智力產(chǎn)出已足夠令人震撼。
![]()
盡管V4 Flash 在性價(jià)比與常態(tài)代碼補(bǔ)全上表現(xiàn)優(yōu)異,但客觀的工程壓測中,它也暴露出了一定的技術(shù)邊界:
首先,在極高難度的推理與算法突破場景中,F(xiàn)lash 模型的表現(xiàn)依然受限于其激活參數(shù)規(guī)模。 軟件開發(fā)者 @OmedVibeCodes 在深度基準(zhǔn)壓測后指出,面對頂級模型(如GPT-5.6 Sol、Kimi K3等)時(shí),V4 Flash 在處理極其復(fù)雜的長邏輯鏈求解上仍有明顯差距。
其次,在特定測試套件的兼容性上,@OmedVibeCodes 觀察到Pi 套件在DeepSeek 上的運(yùn)行表現(xiàn)遜于 OpenCode,顯示出不同基準(zhǔn)下的適配差異。
此外,當(dāng)前 V4 Flash 尚不支持原生的多模態(tài)視覺輸入,處理圖文混排任務(wù)時(shí)仍需借助外部模型進(jìn)行前置解析。
因此,在真實(shí)的生產(chǎn)架構(gòu)中,V4 Flash 更適合承擔(dān)80% 高頻、常態(tài)化任務(wù)的基礎(chǔ)引擎角色,而極端復(fù)雜的難題仍需交由規(guī)模更大的旗艦?zāi)P吞幚怼?/b>
04灰度中的 V4 Pro 提前亮相:"礦泉水摻頂級茅臺"
在 Flash 模型憑性價(jià)比引發(fā)關(guān)注的同時(shí),正在小范圍灰度測試的旗艦?zāi)P?V4 Pro GA 正式版也引發(fā)了討論。
開發(fā)者 @BoxMrChen 僅用4行提示詞,要求模型融合《我的世界》與《無人深空》的核心機(jī)制編寫一款 Web 網(wǎng)頁游戲。V4 Pro 經(jīng)過深度推理,以約0.1美元的 Token 成本生成了包含任務(wù)樹系統(tǒng)、物品合成邏輯與資源采集的可玩游戲。
![]()
開發(fā)者 @mirochill 在復(fù)雜 Bug 修復(fù)測試中表示,針對《魷魚游戲》機(jī)制的代碼構(gòu)建中,V4 Pro 只經(jīng)歷2次自我迭代就修復(fù)了深層邏輯缺陷,連續(xù)輸出3000行代碼,總成本僅0.12美元,表現(xiàn)足以正面抗衡 Fable 5和 GPT-5.6 Sol。
![]()
開發(fā)者 @Waguri_Kaoruko8補(bǔ)充稱,新版 V4的推理思維鏈(CoT)能夠自動梳理出"編寫主要場景代碼……""生成核心邏輯……"等節(jié)點(diǎn),可讀性有所提升。
![]()
然而,V4 Pro 展現(xiàn)出的生成能力,也在社區(qū)內(nèi)引發(fā)了爭議。
科技媒體 @TechFlowPost 報(bào)道稱,有部分開發(fā)者稱在調(diào)用 V4 Pro 生成復(fù)雜大廠級別代碼時(shí),發(fā)現(xiàn)其輸出風(fēng)格與某些高價(jià)旗艦?zāi)P停ɡ?Claude Fable 5)存在相似之處,甚至有用戶稱觸發(fā)了疑似特定高價(jià)模型風(fēng)格的安全拒絕響應(yīng),從而引發(fā)了后臺是否采用了混合路由機(jī)制的猜測。
社區(qū)調(diào)侃該現(xiàn)象為"礦泉水瓶里摻茅臺"。 需要指出的是,上述安全響應(yīng)細(xì)節(jié)目前多為社區(qū)反饋,尚無官方的進(jìn)一步復(fù)現(xiàn)說明。
![]()
面對社區(qū)的種種猜想,技術(shù)專家 @TeksCreate 從架構(gòu)層面給出了分析。
V4 Pro 擁有1.6萬億的總參數(shù)規(guī)模(推理時(shí)單 Token 激活490億),采用 MoE 混合專家架構(gòu)。 其核心改進(jìn)在于引入了混合注意力系統(tǒng),將歷史壓縮(CSA)、超長文本壓縮(HCA)與全保真跟蹤(SWA)結(jié)合,使處理100萬上下文時(shí)的計(jì)算量降至前代的27%,KV 緩存占用也大幅下降。
在性能上,V4 Pro 在 Codeforces 跑出3206分,SWE-bench Verified 達(dá)80.6%,1M 長上下文檢索 MRCR 達(dá)83.5%。 @TeksCreate 認(rèn)為,這些架構(gòu)創(chuàng)新證明 V4 Pro 本身具備獨(dú)立達(dá)到該水平的技術(shù)條件。至于模型在實(shí)際部署中是否使用了混合路由,在官方明確回應(yīng)之前尚無定論。
![]()
05宏觀市場重構(gòu):更多人負(fù)擔(dān)得起的前沿 AI 生產(chǎn)力
從 V4 Flash 的正式公測到 V4 Pro 正式版的灰度亮相,DeepSeek 掀起的定價(jià)風(fēng)暴正在全球開發(fā)者生態(tài)與市場預(yù)期中引發(fā)連鎖反應(yīng)。
對比當(dāng)下主流廠商的定價(jià)策略,V4 Flash 每百萬輸入/輸出 Token 0.14/0.28美元的價(jià)格,不僅讓打折后的 GPT-5.6 Luna(輸入0.20美元/輸出1.20美元)感到巨大壓力,更是對 Anthropic Haiku 4.5(輸入1美元/輸出5美元)形成了輸入端便宜7倍、輸出端便宜18倍的優(yōu)勢。
預(yù)測市場平臺 Polymarket 的分析者 @goodworse 認(rèn)為,V4 Flash 的出現(xiàn)將迫使前沿 AI 服務(wù)的綜合使用成本進(jìn)一步降低。
![]()
0xSupergemma 創(chuàng)始人宋駿(Jun Song)從全球經(jīng)濟(jì)視角分析指出,全球有相當(dāng)龐大的低收入群體與初創(chuàng)團(tuán)隊(duì)無法直接承擔(dān)高昂的模型訂閱費(fèi)。DeepSeek 極低 API 定價(jià)的意義,在于能夠通過下游開發(fā)者轉(zhuǎn)化為極其便宜的 SaaS 工具、應(yīng)用與服務(wù),間接讓更廣泛的終端用戶享受技術(shù)紅利,成為降低 AI 生產(chǎn)力門檻的重要選項(xiàng)之一。
![]()
《財(cái)富》雜志分析指出,DeepSeek V4的研發(fā)與發(fā)布與華為底層芯片生態(tài)進(jìn)行了緊密適配。 隨著華為昇騰系列處理器軟硬件協(xié)同效率的提升,未來模型推理成本還有進(jìn)一步下探的空間。DeepSeek 展現(xiàn)出的成本優(yōu)勢,背后是算法架構(gòu)重構(gòu)與本土硬件生態(tài)適配共同作用的結(jié)果。
結(jié)語
綜合官方測試集數(shù)據(jù)、權(quán)威第三方交叉驗(yàn)證以及一線開發(fā)者的真實(shí)反饋,DeepSeek V4 Flash 展現(xiàn)出的核心價(jià)值,并不在于要在每一個實(shí)驗(yàn)室單項(xiàng)榜單上都拿下第一,而在于它以一種務(wù)實(shí)的方式,重構(gòu)了智能體與代碼開發(fā)中的成本賬單。
在現(xiàn)代智能體軟件工程中,一個看似簡單的自然語言指令,往往需要拆解為意圖理解、環(huán)境感知、文件檢索、工具調(diào)用以及多次代碼生成與自我修正,調(diào)用的乘數(shù)效應(yīng)會瞬間放大 Token 消耗。
V4 Flash 在中等努力水平下的穩(wěn)定性、對 Codex 接口的無縫集成以及高額緩存折扣,為開發(fā)者提供了一個能夠支撐大規(guī)模日常調(diào)用的基礎(chǔ)選項(xiàng)。
當(dāng)越來越多的企業(yè)財(cái)務(wù)官與開發(fā)者開始精細(xì)化計(jì)算 API 賬單時(shí),答案已經(jīng)很明確:前沿智能的價(jià)格,正在被重新定義。
