![]()
在控制成本這方面,OpenAI如今正準備走DeepSeek走過的老路。
外媒報道稱,OpenAI找到了一種新的系統(tǒng)優(yōu)化方案,能把模型推理成本砍掉一半以上。
原文中是這樣描述的,說過去幾萬張GPU才能滿足的需求,現(xiàn)在幾百張就足夠了。
其實AI公司現(xiàn)在最頭疼的,不是模型能不能再聰明一點,而是聰明一次到底要花多少錢。
過去,行業(yè)的主線一直是把模型的性能做強、把上下文的窗口拉大。可結(jié)果呢?能力是上去了,然而賬單也上去了。
尤其是OpenAI這種月活8億的公司,推理成本是他們商業(yè)運作的根基。
當所有人都在把AI編程、Agent當作核心敘事的時候,OpenAI準備去講一個新故事。
01
OpenAI從很久之前就在想辦法降低推理成本
OpenAI雖然到現(xiàn)在也沒公開這個方案的具體技術(shù)細節(jié),但外媒援引知情人士的說法,稱推理優(yōu)化方向,主要來自于KV cache上的優(yōu)化。
啥是KV cache?
一句話概括,KV cache就是模型讀完前文后留下的“筆記”。
大模型生成一句話,不是一次性寫完的,而是一個token一個token地往外蹦。每蹦一個新token,它都要回頭看前面已經(jīng)出現(xiàn)過的內(nèi)容,判斷下一個該說什么。
如果沒有KV cache,模型每生成一個新token,都要把前面整段話重新讀一遍、重新算一遍。比如你問了1萬字材料,它生成第1個字要讀一遍,生成第2個字還要再讀一遍,生成到第10000個字還要再讀一遍的話,那成本就炸了。
海外科技博主安德魯·庫蘭(Andrew Curran)表示,OpenAI在架構(gòu)上出現(xiàn)了一個重大突破,尤其是在內(nèi)存效率方面。最關(guān)鍵的是,開發(fā)了這個新架構(gòu)的團隊,是一個從OpenAI剝離出去的團隊,并且這個新團隊大概很快就會公布結(jié)果。
其實OpenAI盯上KV cache已經(jīng)不是一兩天的事情了。
早在2024年10月的一次開發(fā)者文檔更新中,OpenAI就加入了Prompt Caching(提示詞緩存)機制。
![]()
Prompt Caching本質(zhì)上就是對KV cache的復(fù)用,模型第一次讀完一段前綴后,會生成對應(yīng)的中間結(jié)果;如果后續(xù)請求用了相同前綴,系統(tǒng)就可以直接復(fù)用這部分KV cache,而不是重新計算整段prompt。
前綴是指開頭那段重復(fù)出現(xiàn)的內(nèi)容。比如“你是一個嚴謹?shù)姆芍郑憧梢哉{(diào)用搜索、數(shù)據(jù)庫、計算器,以下是合同全文……請找出風(fēng)險條款”
它的底層邏輯很簡單,很多請求并不是完全從零開始的。
尤其像是系統(tǒng)提示、代碼庫上下文、長對話歷史,往往會反復(fù)出現(xiàn)。如果每次都把這些前綴重新跑一遍prefill,等于在浪費算力。
官方文檔表示,通過Prompt Caching,最高可以把延遲降低80%,把輸入token成本降低90%。
其實2024年5月的時候,DeepSeek就提出過類似的想法,以壓縮KV cache。在DeepSeek-v2的技術(shù)報告中,DeepSeek團隊提出了一個新的機制,叫做Multi-head Latent Attention(MLA)。
MLA的核心目的就是壓縮KV cache。報告里表示,MLA把KV cache壓進latent vector,從而保證高效推理。相較于 DeepSeek 67B,DeepSeek-V2的KV cache減少了93.3%,最大生成吞吐提升到5.76倍。
DeepSeek在V4發(fā)布后很快調(diào)整緩存命中價格,其實也是因為發(fā)現(xiàn)KV cache可以復(fù)用。
目前GPT并未有類似的折扣的機制,所以這次OpenAI推理優(yōu)化,很有可能是想走DeepSeek走過的路。
02
KV Cache是怎么扼住HBM喉嚨的
KV cache和顯存是強相關(guān)的,因為KV cache就放在顯存里。
KV cache跟圖片、視頻這類可以慢慢加載的冷數(shù)據(jù)不同,它是模型生成每一個新token時都要頻繁讀取的熱數(shù)據(jù)。如果把KV cache放在CPU內(nèi)存、SSD或者普通存儲里,它也可以讀取,但是讀取的時間就會比較久。
模型每生成一個token,GPU都要去KV cache里查歷史信息,所以為了減少延遲、提高吞吐,KV cache必須放在離GPU計算單元最近,帶寬最高,延遲最低的地方,也就是HBM里。
進一步來說,HBM越大,首先意味著GPU能同時裝下更多東西。比如更大的模型權(quán)重、更長上下文的KV cache、更多并發(fā)用戶的緩存。
![]()
所以HBM越大,模型服務(wù)的能力上限也就會越強,尤其是長上下文和高并發(fā)推理能力。
也正是因為推理對HBM的需求大到這個地步,所以行業(yè)才會去拼命地迭代HBM4,英特爾另起爐灶搞ZAM。
HBM4是正統(tǒng)路線,繼續(xù)堆帶寬。
JEDEC在2025年4月發(fā)了標準,核心變化是內(nèi)存接口從1024位翻到2048位,單堆棧帶寬從HBM3E的1.18TB/s直接拉到2.8TB/s,容量從24GB提到48GB。SK 海力士和三星在今年2月同時量產(chǎn),全年產(chǎn)能被英偉達最新的Rubin架構(gòu)提前訂光。
但問題就是,從H100上的HBM3(819 GB/s)到Rubin上的HBM4(2.8 TB/s),帶寬翻了3倍多,然而在AI面前,仍然是無底洞。
ZAM是英特爾和軟銀旗下SAIMEMORY聯(lián)合發(fā)布的新型顯存,全稱Z-Angle Memory。
它跟HBM的區(qū)別在工藝,HBM靠微凸塊和硅通孔把DRAM一層一層疊起來,ZAM用銅對銅混合鍵合直接把9層(8層存儲加1層控制)熔在一起。
結(jié)果是堆疊更矮、散熱更好、功耗更低、成本更便宜。帶寬約2.5TB/s,接近HBM4。不過短期內(nèi)還是取代不了HBM的。只是說當前HBM的產(chǎn)能被SK 海力士和三星兩家吃死,價格和交期都不受下游控制,ZAM的出現(xiàn),是給行業(yè)多一條活路。
理解完這些技術(shù)路線,再來看HBM的邏輯,就很有意思了。
當KV cache壓縮、分頁、量化這些技術(shù)足夠成熟,單個請求需要的HBM容量肯定會下降。尤其對推理集群來說,HBM容量和帶寬的利用效率會系統(tǒng)性提升。
但是你反過來去想,一旦推理的成本降下來了,模型廠商馬上會把省出來的顯存拿去做更長上下文、更高并發(fā)、更復(fù)雜agent。
以前8K上下文貴,那就少給;現(xiàn)在KV cache優(yōu)化了,就推128K、1M上下文。以前agent跑10步嫌貴,現(xiàn)在就讓它跑50步、100步。以前一個用戶占一份緩存,現(xiàn)在要同時服務(wù)更多用戶。
單個請求占用的HBM可能下降,但總的HBM需求未必下降。
還有一個點,HBM不只是裝KV cache,它還要裝模型權(quán)重、激活值、中間計算結(jié)果,也決定數(shù)據(jù)喂給GPU計算單元的速度。
就算KV cache被優(yōu)化了,HBM容量和帶寬仍然是核心瓶頸。
03
OpenAI想上市就必須降低推理成本
6月24日,OpenAI和博通聯(lián)合發(fā)布了Jalape?o。這是OpenAI參與設(shè)計的首款A(yù)I芯片。
這玩意從第一行電路設(shè)計開始,就是為LLM推理而生的,甚至于它都沒辦法跑通用任務(wù)。
從2025年10月公開宣布合作到2026年6月亮相,Jalape?o只用了9個月。可是在半導(dǎo)體行業(yè)里,一顆新處理器的開發(fā)周期通常以年為單位,這個速度有點“太快了”。
OpenAI的官方說法是,能這么快是因為軟件和硬件深度協(xié)同開發(fā),而且OpenAI用自己的模型,加速了芯片設(shè)計中的部分優(yōu)化流程。用AI設(shè)計AI的芯片,然后AI芯片再去跑AI模型。
![]()
Jalape?o瞄準的方向就是推理。據(jù)外媒報道,Jalape?o能把LLM服務(wù)成本砍掉約50%。如果疊加上這次KV cache方面的優(yōu)化,那OpenAI的推理成本,恐怕會降低一個數(shù)量級。
更關(guān)鍵的是,Jalape?o還不是OpenAI在推理芯片這方面下的唯一籌碼。
2026年1月14日,OpenAI和Cerebras簽下了一份超過100億美元的協(xié)議。協(xié)議中提到,后者給前者提供,750MW的推理算力,持續(xù)到2028或2029年。未來可能還將擴展到2GW。
5月,Cerebras在納斯達克IPO,估值一度沖到230億美元以上。
英偉達和AMD做GPU,底層邏輯是把很多小芯片用高速網(wǎng)絡(luò)連起來組成集群。這是因為生產(chǎn)這些芯片的光刻機,它的單次最大曝光面積約858mm2(光罩固定尺寸)。而H100裸片已經(jīng)達到了814mm2,如果強行做更大單片,需要多次拼接曝光,光刻缺陷、對位誤差暴增,流片工藝基本不可行。
然而Cerebras不一樣,它是直接造一顆跟整片硅晶圓一樣大的芯片。WSE-3,4萬億個晶體管,90萬個計算核心,44GB片上SRAM。一塊芯片的內(nèi)存帶寬是英偉達B200的2625倍。
這么做的好處在于降低通信成本。在傳統(tǒng)的GPU集群里,數(shù)據(jù)傳輸要在芯片之間、節(jié)點之間跳來跳去,通信成本非常大。
Cerebras把所有東西放在一塊晶圓上,省掉了絕大部分通信延遲。結(jié)果就是推理速度可以比GPU方案快15倍。GPT-5.3-Codex-Spark在Cerebras上跑到了超過1000 tokens/秒。
目前,Cerebras CEO確認,GPT-5.4已經(jīng)可以在Cerebras硬件上跑起來了,在未來,GPT-5.5也會運行在Cerebras的硬件上面。
而且不只是OpenAI,AWS在6月宣布和Cerebras合作搞“推理分解”(inference disaggregation),把推理拆成prefill和decode兩個階段。prefill是計算密集的,用AWS的Trainium;decode是內(nèi)存帶寬密集的,用Cerebras的CS-3。
如今的OpenAI就是在兩條腿走路,從硬件方面先壓推理成本,然后再從軟件方面壓。奧特曼口口聲聲說不著急上市,并且外媒也表示,受SpaceX上市后股價不穩(wěn)的影響,OpenAI傾向于推遲到2027年再上市。
OpenAI在6月中旬泄露的財務(wù)數(shù)據(jù)顯示,OpenAI2025年全年收入為130.7億美元,總成本和費用卻高達340億,運營虧損209億。光付給微軟的云計算賬單就超過172億。
2026年預(yù)計燒在推理和訓(xùn)練方面燒掉141億。唯一的好消息是毛利率提高了,2026年Q1,OpenAI的API業(yè)務(wù)毛利率達到了39%,目標是年底沖到52%。
不過這只是皮毛而已,大家心里都清楚,再不控制成本,OpenAI可能就再也控制不住成本了。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.