![]()
![]()
觀點:劉潤 主筆:景九 版面:黃靜
來源:劉潤(ID:runliu-pub)
讀者說最近DeepSeek宣布自研芯片,問我怎么看。
首先,DeepSeek大概率不是要蓋晶圓廠,自己造芯片。
它做的,應該更多是芯片設計。因為從目前的報道看,DeepSeek做的,是招聘芯片設計工程師,接觸代工、存儲等企業。
而且它的目的,可能也和很多人討論的“把模型做得更強”,不太一樣。
因為DeepSeek著手研發的,是推理芯片,不是訓練芯片。
都是芯片,為什么要分推理和訓練?如果推理芯片沒辦法讓模型更聰明,那采購就好了,為什么要花大力氣自己做呢?
這可能因為,大模型的競爭,可能正從“模型能力”走向“使用效率”。而這個變化,也可能會給我們,帶來巨大的新機會。
為什么這么說呢?
我們首先從今天的主角,推理芯片,開始講起。
01
如果說訓練是上學,推理就是出來工作。
先了解兩個不分家的基礎概念:訓練、推理。
如果把大模型看做一個小伙子,那訓練就好比他寒窗苦讀10年,學會了一堆知識。推理,就好比他出來工作,用學會的知識解決問題。
訓練,是把模型教會。推理,是讓模型干活。
DeepSeek之所以這么聰明,是因為在見你之前,工程師們已經用海量的數據,幾個月不停的測試調優,陪它“上過學”了。
這個過程中用到的芯片,就是訓練芯片。
可光上學也不行,你得上班才能養家糊口。于是,當用戶打開對話框,提出問題之后,它就要一個字一個字往外吐答案。
這個過程中,提供實時算力支持的,就是推理芯片。
![]()
(圖片為AI生成)
原來如此。可是,芯片為什么要分訓練和推理?
很多大模型,本來就是用同一批GPU訓練出來,再繼續放在GPU上回答問題。今天很多訓練芯片,本來就在跑推理。直接全干了,不是更方便?
問題不是能不能,而是劃不劃算。
訓練和推理芯片,應用的重點其實完全不同。
你做訓練的時候,不光要模型給答案,還要能回頭,一層層傳回錯誤,修改參數。所以對訓練芯片來說,如何保存大量中間結果,讓幾千張、幾萬張芯片高速協同,更重要。
可要是做推理呢?模型已經訓練好了,它不需要回答一個問題,就學習一遍。你更關心,怎么同時服務更多人,怎么少用一點電。所以,推理芯片需要更快響應,更低成本,卻不需要那么高精度。
一顆芯片的面積就那么大,晶體管也就那么多。你把資源拿去支持訓練,就不可能把推理效率也做到極致。
就像一輛重型越野車,起步慢,馬力大。你說它能不能送外賣?當然可以。但它為了翻山越嶺準備的四驅用不上,油耗和成本也高得嚇人。
![]()
(圖片為AI生成)
所以,所謂的推理芯片,就是專門為“干活”優化的芯片。它追求的,是模型回答得更快、服務更多人,成本更低。
如果你也關注芯片行業,你大概會知道,最近一段時間,關于推理芯片的新聞,其實并不少。
比如,Google在今年4月發布的TPU芯片V8,就專門分成了兩個版本。分別用于推理和訓練。前段時間,黃仁勛更是花了約200億美元,和一家專門做推理的公司Groq,達成深度合作。
有意思。可問題是,推理從來都不是今天才有。ChatGPT、DeepSeek上線第一天,就已經在不停回答用戶的問題。
為什么到了今天,似乎有越來越多的人,開始關注推理芯片?
02
大模型的競爭,正在從能力到效率。
因為過去最重要的任務,是先把模型訓練出來。現在更緊迫的問題,可能是怎么讓更多人把模型用起來。
過去幾年,大模型行業缺什么?缺足夠好用的模型。
模型能不能聽懂人話?能不能寫代碼?能不能把幾百頁資料讀完,再給出分析?這些問題沒有解決,速度再快、成本再低,也沒意義。所以,大家自然會把主要資源,放在訓練上。
但今天,情況似乎已經變化。
DeepSeek、千問,當然還算不上完美。但在寫郵件、分析表格、修改代碼這些日常任務里,已經跨過了能干活的關鍵門檻。
你問DeepSeek一個問題,它要推理一次,或者幾次。程序員讓它修改一段代碼,它要推理很多次。公司把它接進客服系統,每天可能要完成幾十萬次、幾百萬次推理。
推理需求一旦變多,成本就開始嚴峻。
用戶少的時候,拿訓練芯片跑推理,哪怕每次多浪費點電,也沒多大關系。可如果每天有幾千萬人使用,1次推理多花1分錢,也會變成筆巨大的成本。
所以,推理芯片突然變得重要,并不是因為訓練不重要了。
恰恰是因為模型訓練得越來越好了,開始有越來越多的人愿意使用它。所以,過去可以忍受的浪費,才會變貴。
![]()
(圖片為AI生成)
大模型的競爭,也就從“誰的模型更聰明”,逐漸走向了另一個問題:誰能讓這種聰明,被更多人更快、更便宜、更穩定地使用。
能力決定模型能不能上場,效率決定模型能不能普及。
嗯,明白了。
但是,市場上已經有那么多公司在做推理芯片,DeepSeek為什么不直接采購,非要花大力氣,自己研發?
03
DeepSeek不是不采購,但不能只靠采購。
因為推理芯片,或許正在變成DeepSeek的核心生產工具。
核心生產工具當然可以買,但不能永遠只靠買。
為什么?我們算三筆賬。
第一筆,是成本賬。
自研芯片,是件投入非常大的事情。組建團隊、設計、驗證、流片,再到量產,每步都要花錢,第一次設計,也未必能成功。
所以,對大多數公司,采購現成芯片才更合理。
如果你的推理量不大,每天只有幾萬次調用,就算自研芯片能讓每次推理便宜一點,也很難把前期巨大的研發投入省回來。
但對DeepSeek來說,這個問題就完全不一樣了。
根據數據,DeepSeek的月活已經過億。它的Token調用量,已經月超17萬億。每天的推理請求,可能要數十億,甚至更高。
所以,當它自己研發芯片,它就可以把有限的芯片面積和電力,集中到最常進行的計算上。即便一次推理只省一分錢,但發生百億次,也是幾個億的區別了。
小規模時,自研芯片是負擔。大規模時,自研芯片是投資。
但省錢,還只是算今天的賬。而模型,卻會一直進化。
這就要算第二筆賬:進化賬。
推理芯片廠商,面對的是整個市場。它的芯片,要服務很多模型、很多客戶,不可能只圍繞DeepSeek下一代模型的發展方向設計。
但是,模型結構的變化,會不斷對芯片提出新的要求。
舉個例子。DeepSeek-V3,用了MoE,也就是混合專家架構。所有參數有6000多億,但處理一個詞,只會激活其中大約370億。可是,哪些數據需要被頻繁讀取?計算單元和存儲之間,怎樣配合才能減少等待?
這些問題,在芯片上都有優化空間。
DeepSeek曾發表過相關研究:當模型繼續擴大,存儲容量、計算效率和芯片互聯正在成為瓶頸。所以,以后需要更多硬件協同設計。
采購,是讓模型適應芯片。自研,是讓模型和芯片一起進化。
明白。可即便如此,DeepSeek也可以和芯片廠商長期合作,讓廠商跟著模型迭代,為什么還要親自下場?
這就是第三筆賬:安全賬。
只要芯片來自外部,那什么時候推新,什么時候交貨,能提供多少產量,最終都不完全由DeepSeek決定。
推理需求不大的時候,交貨晚一點,擴容就晚一點,都不算什么大問題。但當幾千萬人每天都在使用DeepSeek,就不一樣了。芯片不夠,用戶就要等待。交付推遲,新模型的適配也會推遲。
前段時間,就有不少用戶反映:融資趕緊到位吧,DeepSeek開始限制重生、修改次數了。還有網友做過統計,2026年,DeepSeek發生了至少18次服務異常,一個可能的原因,就是用戶太多,但算力沒跟上。
![]()
采購,只能解決戰術問題。自研,才是戰略級的安全閥。
這就是三筆賬。
成本賬,讓它有理由做。進化賬,讓它有必要自己做。安全賬,讓它不能只靠別人做。
那這,又會給整個芯片行業,帶來什么變化?
04
推理,把一場大戰拆成了無數小戰場。
推理時代,可能給我們打開了一扇機會之窗。
為什么這么說?
因為今天的AI競爭,正在被推理這事,拆成無數小戰場。在每個小戰場,只要你吃透場景,就都有機會站住腳。
過去十年,芯片的主戰場,是訓練。
全世界,真正有能力訓練大模型的公司,你掰著手指頭就能數出來。它們要解決的問題,也很接近:怎么把幾萬張芯片連接起來,在盡可能短的時間里,把大模型訓練出來。
而英偉達,已經把卷子答的非常完整了。
它不只有GPU,還有CUDA軟件生態、芯片之間的高速互聯,工程師已經使用多年的開發工具。你要換芯片,代碼和工程經驗,都要重新適配。
可如果說訓練只有一張考卷,那推理就有無數道應用題。
你打開DeepSeek問問題,是推理。醫院用模型整理病例,也是推理。以后,手機幫你實時翻譯,電腦幫你總結文件,同樣是推理。
而它們的需求,各自不同。
同樣是推理,云端需要高并發,醫院需要隱私,機場需要長時間穩定運行,便攜設備還要控制體積、功耗和噪音。需求,完全不同。
場景越統一,通用芯片的優勢越大。場景越分散,越需要有人進去,理解客戶需要什么,再圍繞需求設計產品。
前段時間,我就聽江源科技的高管,分享了一個具體案例。
政府人員外出工作,需要用AI整理談話資料。但數據不能上傳,裝著資料的機器,甚至不能離開人的視線。怎么辦?那就把模型和推理芯片,裝進一臺手提設備里。你甚至,可以拎著它上飛機。
太妙了。
過去提到大模型算力,我們想到的都是一排排服務器,是巨大的數據中心里。但現在,一整套推理算力,已經可以被一個人拎著上飛機。
你說,這臺設備需要的,是不是算力最高的芯片?當然不是。它在意的,是能不能全國產,是不是足夠安全,能不能放進一個小箱子。
這就是機會所在。
過去,是芯片先定義能力,應用再想辦法適配。但推理時代,越來越多的芯片,會從具體問題出發,沿場景反向生長。
![]()
(圖片為AI生成)
這對國產芯片,尤其重要。
因為最懂中國醫院、工廠和消費者需求的公司,就在國內。模型公司、應用公司和芯片公司之間,可以離得更近,反饋也可以更快。
推理帶給國產芯片的,不只是一條繞開英偉達的捷徑。它把一場決出總冠軍才算贏的比賽,拆成了無數場規則不同的比賽。
最后的話
AI的上半場,比的是誰能把模型練出來。這個賽道上,玩家掰著手指頭就數完了。我們一直在追趕,跌跌撞撞,非常辛苦。
但AI的下半場,比的可能是誰能把模型用好。這個賽道上,中國有一堆天然優勢:最多的用戶、最豐富的場景、最快的迭代速度……
所以,接下來的競爭,不只是誰能把模型做得更強。還要看誰能讓模型更穩定,進入一個個具體場景。
醫院需要隱私,機場需要穩定,手機需要低功耗,企業需要本地部署。國產芯片,未必能在所有指標上超過英偉達,但只要真正吃透一個場景,就可能先在這個場景里,成為更合適的選擇。
當然,這并不是什么捷徑。
芯片設計、軟件生態、模型適配,任何一關都不好過。但它至少意味著,國產芯片不必繼續在英偉達定義的賽道上,追趕同一個終點。
而這次DeepSeek自研芯片,可能就是一個明確的信號。
版權聲明:部分文章推送時未能與原作者取得聯系。若涉及版權問題,敬請原作者聯系我們。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.