![]()
作者|梁耀丹
主編|趙妍
來源|星火Ember
7 月 27 日,月之暗面官方正式開源 Kimi K3 模型。當(dāng)天,月之暗面發(fā)布Kimi K3的模型權(quán)重、技術(shù)報告,并開源支撐Kimi K3模型訓(xùn)練的關(guān)鍵Infra技術(shù):MoonEP、FlashKDA和AgentEnv。
Kimi K3模型發(fā)布于7月16日。據(jù)悉,該模型總參數(shù)達到2.8萬億,是目前全球參數(shù)規(guī)模最大的開源模型。
Kimi K3 的問世,被行業(yè)視作全新里程碑。在由加州大學(xué)伯克利分校搭建的國際AI盲測平臺 Arena 上,K3憑借前端代碼榜單1679分的成績位居第一,超越了Anthropic的Claude Fable 5和OpenAI的GPT-5.6 Sol等頂尖閉源模型。這也是中國大模型首次在編程能力測評中斬獲榜首。
資本市場的反應(yīng)幾乎是條件反射式的。Kimi K3發(fā)布的首個交易日,英偉達單日市值蒸發(fā)約1000億美元,費城半導(dǎo)體、納斯達克綜合指數(shù),全部下跌。
IG市場分析師Tony Sycamore估計,來自Kimi K3的沖擊,導(dǎo)致尚未上市的兩大美國AI巨頭OpenAI和Anthropic的預(yù)期估值合計蒸發(fā)了3140億美元。
“DeepSeek時刻重現(xiàn)”——多家外媒的報道中,不約而同地使用了這個措辭。提到這個說法的還有中信建投,“K3的發(fā)布意味著中國大模型第一次以‘競爭威脅’身份進入全球大模型敘事。”中信建投在7月20日的文章中稱。
歷史似乎正在重演,但熱潮褪去后,疑問隨之而來:Kimi K3 高達2.8 萬億參數(shù)背后,真實技術(shù)含金量究竟如何?伴隨產(chǎn)品發(fā)布涌現(xiàn)的各類爭議,又暴露了這家頭部AI創(chuàng)業(yè)公司哪些隱憂?
2.8萬億參數(shù)背后
要理解Kimi K3的2.8萬億參數(shù)規(guī)模意味著什么,需要建立幾個坐標(biāo)系。
Anthropic的Claude模型沒有披露過參數(shù)規(guī)模,外界推測總參數(shù)量級大致在1萬億到5 萬億之間;OpenAI的GPT-4,被業(yè)內(nèi)廣泛推測為約1.8萬億參數(shù);行業(yè)內(nèi)對 Google Gemini Ultra 的總參數(shù)量估算普遍在 1.5 萬億;Meta開源的Llama 3最大版本停留在4050億。在國內(nèi),百度發(fā)布的文心大模型5.0總參數(shù)規(guī)模超2.4萬億;DeepSeek最新發(fā)布的V4-Pro 總參數(shù)量為1.6萬億;智譜GLM-5.2模型參數(shù)規(guī)模為7440億。
月之暗面有關(guān)負(fù)責(zé)人對媒體表示:“參數(shù)越大,能力上限越高,可以提供更智能的模型表現(xiàn)。參數(shù)就像人腦里的神經(jīng)連接,近3萬億參數(shù)意味著這個模型能把更多的知識和規(guī)律裝進‘腦子’,懂得更多、想得更深、答得更準(zhǔn)。”
但參數(shù)不是全部,關(guān)鍵在于有效參數(shù)背后的“經(jīng)濟學(xué)”。
據(jù)月之暗面披露,Kimi K3 基于混合線性注意力機制 (Kimi Delta Attention,下稱KDA)和注意力殘差( Attention Residuals,下稱AttnRes)構(gòu)建。這兩項架構(gòu)更新,都是為了讓信息在更長序列和更深模型中流動得更順暢。團隊也進一步擴大了 Mixture of Experts(MoE)的稀疏度:結(jié)合 Stable LatentMoE 框架后,模型可以在 896 個專家中高效激活 16 個。再加上訓(xùn)練方法和數(shù)據(jù)配方的優(yōu)化,這些結(jié)構(gòu)性改進讓 Kimi K3 相比 K2 的整體擴展效率提升約 2.5 倍,能更有效地把算力轉(zhuǎn)化為能力。
假如把K3理解為一個內(nèi)部就像一個擁有上千名員工的超級公司,那么KDA相當(dāng)于給員工發(fā)了一個“隨用隨取的記事本”;AttnRes則相當(dāng)于在公司每層樓之間修了“直達電梯”——底層發(fā)現(xiàn)的關(guān)鍵信息,可以一路暢通地送到最高層。混合專家模型(MoE)則是一種讓 AI 模型更聰明且更省資源的架構(gòu),好比這家公司有 896 名員工,但每次接到任務(wù),只叫其中 16 個最對口的上班,其余 880 多人休息。Stable LatentMoE分發(fā)機制則是這套“排班系統(tǒng)”的升級版——讓每一次挑哪 16 個人更準(zhǔn)、更穩(wěn)定。
這也是在芯片受限的大背景下,國內(nèi)大模型研發(fā)側(cè)重算法優(yōu)化和資源利用效率的縮影。
不過,在 AI 行業(yè),參數(shù)規(guī)模從來都不是衡量模型能力的唯一標(biāo)尺。
月之暗面也承認(rèn),“盡管 Kimi K3 總體上是一個非常有競爭力的模型,但與 Claude Fable 5 和 GPT-5.6 Sol 相比,在用戶體驗上仍有一定差距。”
唯一可以確認(rèn)的是,正如月之暗面所說的,“它在我們的整套評測中展現(xiàn)出前沿水平的能力,并穩(wěn)定超過了其他所有模型。”
雖然 K3的性能表現(xiàn)讓市場看到了中國大模型持續(xù)縮小與全球頂尖模型的差距,但也有觀點認(rèn)為,Kimi K3的發(fā)布又不完全等同于“DeepSeek時刻”。
時針撥回2025年1月,DeepSeek R1橫空出世,以極低的訓(xùn)練成本打造出比肩GPT-4o的推理能力,被視為大模型的研發(fā)可以“繞過高算力壁壘”,導(dǎo)致英偉達單日市值蒸發(fā)近6000億美元。
但在Kimi K3發(fā)布后,來自多家國際投行的觀點認(rèn)為,Kimi K3不是算力需求的終結(jié)者,相反,加大了對算力的需求。
半導(dǎo)體研究機構(gòu)Semi Analysis在報告中也提到,K3采用的KDA混合線性注意力機制不僅不會削弱高端AI硬件需求,反而可能進一步強化對英偉達高端GPU、HBM以及高速互聯(lián)設(shè)備的需求。
狂奔背后的裂縫
技術(shù)實力從來不等同于商業(yè)上的成功。伴隨Kimi K3誕生的還有諸多爭議,暴露了月之暗面狂奔背后的裂縫與隱憂。
K3發(fā)布48小時內(nèi),用戶請求量大幅超出預(yù)估,逼近現(xiàn)有集群承載極限,7月19日深夜,月之暗面被迫發(fā)布公告,暫停C端新用戶的會員訂閱,將算力全部投入已訂閱用戶。直至7月28日,這一限制仍未得以解除。
K3 發(fā)布不到三天即暫停C 端訂閱,對一家傳出6個月內(nèi)赴港IPO、估值約315億美元的公司而言,拒絕新用戶等于中斷增長曲線。
與算力瓶頸伴生的,還有昂貴的定價體系。
Kimi K3未緩存輸入20元/百萬Token、輸出100元/百萬Token,位列國產(chǎn)模型最貴一檔,遠(yuǎn)超DeepSeek V4 Pro的價格(未緩存輸入 3 元、輸出 6 元)。國外主流大模型與之相比,GPT-5.6 Sol的價格是輸入5美元、輸出30美元,F(xiàn)able 5輸入10美元、輸出50美元。
對此,月之暗面方面硬氣回應(yīng):“開源模型、中國大模型不該被貼上低價標(biāo)簽,我們做出了SOTA級模型,也能匹配合理商業(yè)定價。”
K3發(fā)布不到一周,來自地緣政治的風(fēng)險也初見苗頭。
7月22日,美國白宮科技政策辦公室主任邁克爾·克拉齊奧斯(Michael Kratsios)在其社交賬號上拋出一個驚人言論稱,Kimi K3是靠“蒸餾”美國最強的閉源模型Fable5才研發(fā)出來的。
但這個說法根本站不住腳。Fable 5大模型是于今年6月9日正式發(fā)布的,而Kimi K3發(fā)布于7月16日。兩者發(fā)布時間相差僅1個多月,根本不可能完成克拉齊奧斯所說的“蒸餾”,更別提模型的研發(fā)流程還涉及大量的測試工作。
此外,據(jù)環(huán)球時報,近期有外媒報道稱,美國政府正考慮禁止使用中國人工智能模型。相關(guān)禁令傳聞已在硅谷初創(chuàng)圈引發(fā)普遍恐慌。大量初創(chuàng)企業(yè)創(chuàng)始人依靠成本更低的中國開放權(quán)重模型開發(fā)產(chǎn)品,無力承擔(dān)Anthropic、OpenAI等美國人工智能企業(yè)高昂的調(diào)用費用。
即便如此,K3引發(fā)的連鎖反應(yīng)遠(yuǎn)未結(jié)束。
至今為止,Kimi K3 已經(jīng)收獲SpaceX CEO埃隆·馬斯克、英偉達CEO黃仁勛、OpenAI 總裁兼聯(lián)合創(chuàng)始人在內(nèi)的美國科技圈大佬的“點贊”。
但真正的檢驗時刻尚未到來。如何持續(xù)守住技術(shù)優(yōu)勢、直面全球市場復(fù)雜的監(jiān)管環(huán)境、跑出可行的商業(yè)模式,才是Kimi K3需要交出的長期答卷。
