文 | 唐辰同學
K3爆火,Kimi卻不得不按下暫停鍵。
7月19日深夜,月之暗面Kimi團隊發布公告,因Kimi K3上線48小時內,用戶請求量大幅超出預估,由于算力資源緊張,暫停開放Kimi新用戶訂閱,將有限算力優先保障現有訂閱用戶。
會員體系隨之拆分為Kimi主權益與Code權益,以精準分配資源。從稍后的官方回應看,Kimi沒有對會員體系進行調整,只是在有限算力下對用戶體驗的重新平衡。
也就是說,K3火到觸發算力“熔斷”,只能婉拒新客,專注服務老用戶。
Kimi的“韜定律”
當下,各大模型廠商都在拼命的做大用戶規模,通過免費、降價等性價比手段吸納新用戶。相較之下,Kimi的反向操作就略顯“凡爾賽”了。
但模型能力越強、上下文越長、用戶調用越頻繁,對推理算力的消耗也越高。在“K3請求量逼近現有算力集群的承載極限”的情況下,Kimi也遭遇到“豆包式”的煩惱:C端用戶越多,對收入的貢獻不明顯,但GPU扛不住了。
作為月之暗面首款3萬億參數級MoE模型,K3總參數規模達到2.8萬億。按照常規理解,這個規模的模型,每輸出一次,算力都是指數級消耗。但在其獨特核心架構的支持下,達到華為在芯片領域提出的“韜定律”效果。
這個架構也被視為是一架超級引擎,落地了三項關鍵技術:KDA(Kimi Delta Attention)混合線性注意力、注意力殘差(Attention Residuals)和高稀疏度MoE,把每一分算力轉化為模型效果的效率推到極致。
長期以來,芯片行業依賴摩爾定律,靠縮小晶體管尺寸提升性能。但當先進制程逼近物理極限、成本暴漲,單純堆疊硬件的增長模式也走入瓶頸。
華為今年提出的“韜定律”,跳出“空間縮微”的傳統思路,轉向“時間縮微”:通過邏輯折疊、三維堆疊、全鏈路架構優化,壓縮信號傳輸時延、減少數據冗余搬運,在成熟制程上實現媲美先進制程的能效躍升。
其核心方法論是:在硬件受限或成本約束下,通過系統級架構創新實現性能躍升。
在我看來,K3所采用的KDA混合線性注意力機制,正是AI領域的“韜定律”實踐。
要知道,Transformer架構在注意力機制上最吃算力。標準注意力隨序列長度呈平方級增長,百萬級上下文任務中,大部分算力消耗在維持長序列的注意力矩陣上。KDA機制將大部分注意力層的計算復雜度從平方級降至線性。
根據月之暗面此前發布的技術報告,在實驗模型上采用KDA與MLA混合比例,KV緩存占用最高削減75%,100萬上下文長度下的解碼吞吐量提升至原來的6倍。配合注意力殘差與高稀疏度MoE技術,訓練效率提升約25%,額外成本不到2%。
這是對“模型生產效率”的重構。如果說硅谷主流的Transformer路線是“大力出奇跡”的燃油車,KDA更像是追求“熱效率極致”的混動引擎。
SemiAnalysis的報告指出,KDA將推理速度提升300%,同時在長上下文處理上保持接近Transformer的性能。這意味著同等算力投入下,K3能產出更多有效智能。
開發者社區的實測反饋,在長流程Agent任務和代碼生成方面,K3表現突出,具備與國際頭部模型競爭的實力。
從根本上說,K3依然遵循Scaling Law(縮放定律),但把刀揮向了粗糙的算法浪費。當硅谷AI企業還在不斷囤卡、堆算力時,Kimi通過重構算法鏈路、精簡計算冗余,在有限算力的條件下,實現了性能與效率的平衡,走出一條“每瓦特智能產出比”最大化的路徑。
這讓華爾街觀察人士和投資者感到意外,他們像驚詫DeepSeek一樣,再度質疑硅谷數千億美元投資AI是否能得到相應回報、美國AI領先優勢是否被削弱。
與此同時,企業用戶和開發者也都開始關注AI使用成本。其中一部分開發者已經用上“模型路由”(Model Routing)服務,根據不同任務自動選擇成本最低、效率最高的 AI 模型,這其中當然包括Kimi在內的中國模型。
楊植麟摸高
回過頭來看,Kimi算力被擊穿是技術成功的副作用:模型效率的提升降低了單次使用成本,反而刺激了需求總量的暴漲。
值得一提的是,7月11日,智譜創始人唐杰宣布“Touch High摸高計劃”,直言“不登頂,就是失敗”,并明確表示未來兩年不追求短期應用變現,而是集中資源攻堅 AGI 的四大核心方向,并擬募集資金,計劃投入百億級資源突破機械可解釋性技術。
如果說,智譜“摸高”是上市后的背水一戰。其希望通過沖擊技術的天花板,來夯實“全球大模型第一股”的故事,并緩解真實焦慮。
我也在楊植麟的決策中,看到Kimi在三個維度的“摸高”:
一是算力摸高,從流量思維切換到價值思維。公開信息顯示,Kimi的API業務占比已經突破了70%,與此前靠C端訂閱模式大為不同。保老用戶,拒新客,實則是將有限算力向高價值場景傾斜,避免泛C端流量擠占已是收入支柱的B端業務配額。
其代價也是顯而易見。比如“優先保障存量用戶”的執行標準不透明,哪些請求被優先響應、哪些被降級處理,一旦處理失策,都會稀釋用戶信任。
長遠來看,Kimi要完成從技術明星向成熟AI頭部企業的轉變,就必須夯實彈性算力池、分級響應機制、動態調度能力等基礎設施。
二是定價摸高,Kimi在進行從廉價自助餐到價值分層的壓力測試。公告中提及的“拆分Kimi主權益與Code權益”,既是應對算力短缺的短期調配,也可能預示著其定價體系重構的開端。
過去,無論用戶寫代碼、查資料還是閑聊,都支付相同費用、消耗相同算力。當高算力消耗的Code用戶占比上升,這種模式必然導致結構性錯配。
Kimi借此機會進行會員權益拆分,也是在按使用場景重新定價:輕度用戶享受基礎服務,重度用戶為高價值能力支付溢價。
這是通過價值用戶分層,在嘗試爭奪模型產品的定價權。目前,K3收費標準已達每百萬Token 2.3美元,雖低于海外頂尖模型,但已創下國產模型新高。
或許,Kimi也想告別廉價模式,對外傳遞一個認知:高性能模型具備定價能力。接下來,大模型的競爭也將從“拼參數”轉向“拼基礎設施”、“拼成本定價”。
這一步,比登頂榜單更難,也更接近商業本質。
第三,地位摸高,Kimi從地緣變量到定價錨點的身份躍遷。
K3發布后迅速引發全球關注。在獨立AI模型評測機構Artificial Analysis發布的最新“智能指數(Intelligence Index)”中,其綜合得分達到57分,位列全球第三,僅次于Claude Fable 5(60分)和GPT-5.6 Sol(59分),領先Claude Opus 4.8(56分)。
這個成績,也順手打破了“開源落后閉源半代”的行業共識。
同時,K3的影響力已溢出技術圈。美國科技投資機構將其視為AI發展的“拐點”,認為高質量開源模型正加速能力擴散;加州大學伯克利分校計算機科學教授聲稱,K3將中國開源模型與美國先進模型的差距,拉小至2到3個月。
資本市場的反應同樣劇烈,K3發布的首個交易日,英偉達單日市值蒸發約1111億美元;摩根大通策略師在報告中直接稱之為“DeepSeek 2.0”。
這個加速度,才是改變定價邏輯的東西。
此外,月之暗面ARR(年化收入)到6月已經接近3億美元,海外增速400%,漲價60%后收入反增,這三組數據疊加,表明Kimi的“開源+效率”模式可以規模化變現。
加上有消息披露,月之暗面正在尋求最快六個月在香港上市,估值在半年內從43億美元飆升至315億美元,漲幅超7倍。
這些都是資本市場在給一條非硅谷主流路線的“確權”。它們為“能跑通單位經濟模型的SOTA”下注時,也說明Kimi擁有了獨立的估值邏輯,不再需要對標OpenAI或Anthropic來證明自己值多少錢。
但K3距離AGI還有很長的路。比如跑分,雖然K3只比Fable 5低了3分,但背后仍是不小的差距。
另外,Kimi在技術報告里還承認了兩個部署層面的缺陷:一是K3在訓練中保留了完整的思考歷史(thinking history),如果調用方沒有正確地把之前的推理過程傳回來,或者在會話中從別的模型切換到K3,輸出質量就會明顯下降;
二是K3在任務模糊時會“過度主動”,更傾向于替用戶做決定。這種“自作主張”在需要精確執行的工程流程里,容易觸發連鎖錯誤。
還有一個容易忽視但極其重要的問題:幻覺。Artificial Analysis在測評中特別指出,K3的幻覺率比上一代 K2.6反而有所上升。
某種程度上,K3的光鮮與隱憂,是全行業算力供需失衡的縮影,也是中國AI產業在算力卡脖子、商業化未閉環、用戶預期過高等重壓下的集體陣痛。
這些AI廠商的每一次過載、每一次“熔斷”,都是中國AI“摸高”需要邁過去的坎兒。可以確定的是,一個新的競爭周期已經開啟,大模型將從拼能力跨越到拼算力。
誰能在算法、算力儲備等基建上建立優勢,誰才能笑到最后,并將定義下一代AI公司的生存標準。
參考資料:
- 字母榜,《K3發布48小時》
- 錦緞,《都怪Kimi》
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.