出品 | 網易智能
作者 | 小小
編輯 | 王鳳枝
7月27日,在首秀11天后,這家中國AI初創公司將Kimi K3的完整模型權重上傳至Hugging Face。
![]()
這批總規模約1.56TB的權重文件,很快在開發者社區引發關注,并在短時間內登上平臺趨勢榜首。不過,權重免費不等于零成本:有人指出想讓這個2.8萬億參數模型跑起來,至少需要200萬元硬件投入;若要提供商業API服務,門檻則在1500萬元左右。
但這次交付的意義仍然遠超一次普通的權重釋放。
從模型權重到底層算子,從訓練沙盒到一份詳盡的47頁技術報告,月之暗面把構建和訓練K3所需的大量工程能力擺上了臺面;與此同時,一份精心設計的許可證,也為這場開放劃定了商業邊界。
![]()
熱鬧的社區狂歡背后,月之暗面試圖回答一個更大的問題:開放權重模型,如何在擴大生態的同時,找到可持續的商業回報?
這既是一場技術開放實驗,也是一次商業模式探索。
01不是只給"魚",連"漁具"也一并打包
對于熟悉K3首次亮相的人來說,參數規模(總參數2.8萬億,激活參數1040億)和跑分已經不是新聞。
此次發布的真正增量,在于月之暗面選擇了"給魚又給漁"的開放策略。它不僅交付了模型權重本身,還將訓練和部署這個龐大模型所需的三項核心基礎設施(MoonEP、FlashKDA和AgentENV)一并開放,并附上一份47頁技術報告。這在當前開放模型生態中并不常見。
![]()
首先,核心交付是完整的模型權重文件,包含K3的文本和視覺編碼器(MoonViT-V2)的相關參數。擁有足夠算力的團隊可以自行部署并研究這一模型。
但真正讓業界關注的,是隨權重一同發布的技術報告。這份報告并非簡單展示性能成績,而是披露了K3從架構設計、訓練策略到數據處理的一系列技術細節。
全棧開發者 @TypicalBryan735評論說,放棄注意力內核、MoE通信庫和代理沙盒基礎設施,同時開放權重,這才是真正推進開放模型生態的方式。
![]()
除了權重文件,月之暗面還開放了三項基礎設施技術,分別解決通信、算子優化和智能體訓練環境問題,對應了訓練和部署超大規模混合專家模型時的幾個關鍵瓶頸。
MoonEP瞄準的是混合專家模型訓練中常見的"負載不均"問題。K3內部有896個路由專家,每處理一個token,系統只激活其中16個專家。這種設計能夠擴大模型規模,同時控制實際計算量,但也帶來新的挑戰:不同專家的調用頻率不同,可能導致部分GPU負載過高,另一部分資源閑置。
傳統方案通常需要額外的數據交換和調度機制。MoonEP通過優化專家分配和通信方式,提升不同計算節點之間的負載均衡效率,減少訓練過程中的通信浪費。
![]()
在訓練超大規模MoE模型時,MoonEP有望提高計算資源利用率,并降低訓練成本。
如果說MoonEP解決的是算力調度問題,FlashKDA則聚焦于計算效率。
Kimi Delta Attention(KDA)是K3處理百萬token長上下文的重要技術之一,但其計算方式也帶來了新的工程挑戰。KDA具有"塊內并行、塊間串行"的特點:塊內計算可以并發,但不同計算塊之間的信息狀態需要連續傳遞。如果按照傳統方式處理,GPU會在計算和狀態傳遞之間產生等待。
FlashKDA是月之暗面針對KDA設計的高性能算子庫。它將計算過程拆分成不同流水線,讓塊內計算和狀態傳遞能夠更高效地并行執行。這就像廚房里,一個廚師負責炒菜,另一個廚師負責傳菜,而不是同一個人炒完一道菜再端出去。
在英偉達H20芯片測試中,FlashKDA的預填充速度相比相關基線方案提升明顯。更重要的是,FlashKDA已經成為相關開源項目可選的后端方案之一,它的價值并不局限于K3本身。
專注AI工具構建的開發者 @Andrii38324276指出,僅開放權重只能讓開發者運行模型,而開放底層內核,才真正讓社區有機會理解和改進訓練效率。
![]()
第三項基礎設施AgentENV,展示了K3訓練中的另一個關鍵環節:如何為AI智能體提供穩定、可規模化的試錯環境。
K3強化學習訓練需要智能體在接近真實工作的環境中反復執行任務,例如讀寫文件、運行代碼、調用工具。早期方案采用容器搭建沙盒環境,但團隊發現,智能體的一些非預期操作可能導致系統崩潰,隔離能力并不足夠。
于是,AgentENV采用了Firecracker microVM作為底層環境。這種輕量級虛擬機技術能夠提供更強隔離能力,讓智能體擁有類似獨立計算環境的空間進行試錯。為了支持大規模訓練,AgentENV還優化了沙箱創建、暫停和恢復流程。
月之暗面披露,在K3訓練和評估過程中,這套系統創建了超過5121萬個沙箱,覆蓋150多萬個鏡像。 此次開放,意味著開發者不僅可以獲得一個模型,也可以參考一套經過大規模驗證的智能體訓練基礎設施。
這三項基礎設施的開放,讓K3與許多只開放權重的模型有所區別。
過去,開放模型通常意味著開發者"可以使用"模型,但訓練和優化模型背后的工程能力,仍然掌握在少數實驗室手中。月之暗面此次交出的,不只是模型本身,還包括一部分支撐模型訓練和部署的工具鏈。
對于開發者而言,這意味著他們獲得的不只是一個可調用的模型,也是一套可以進一步研究、修改和復用的工程資源。
02開放新范式:營收掛鉤許可證,在開放與商業之間走鋼絲
K3的發布,也讓"開放權重"和傳統意義上的"開源"之間的區別再次成為焦點。
隨模型權重一同發布的Kimi K3許可證,因其獨特的商業限制條款,迅速成為討論中心。
這份許可證的大部分內容接近寬松開源許可,允許用戶使用、修改、分發甚至基于模型開發產品。但它附加了兩個關鍵條件。
第一,經營模型即服務(Model as a Service)業務,且自身及關聯方年營收超過2000萬美元的公司,需要另行簽訂商業協議。
第二,如果任何商業產品或服務的月活躍用戶超過1億,或者月收入超過2000萬美元,則需要在界面顯著位置展示"Kimi K3"標識。
這兩項限制不適用于企業內部自用,也不適用于通過月之暗面官方產品或認證合作伙伴訪問模型的場景。也就是說,這套許可證主要針對的是達到一定商業規模、并直接向第三方提供模型推理或微調服務的企業。普通企業內部使用模型,或者將模型能力嵌入自身產品功能的部分場景,并不一定觸發額外商業協議。
正如Interconnected Capital的Kevin Xu所指出的,這種做法讓人聯想到MongoDB等公司為防止云廠商直接轉售其成果而采用的定制許可證。
![]()
過去,一些開源軟件公司曾面臨類似問題:代碼開放后,云服務商可以直接基于這些成果提供商業服務,而原始開發者卻難以獲得對應收益。K3許可證的思路,本質上是在開放生態和商業回報之間尋找一個平衡點。
開發者對此總體持積極態度,但也有不同聲音。
AI研究者內森·蘭伯特(Nathan Lambert)總結道,這份許可證受到MIT許可啟發,但加入了明顯的商業限制。因此,從嚴格定義來看,它更接近"開放權重"而非傳統意義上的"開源"。
X用戶 @peterom則持更務實的觀點。他認為,資本主義和開放生態并不一定矛盾,Kimi這種模式可能是一種新的平衡方式。他預測,未來幾年可能會出現多家開放模型公司實現大規模商業收入,而"開放模型無法賺錢"的觀點也會逐漸被重新審視。
![]()
不過,這條精心設計的商業邊界,也讓K3進入了另一個更復雜的討論領域:監管。
出口管制專家、前拜登政府官員彼得·哈雷爾(Peter Harrell)曾分析,單純下載和使用開放權重模型,可能被視為受保護的信息傳播,美國政府直接干預的法律基礎并不明確。
但K3許可證改變了一部分情況:當一個大型云服務商希望將K3模型能力作為商業服務提供時,它需要與月之暗面建立明確商業關系。 一個原本只是"下載模型"的行為,可能轉變為商業交易。而商業交易,也意味著更明確的監管邊界。
如果美國商務部未來依據相關規則限制某些交易,或者將月之暗面列入制裁名單,這類商業協議可能成為監管關注的對象。
這也構成了K3開放策略中的一個微妙矛盾:開放可以擴大生態,但商業化會帶來新的監管關系。當月之暗面希望在保持開放屬性的同時獲得更多商業回報時,它需要面對一個新的平衡問題:有營收,就意味著更容易進入監管視野。
03開放了,然后呢?從200萬到1500萬的部署賬單
如果說許可證解決的是"誰可以免費使用、誰需要付費"的商業問題,那么接下來面對的是另一個更加現實的問題:即使拿到了免費權重,K3到底有多少人真正跑得起來?
模型權重可以免費下載,但這1.56TB文件一旦落地,就立刻變成了一道昂貴的硬件門檻。
小紅書博主"平凡v97"根據公開方案,對K3部署成本進行了估算,并將其分成兩個層級。
第一個層級,是"讓模型運行起來"。AMD此前公布的驗證方案提供了一個參考:8張MI355X,每張擁有288GB顯存,總顯存約2.3TB。按照當前硬件價格估算,這套配置的服務器成本約為170萬至240萬元。如果進一步考慮服務器、散熱、機房和運維成本,總投入可能超過200萬元。
但這解決的只是"能運行"。
如果目標是提供商業API服務,要求會完全不同。商業部署需要考慮多用戶并發、百萬token上下文處理、穩定響應延遲、故障切換以及長期運行成本。
因此,月之暗面在技術文檔中建議,生產環境采用64張以上加速卡組成的部署方案。按照類似硬件規模估算,商業級集群投入可能達到1400萬至1900萬元。
也就是說:200萬元,可能讓模型跑起來;1500萬元左右,才接近商業化服務的起點。
![]()
也有外國網友吐槽:“你只需要每月3萬5000美元的GPU預算,或一次性50萬美元投資,就能避開Kimi K3的99美元/月訂閱。”
![]()
不過,開放權重的意義,也正在于它允許不同玩家探索不同路徑。
Ning團隊展示了一套更偏極客路線的方案:80張RTX 5090消費級顯卡(大概需要200萬元人民幣)組成10個節點,每個節點8張卡,總顯存達到2.56TB。這套方案沒有采用AI服務器常見的HBM高帶寬顯存,也沒有使用NVLink、InfiniBand等高端互聯設備,而是依靠消費級顯卡和普通網絡完成運行。
![]()
測試結果顯示,K3在這套系統上實現了約20 tok/s的單流推理速度。雖然距離大型商業服務仍有差距,但它證明:一個2.8萬億參數模型,并非只能存在于少數大型數據中心。
這兩條路徑的并存,正是開放權重生態的價值所在。一端,是官方推薦的數百萬甚至上千萬元級數據中心部署;另一端,是開發者基于現有硬件不斷嘗試的社區方案。
開放權重并不意味著所有人都能低成本運行前沿模型。但它確實讓"如何運行模型"這個問題,有了更多探索空間。
而這也進一步引出下一個問題:K3為什么能夠在如此龐大的規模下,仍保持接近前沿模型的效率?
04架構紅利:K3如何把規模變成效率
答案在于K3的架構設計,它在多個層面降低了單位計算的成本。
從Kimi K2到K3,模型總參數規模擴大到近3倍。月之暗面表示,新架構、訓練方法和數據配方共同提升了模型的整體擴展效率,約為上一代的2.5倍。
需要注意的是,這里的"2.5倍"是月之暗面對整體擴展效率的描述,并不等同于訓練速度提升2.5倍,也不是某一項技術單獨帶來的收益,而是多個優化共同作用后的綜合結果。
這些優化主要來自KDA、Attention Residuals以及Stable LatentMoE等架構設計。
KDA:解決百萬Token上下文的效率問題
長上下文一直是大模型擴展中的核心挑戰。傳統Transformer注意力機制的計算成本,會隨著序列長度增加而快速增長。當上下文窗口擴大到百萬token級別時,如何控制計算成本,就成為模型能否繼續擴展的關鍵。
K3的核心注意力機制KDA(前文已介紹其工程實現FlashKDA)在架構層面的價值在于:它通過遞歸方式處理長程依賴,避免了傳統注意力機制隨序列長度平方級增長的計算開銷。同時,K3結合Gated MLA等機制,在效率和信息保留之間進行平衡。
月之暗面表示,KDA能夠顯著提升百萬token上下文場景下的推理效率。
Attention Residuals:讓深層網絡保持信息流動
傳統殘差連接主要負責將上一層的信息傳遞到下一層。但隨著模型深度增加,如何避免有效信息逐漸衰減,成為大型模型訓練中的重要問題。
Attention Residuals允許模型根據當前任務需要,從不同深度的表示中主動檢索信息。它不再依賴固定的信息傳遞路徑,而是讓模型擁有更靈活的信息調用方式。對于深層網絡而言,這有助于提高信息利用效率。
Stable LatentMoE:解決專家模型的調度難題
K3采用混合專家架構(MoE)。模型總共有896個專家,但每個token只激活其中16個。這種設計能夠讓模型擁有更大的參數規模,同時控制實際計算成本。
但MoE架構也帶來了新的問題:如果部分專家被大量調用,對應計算資源會出現過載;而其他專家可能長期處于低利用狀態。
K3采用"分位數均衡"(Quantile Balancing)方法優化專家路由。它并不是不斷人工調整冷門專家權重,而是根據路由分數分布確定專家分配邊界,從而減少對啟發式更新規則和敏感平衡參數的依賴。
原生多模態與視覺能力
在視覺能力方面,K3采用MoonViT-V2視覺編碼器。
月之暗面表示,K3沒有沿用部分模型常見的視覺預訓練路徑,而是探索通過下一token預測任務訓練視覺編碼器。這種方式讓模型能夠在統一架構下處理文本和視覺信息。
這些架構設計最終反映在模型表現上。
在月之暗面公布的基準測試中,K3在BrowseComp等智能體任務評測中表現突出,并在AutomationBench測試中取得最高成績。在SpreadsheetBench 2中,K3也以微弱優勢領先。
在推理能力測試中,K3在GPQA Diamond中獲得93.5%的成績,與GPT-5.6 Sol的最高成績接近。在更貼近真實軟件開發任務的FrontierSWE測試中,K3取得81.2%的成績,高于GPT-5.6 Sol公布的71.3%。
![]()
![]()
第三方評測機構Artificial Analysis的Intelligence Index顯示,K3獲得57.1分,進入全球前列。該榜單中,K3超過Claude Opus 4.8(max)和GPT-5.5(xhigh),排名位于Claude Fable 5和GPT-5.6 Sol之后。
需要注意的是,不同模型評測時使用的配置、工具鏈和測試方式并不完全一致,因此這些成績更適合說明K3已經進入全球前沿競爭范圍,而不能簡單理解為全面超過所有閉源模型。
在WebDev Arena前端代碼競技場中,K3以1678分排名第一,超過Claude Fable 5。這也是目前開放權重模型在該類競技場中取得的重要突破。
![]()
更具沖擊力的是成本。K3 API價格低于部分頂級閉源模型,同時推理時只激活部分參數,并通過MoE架構、低精度量化和KDA機制降低運行成本。
一位測試者指出,在智能體工作流中,K3的表現接近Claude Fable 5,但成本顯著降低。
![]()
這也是開放模型對閉源模型形成挑戰的關鍵:它不一定首先贏在絕對能力,而可能贏在"能力、成本和可獲得性"的綜合平衡。
05中國開放模型的新信號:從性能競爭到生態競爭
K3的發布,已經不只是一次模型升級。
它同時展示了一個此前開放模型較少呈現的組合:接近全球前沿模型的性能、完整的工程工具鏈,以及明確的商業授權規則。
過去幾年,中國AI公司的競爭重點更多集中在模型能力本身:誰的參數更多,誰的跑分更高,誰的價格更低。而K3此次展示出的變化在于:競爭開始從"模型能力"延伸到"圍繞模型建立的生態"。
過去,開放模型通常意味著開發者可以下載權重、進行微調或者開發應用。但模型訓練背后的工程能力(例如超大規模MoE訓練、推理優化、智能體訓練環境)往往仍然掌握在少數大型AI實驗室手中。
K3此次開放的不同之處,在于它同時提供了一部分支撐模型訓練和部署的基礎設施:MoonEP解決MoE訓練通信問題,FlashKDA提供針對KDA架構的優化實現,AgentENV提供智能體訓練環境。
這些工具是否會形成長期生態,還需要時間驗證。但至少,它讓開發者獲得的不只是一個模型,而是一套可以繼續研究和改造的工程資源。
Hugging Face首席執行官Clement Delangue也注意到了社區反應。他表示,K3發布后很快登上Hugging Face趨勢榜首,社區反響非常強烈。
![]()
風險投資機構Air Street的Nathan Benaich則認為,當前AI競爭環境正在發生變化。美國長期占據開放模型生態優勢,而中國公司正在快速縮小差距。
![]()
不過,K3是否意味著中國開放模型生態已經完成質變,目前仍然需要更多觀察。
真正的生態形成,需要開發者持續采用、第三方應用出現、工具鏈被廣泛復用、商業模式得到驗證。這些都不是一次模型發布能夠立即證明的。
Kimi K3的權重現在已經公開。任何擁有足夠算力的團隊,都可以下載、研究和修改它。
但從下載到部署,需要數百萬元級別的硬件投入;從部署到商業服務,需要穩定的基礎設施和運營能力;從商業服務到規模化競爭,還需要面對許可證、市場環境以及政策因素。
這也是K3最有意思的地方:它把AI產業鏈中此前分散的問題,同時擺到了臺面上。
模型可以開放。但算力不會免費。工程能力不會自動復制。商業價值也不會憑空產生。
月之暗面試圖探索的,并不是簡單回答"AI應該開源還是閉源"。它更像是在回答另一個問題:當越來越多前沿模型走向開放,創造這些模型的公司,如何在生態擴散和商業回報之間找到新的平衡?
K3給出了一個新的嘗試。
但這個答案,最終仍需要市場和時間驗證。
