![]()
![]()
2026 年 7 月 17 日,月之暗面正式發布新一代旗艦模型 Kimi K3。
![]()
Kimi K3 是一款擁有 2.8 萬億參數的模型,基于 Kimi Delta Attention 和 Attention Residuals 架構構建,原生支持視覺能力,并具備 100 萬 Token 的上下文窗口。它是全球首個開放的 3 萬億參數級模型,面向長周期編程、知識工作和推理等前沿智能任務而設計。
月之暗面同時承認,Kimi K3 的綜合能力仍落后于 Claude Fable 5 和 GPT 5.6 Sol 等最強閉源模型。
但從官方公布的測試結果看,Kimi K3 已經在編程、Agent、知識工作和視覺理解等多個方向接近當前第一梯隊,并在部分項目中取得領先。
![]()
![]()
![]()
![]()
Kimi K3 已經上線 Kimi 網頁端、移動端、Kimi Work、Kimi Code 和 Kimi API。
![]()
模型目前默認使用最高推理強度,月之暗面計劃后續增加低強度和高強度選項。
Kimi K3 的完整模型權重尚未同步開放,官方表示將在 2026 年 7 月 27 日前發布。
2.8 萬億參數,每次只調用 16 個專家
Kimi K3 延續混合專家模型架構,共設置 896 個專家,每個 Token 實際激活其中 16 個。與 Kimi K2 的 1 萬億總參數、320 億激活參數相比,K3 繼續擴大總參數和專家數量,同時維持較高的稀疏度。
![]()
模型采用 Kimi Delta Attention 和 Attention Residuals 兩項核心架構。前者用于降低長序列注意力計算成本,后者允許模型在不同網絡深度間選擇性讀取此前生成的表示,而不是簡單逐層累積信息。
![]()
月之暗面稱,配合 Stable LatentMoE、Quantile Balancing、Per-Head Muon 等訓練方法,Kimi K3 的整體擴展效率較 Kimi K2 提高約 2.5 倍。模型從監督微調階段開始進行量化感知訓練,采用 MXFP4 權重和 MXFP8 激活,以提高不同硬件平臺上的部署兼容性。
不過,2.8 萬億參數也對本地部署提出較高要求。
月之暗面建議采用至少包含 64 個加速器的超級節點部署 Kimi K3。
雖然模型權重開放,但普通開發者很難在消費級設備或常規單機服務器上完整運行未經大幅量化的版本。
編程能力成為 Kimi K3 的主攻方向
從官方展示的案例和測試結果看,長時間自主編程是 Kimi K3 最重要的能力之一。
月之暗面稱,Kimi K3 可以在較少人工干預的情況下持續執行長時間工程任務,包括分析大型代碼倉庫、調用終端工具、修改代碼、運行測試和根據運行結果繼續迭代。
![]()
在 GPU 內核優化測試中,不同模型需要在最長 24 小時內優化四項任務,涉及 NVIDIA H200 和另一家供應商的通用 GPU。
Kimi K3 的結果接近 Claude Fable 5,并明顯超過 Claude Opus 4.8、GPT 5.6 Sol 和 GPT 5.5。
月之暗面還讓 Kimi K3 從零開發了一個名為 MiniTriton 的 GPU 編程系統。該系統包含自己的領域特定語言、基于 MLIR 的中間表示、優化流程和 PTX 代碼生成管線。在部分測試負載上,MiniTriton 的運行性能達到或超過 Triton 與 torch.compile,并能夠完成 nanoGPT 的端到端訓練。
![]()
在 Kimi K3 開發后期,一個早期版本的 K3 已經承擔了團隊大部分 GPU 內核優化工作。
多項編程和 Agent 測試進入第一梯隊
在官方公布的測試表中,Kimi K3 在 Program Bench 上獲得 77.8 分,略高于 Claude Fable 5 的 76.8 分和 GPT 5.6 Sol 的 77.6 分。
在考察長期軟件工程能力的 SWE Marathon 中,Kimi K3 獲得 42.0 分,高于 Claude Fable 5 的 35.0 分、GPT 5.6 Sol 的 39.0 分和 Claude Opus 4.8 的 40.0 分。
在 FrontierSWE 中,Kimi K3 獲得 81.2 分,低于 Claude Fable 5 的 86.6 分,但高于 GPT 5.6 Sol 的 71.3 分。Terminal Bench 2.1 測試中,Kimi K3 得分為 88.3,與 GPT 5.6 Sol 的 88.8 分接近。
在 Agent 測試中,Kimi K3 的 BrowseComp 得分為 91.2,超過 Claude Fable 5 的 88.0 和 GPT 5.6 Sol 的 90.4;DeepSearchQA 得分為 95.0,也高于官方列出的其他對比模型。
辦公與知識工作方面,Kimi K3 在 SpreadsheetBench 2 上獲得 34.8 分,略高于 Claude Fable 5 的 34.7 分;在內部 DECK-Bench 演示文稿測試中獲得 73.5 分,略高于 Fable 5,但低于 GPT 5.6 Sol 的 74.7 分。
![]()
不過,這些結果不能直接理解為 Kimi K3 已經全面超過其他模型。
不同模型分別運行在 KimiCode、Claude Code 和 Codex 等不同 Agent 框架內,部分結果來自月之暗面內部測試,Claude Fable 5 的個別測試還可能在拒絕執行時回退至 Claude Opus 4.8。
月之暗面也明確表示,Kimi K3 的全部成績均使用最高推理強度測得,采樣參數為 temperature 1.0、top-p 1.0。不同運行框架、工具權限和推理預算均可能影響最終結果。
視覺、游戲、CAD 和視頻編輯成為新重點
Kimi K3 原生支持文本、圖像和視頻,不再將視覺能力作為獨立模塊附加到語言模型之上。
在游戲與前端開發中,模型可以讀取運行截圖,根據畫面繼續修改代碼,形成“視覺進入編程循環”的工作方式。官方展示的案例包括根據圖片或視頻生成可運行的 3D 游戲,以及結合視覺反饋迭代前端界面和 CAD 項目。
在視覺測試中,Kimi K3 的 OmniDocBench 得分為 91.1,高于 Claude Fable 5、GPT 5.6 Sol 和 Claude Opus 4.8;WorldVQA ForceAnswer 得分為 51.0,低于 Fable 5 的 56.7,但高于 GPT 5.6 Sol 的 41.8。
Kimi K3 在 MMMU-Pro 上獲得 81.6 分,接近 Claude Fable 5 的 81.2 分,但低于 GPT 5.6 Sol 的 83.0 分。加入 Python 工具后,其 MathVision 得分達到 97.8,與 GPT 5.6 Sol 相同,略低于 Fable 5 的 98.6。(?Kimi AI)
月之暗面還稱,Kimi K3 能夠完成視頻素材篩選、鏡頭切換、節奏匹配、音頻處理和多輪修改。Kimi K3 的發布預告視頻便由模型從 56 段源素材中完成剪輯。
從回答問題轉向完成完整知識工作
除公開測試外,月之暗面還公布了多項長周期知識工作案例。
在一個 AI 芯片產業研究項目中,Kimi K3 進行了超過 120 輪自我迭代,執行約 2800 次網頁搜索和抓取、1100 次終端數據提取,處理超過 1.1 萬個頁面,其中包括 87 份季度報告和 99 份原始 PDF,最終生成覆蓋 42 年 AI ASIC 產業發展的交互式研究網站。
在另一個計算天體物理項目中,Kimi K3 閱讀并交叉驗證了 20 多篇論文,處理超過 300 個狀態方程,編寫超過 3000 行 Python 代碼,并生成交互式分析頁面。月之暗面稱,這項工作由 K3 在約兩個小時內完成,通常需要有經驗的研究人員工作一至兩周。
此外,K3 還使用 20 多個并行子 Agent 分析了 391 個引力波事件,生成 7 張科學圖表、2 個表格,并整合了 10 多篇論文。上述案例均來自月之暗面的官方展示,尚缺少外部機構對過程和結果的獨立復現。
Kimi Work 也隨 K3 增加 Widgets 和 Dashboard 功能。用戶可以在對話中生成連接本地數據或外部插件的交互組件,并將常用組件固定在持續更新的個人儀表盤中。
API 輸出價格達到每百萬 Token 15 美元
Kimi K3 API 已經開放,緩存命中的輸入價格為每百萬 Token 0.30 美元,未命中緩存的輸入價格為每百萬 Token 3 美元,輸出價格為每百萬 Token 15 美元。
月之暗面稱,依靠 Mooncake 分離式推理架構,Kimi 官方 API 在編程任務中的緩存命中率超過 90%。按照這一口徑,長代碼倉庫和重復上下文任務的實際輸入成本可能明顯低于標價,但輸出價格較 Kimi 此前的模型大幅提高。
這也顯示出 Kimi K3 的定位變化,它不再單純依靠低價競爭,而是嘗試以更高的推理強度、更長的任務執行時間和更完整的最終交付物進入高端模型市場。
Kimi K3 發布后,X 上很快出現大量游戲、3D 場景、交互網頁和數據可視化演示。
![]()
![]()
![]()
![]()
部分評論將此次發布稱為中國開放模型的又一次“DeepSeek 時刻”。
卡內基梅隆大學教授、知名機器學習學者 Ruslan Salakhutdinov 在 X 上祝賀月之暗面創始人兼 CEO 楊植麟發布 Kimi K3,稱這是開源社區的一次重大勝利。他回憶,楊植麟曾在自己與 William Cohen 聯合指導的實驗室中攻讀博士,僅用 4 年便獲得卡內基梅隆大學博士學位,并在校期間參與推出 XLNet、Transformer-XL 等重要機器學習成果。Salakhutdinov 稱贊楊植麟取得了“非凡的職業成就”,并感謝整個 Kimi 團隊對開源社區作出的貢獻。
![]()
中國大模型開始正面沖擊高端閉源市場
Kimi K3 最值得關注的部分,并不只是參數規模從 1 萬億擴大至 2.8 萬億,而是月之暗面第一次明確將自家模型放入 Claude Fable 5、GPT 5.6 Sol 和 Claude Opus 4.8 所在的高端閉源模型競爭區間。
從此次發布和評價看,中國開放模型的競爭目標已經從“以較低成本接近閉源模型”,進一步轉向在部分復雜任務上直接爭奪全球第一梯隊。
云頭條聲明:如以上內容有誤或侵犯到你公司、機構、單位或個人權益,請聯系我們說明理由,我們會配合,無條件刪除處理。
![]()
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.