![]()
智東西
編譯 茄子
編輯 程茜
智東西7月17日報(bào)道,今日,Kimi正式發(fā)布其迄今能力最強(qiáng)、全球首個開源的3萬億參數(shù)級別模型Kimi K3。該模型參數(shù)量達(dá)到2.8萬億,原生支持視覺理解,并擁有100萬token上下文窗口。
![]()
Kimi K3一上線便成為大模型頂流,不少網(wǎng)友將其發(fā)布稱作“中國的Fable 5時(shí)刻”。就連Kimi創(chuàng)始人兼CEO楊植麟的博士生導(dǎo)師、CMU機(jī)器學(xué)習(xí)泰斗Russ Salakhutdinov也發(fā)貼盛贊新版Kimi為開源社區(qū)帶來重大突破。
![]()
云平臺Vercel創(chuàng)始人、Next.js作者Guillermo Rauch公布專業(yè)網(wǎng)頁工程AI評測結(jié)果,Kimi K3綜合表現(xiàn)位列第一。他發(fā)帖稱,首次有開源模型在該權(quán)威榜單超越全部海外閉源模型;其代碼任務(wù)成功率達(dá)92%,開發(fā)效率優(yōu)于同梯隊(duì)Claude Fable 5。
![]()
測評博主aditya實(shí)測后,認(rèn)為Kimi K3就像中國開源了Claude Fable 5類型的模型。他用Kimi K3生成了一款槍戰(zhàn)游戲,并稱,從未見過AI僅憑一個提示就能生成如此驚喜的界面。
![]()
AI頭部測評博主Taelin也對Kimi K3進(jìn)行了體驗(yàn)。他認(rèn)為Kimi K3在有些題目上表現(xiàn)超過Claude Fable 5,但有一些題目表現(xiàn)卻很差,并且,花費(fèi)的時(shí)間是Claude Fable 5的10倍。不過,他稱,用Claude Sonnet 5的價(jià)格就能買到接近Claude Fable 5的開源模型,確實(shí)改變了自己的看法。
![]()
從技術(shù)博客看,Kimi K3長程Agent式執(zhí)行能力大幅提升,該模型可以把編程、視覺理解、工具調(diào)用和知識工作串成完整流程。以官方展示的ASIC行業(yè)42年研究網(wǎng)站為例,Kimi K3通過120多輪迭代,完成2800多次網(wǎng)頁搜索與抓取、1100多次終端數(shù)據(jù)提取,處理87份季度報(bào)告和99份原始PDF,最終生成包含定制圖表、動畫示意圖和交互式可視化敘事的研究報(bào)告。
![]()
在基準(zhǔn)測試方面,Kimi K3在大模型評測競技Arena.AI的前端代碼測試中,超越Claude Fable 5;在第三方獨(dú)立測評機(jī)構(gòu)Vals AI中,Kimi K3的綜合測試得分為74.7,位列第2,超越GPT-5.6,僅次于Claude Fable 5。
![]()
Kimi K3上線前在海外曾以Kivine為代號被眾多網(wǎng)友注意到。開源生態(tài)基金會Super Gemma創(chuàng)始人Jun Song評價(jià)稱,從生成的結(jié)果來看,“Kimi明顯比Opus強(qiáng)”,并認(rèn)為Kimi K3已經(jīng)達(dá)到了Opus 5的水平。
在架構(gòu)和基礎(chǔ)設(shè)施上,Kimi K3通過KDA、AttnRes等架構(gòu)升級和更高稀疏性的MoE設(shè)計(jì),提高長序列信息處理和模型擴(kuò)展效率,相比Kimi K2整體擴(kuò)展效率提升約2.5倍。
價(jià)格方面,Kimi維持分級計(jì)費(fèi)模式,但相比Kimi K2.6價(jià)格有明顯上漲。具體來看,Kimi K3每百萬token的輸入價(jià)格為20元(緩存未命中),較Kimi K2.6的6.5元上漲了約207.69%;緩存命中情況下的輸入價(jià)格為2元,較之前的1.1元也有所提升;而輸出價(jià)格則從27元上調(diào)至100元,漲幅約270.37%。![]()
相比頂級閉源模型,Kimi K3仍保持較低價(jià)格。以Claude Fable 5為例,其API輸入和輸出價(jià)格分別為每百萬token10美元(約合人民幣67.78元)和50美元(約合人民幣338.88元),明顯高于Kimi K3。
Kimi K3現(xiàn)已上線kimi.com、最新版Kimi應(yīng)用、Kimi API和Kimi Code編程助手,所有用戶可在免費(fèi)額度內(nèi)體驗(yàn),額度用完后需付費(fèi)使用。Kimi稱,Kimi K3的完整模型權(quán)重將于7月27日前發(fā)布。智東西也在Kimi K3 Max模式下進(jìn)行了多模態(tài)創(chuàng)意的實(shí)測。由于Kimi K3受到廣泛關(guān)注,使用人數(shù)不斷增多,智東西在進(jìn)行第2個實(shí)測時(shí)被告知暫時(shí)無法使用。
![]()
一、實(shí)測對標(biāo)Claude Fable 5,Kimi K3展示多模態(tài)創(chuàng)意理
智東西在Kimi K3 Max模式下測試了該模型的多模態(tài)與代碼生成能力,我們對Kimi K3下達(dá)的任務(wù)是要求其制作一個3D橫版的格斗游戲。
提示詞:制作一個單文件HTML的3D橫版格斗游戲,場景為被霸天虎入侵的破敗城市地圖,敵人為類人型賽博坦機(jī)器人,包含武器后坐力效果,采用低多邊形風(fēng)格并帶有卡通美學(xué)。游戲開始時(shí),玩家位于街道上,周圍有建筑廢墟;游戲中應(yīng)包含可被擊倒的細(xì)節(jié)物品,如汽車、樹木、石塊/瓦礫和自動售貨機(jī)。玩家可以選擇5種擎天柱陣營角色進(jìn)行游戲,并與5種霸天虎變種敵人戰(zhàn)斗,這些敵人會不斷生成,游戲?yàn)闊o限時(shí)間的沙盒模式。
![]()
從實(shí)測結(jié)果來看,Kimi K3僅用一次就完成了該游戲的創(chuàng)建,并且沒有出現(xiàn)錯誤。在游戲邏輯與元素還原上Kimi K3相較于之前的Kimi K2.6(下圖)都有較強(qiáng)的提升,主要表現(xiàn)在對提示詞的理解沒有像Kimi K2.6那樣出現(xiàn)讓玩家上下移動的情況,其次,在畫面的精細(xì)程度上,生成的人物更加接近提示詞要求,廢墟等環(huán)境都有出現(xiàn)。此外,在沒有提示的情況下,該游戲還為玩家提供了射擊和擊打2種攻擊模式。
![]()
AI領(lǐng)域記者Chetaslua對Kimi K3和GPT-5.6 Sol在3D內(nèi)容生成方面進(jìn)行了對比。他稱,兩款模型的差異不僅體現(xiàn)在輸出效果上,也體現(xiàn)在任務(wù)完成方式上。即便最終產(chǎn)出較為接近,二者采用的實(shí)現(xiàn)路徑仍存在明顯差異,他認(rèn)為Kimi K3在創(chuàng)意生成方面表現(xiàn)更突出。
![]()
海外網(wǎng)友之前用Kimi K3生成了一個達(dá)芬奇工坊”(Officina di Leonardo)模擬器,主題是達(dá)芬奇設(shè)計(jì)的撲翼機(jī)(Ornithopter)。
Kimi K3不僅復(fù)現(xiàn)了文藝復(fù)興工坊的視覺風(fēng)格,還理解了達(dá)芬奇撲翼機(jī)的歷史背景和工程細(xì)節(jié),將材料、結(jié)構(gòu)與空氣動力學(xué)知識融入生成結(jié)果,這說明該模型具備跨領(lǐng)域知識整合能力。
![]()
測評博主aditya在3D游戲生成任務(wù)中,將Kimi K3與GPT-5.6、Claude Fable 5、Grok 4.5同臺比拼,發(fā)現(xiàn)它們的性能不相上下,但Kimi K3單次調(diào)用成本僅0.71美元(約合人民幣4.81元),遠(yuǎn)低于GPT、Claude;更突出的是它能解決其他模型察覺不到的隱性問題。他認(rèn)為,開源大模型趕超頂尖閉源產(chǎn)品的速度遠(yuǎn)超行業(yè)預(yù)期。
開發(fā)者LASCHUK也實(shí)測對比了Kimi K3與Claude Fable 5,提示詞都是復(fù)刻蘋果官網(wǎng)、無額外輔助,兩款模型都能完成頁面開發(fā),但Kimi K3單次花費(fèi)僅0.44美元(約合人民幣2.98元),成本只有Claude Fable 5 0.94美元(約合人民幣6.37元)的一半;按百萬token計(jì)價(jià),Claude Fable 5定價(jià)遠(yuǎn)高于市面絕大多數(shù)模型,Kimi K3定價(jià)僅其三分之一,LASCHUK由此質(zhì)疑高價(jià)閉源模型的溢價(jià)價(jià)值。
![]()
二、從代碼開發(fā)到知識創(chuàng)作,Kimi K3展現(xiàn)復(fù)雜任務(wù)執(zhí)行能力
在編程領(lǐng)域,Kimi K3不僅能夠理解大型代碼庫、調(diào)用終端工具,持續(xù)完成長時(shí)間的軟件開發(fā)任務(wù),還能參與GPU內(nèi)核優(yōu)化、編譯器開發(fā)、芯片設(shè)計(jì)等高復(fù)雜度工程工作,并結(jié)合視覺理解能力完成游戲開發(fā)、前端設(shè)計(jì)等多模態(tài)編程任務(wù)。
首先,Kimi K3具備構(gòu)建完整工程系統(tǒng)的能力。Kimi展示了該模型從零開始構(gòu)建GPU編程系統(tǒng)的案例。它開發(fā)了類似Triton的編譯器MiniTriton,該編譯器可以將開發(fā)者編寫的程序轉(zhuǎn)換為GPU能夠執(zhí)行的代碼,并完成優(yōu)化和運(yùn)行,在部分場景下性能達(dá)到甚至超過現(xiàn)有工具。
![]()
其次,Kimi K3還融合了3D推理、編程與視覺能力。它能將概念、圖像和視頻轉(zhuǎn)化為完全可玩的交互體驗(yàn)。比如,Kimi K3生成的3D動畫游戲場景,里面是下雨天的森林,還包含湖泊,雨滴和馬匹以及人物等元素。
![]()
Kimi K3還能設(shè)計(jì)芯片。Kimi稱,在連續(xù)48小時(shí)的自主Agent運(yùn)行中,Kimi K3基于開源EDA工具和Nangate 45nm工藝庫,獨(dú)立完成了芯片的構(gòu)建、優(yōu)化與驗(yàn)證。
![]()
此外,Kimi K3還能將科學(xué)文獻(xiàn)中的方法轉(zhuǎn)化為可執(zhí)行代碼,完成從論文理解、代碼實(shí)現(xiàn)到實(shí)驗(yàn)分析的完整科研計(jì)算流程。
![]()
在知識生成領(lǐng)域,Kimi K3能夠自主搜集和分析大量資料,整合文獻(xiàn)、數(shù)據(jù)與工具,完成產(chǎn)業(yè)研究、科研分析、報(bào)告生成和可視化創(chuàng)作等任務(wù)。
下圖是Kimi K3生成的一份咨詢風(fēng)格的行業(yè)報(bào)告,這份報(bào)告包含交互式可視化圖表。圖表中包括時(shí)間線、漏斗、甘特圖等。
![]()
這是Kimi K3對GWTC-5引力波的分析報(bào)告,它使用20多個并發(fā)subagents分析了391個引力波事件,生成了7張科學(xué)可視化圖、2張表格,并綜合了10多篇論文的文獻(xiàn)內(nèi)容。
![]()
此外,Kimi K3還可以將技術(shù)概念轉(zhuǎn)化為動畫圖示和轉(zhuǎn)場。在這個案例中,Kimi K3制作了一支介紹自己架構(gòu)的「3Blue1Brown」風(fēng)格動態(tài)圖形講解視頻。
![]()
Kimi K3還能自己剪輯視頻。Kimi官方展示了該模型依托56段原始素材自主生成品牌宣傳視頻,獨(dú)立完成素材篩選、畫面動作匹配剪輯、卡點(diǎn)、音頻以及多輪迭代修改工作,較人工快上數(shù)天。
![]()
值得注意的是,Kimi K3還進(jìn)一步增強(qiáng)了模型交互的可視化和持續(xù)管理能力。基于Kimi K3,Kimi Work推出了“小組件”和“看板”功能。其中,小組件支持在對話中生成可交互內(nèi)容,并連接本地?cái)?shù)據(jù)或外部插件實(shí)現(xiàn)動態(tài)更新;看板則能夠集中管理多個小組件,形成圍繞項(xiàng)目、主題或目標(biāo)的長期工作空間。
![]()
三、多維評測驗(yàn)證,編程、Agent與視覺能力全面提升
在官方公布的評測結(jié)果中,Kimi K3在編程、Agent任務(wù)和視覺理解等多個方向展現(xiàn)出較強(qiáng)能力。
在編程能力方面,Kimi K3在超長時(shí)序持續(xù)開發(fā)SWE Marathon、軟件逆向Program Bench、終端運(yùn)維Terminal Bench 2.1等測試中表現(xiàn)突出。其中,SWE Marathon、Program Bench均取得第一,Terminal Bench 2.1達(dá)到88.3分,與GPT-5.6 Sol接近;在高難度軟件工程任務(wù)FrontierSWE中,Kimi K3以81.2分位列第二,僅次于Claude Fable 5。
![]()
在Agent和知識工作場景中,Kimi K3同樣展現(xiàn)出較強(qiáng)的任務(wù)執(zhí)行能力。在網(wǎng)頁深度調(diào)研BrowseComp、辦公自動化Automation Bench、Excel財(cái)務(wù)建模SpreadsheetBench 2等測試中取得領(lǐng)先,其中BrowseComp達(dá)到91.2分,Automation Bench和SpreadsheetBench 2均排名第一。不過,在綜合白領(lǐng)任務(wù)GDPval-AA v2、APEX-Agents等更貼近真實(shí)辦公流程的評測中,Kimi K3仍弱于Claude Fable 5等頂級閉源模型。
![]()
在視覺能力方面,Kimi K3在圖表理解CharXiv、文檔分析OmniDocBench等任務(wù)中表現(xiàn)較強(qiáng),其中OmniDocBench達(dá)到91.1分,超過參與對比的多款模型;但在部分視覺推理任務(wù)中,Kimi K3仍存在差距,例如零樣本視覺工具任務(wù)Zerobench低于Claude Fable 5。
![]()
Kimi內(nèi)部也測試了Kimi K3的工程能力。在GPU內(nèi)核優(yōu)化測試中,Kimi K3需自主完成代碼分析、內(nèi)核重寫和性能驗(yàn)證,覆蓋AttnRes、KDA、MLA等GPU計(jì)算任務(wù)。結(jié)果顯示,在最高推理強(qiáng)度下,Kimi K3表現(xiàn)接近Claude Fable 5(含回退機(jī)制),并超過Claude Opus 4.8、GPT-5.6 Sol和GPT-5.5。
![]()
在知識工作方面,Kimi內(nèi)部Internal Knowledge Work Bench測試顯示,在統(tǒng)一開啟最高深度思考模式后,Kimi K3在通用推理、深度文檔分析和金融專項(xiàng)三類任務(wù)中的表現(xiàn)均超過GPT-5.5和Claude Opus 4.8。
![]()
四、兩大架構(gòu)升級支撐3T級模型,推理成本仍可控
據(jù)官方博客介紹,從去年7月到現(xiàn)在,中間有9個月,Kimi模型始終保持著開源模型的規(guī)模上限,參數(shù)量一直在1萬億以上,而今天推出的Kimi K3是首個參數(shù)量達(dá)到2.8萬億的開源模型。![]()
Kimi K3的構(gòu)建主要基于這2項(xiàng)架構(gòu)更新:Kimi Delta Attention(KDA)和Attention Residuals(AttnRes)。更新之后的架構(gòu)可讓信息在更長序列和更深模型中流動得更順暢。同時(shí),Kimi K3進(jìn)一步擴(kuò)大了Mixture of Experts(MoE)的稀疏度:結(jié)合Stable LatentMoE框架后,該模型可以在896個專家中高效激活16個。
![]()
Kimi稱,再加上訓(xùn)練方法和數(shù)據(jù)配方的優(yōu)化,這些結(jié)構(gòu)性改進(jìn)讓Kimi K3相比Kimi K2的整體擴(kuò)展效率提升約2.5倍,能更有效地把算力轉(zhuǎn)化為能力。
在訓(xùn)練與部署上,該模型從SFT階段開始采用量化感知訓(xùn)練,使用MXFP4權(quán)重和MXFP8激活,并通過平衡專家并行訓(xùn)練提升吞吐。針對長上下文推理,Kimi團(tuán)隊(duì)還向vLLM社區(qū)貢獻(xiàn)了KDA相關(guān)實(shí)現(xiàn),使Kimi K3在2.8萬億參數(shù)和百萬token上下文條件下仍能控制推理成本。
在安全性和可靠性方面,Kimi稱目前Kimi K3仍存在一些使用限制。
一是由于Kimi K3是在保留思維歷史的模式下訓(xùn)練的,如果Agent框架沒有正確返回完整歷史內(nèi)容,或用戶在會話中從其他模型切換到K3,生成質(zhì)量可能變得不穩(wěn)定。
二是Kimi K3針對長期復(fù)雜任務(wù)進(jìn)行了強(qiáng)化訓(xùn)練,在用戶意圖不明確時(shí)可能表現(xiàn)得過于主動,因此官方建議在系統(tǒng)提示詞或AGENTS.md中設(shè)置更明確的行為邊界。
Kimi也承認(rèn),Kimi K3雖然具備較強(qiáng)競爭力,但用戶體驗(yàn)相比Claude Fable 5、GPT 5.6 Sol等頂級閉源模型仍存在差距。
結(jié)語:Kimi K3拉開超大開源模型序幕,搞定復(fù)雜工作完整交付
Kimi K3的發(fā)布,進(jìn)一步推動開源模型向超大規(guī)模邁進(jìn)。但相比參數(shù)規(guī)模的提升,Kimi K3更值得關(guān)注的是其在長程任務(wù)執(zhí)行上的探索。
從長時(shí)間代碼開發(fā)、GPU工程優(yōu)化,到產(chǎn)業(yè)研究、科研分析和多模態(tài)創(chuàng)作,Kimi K3展示了大模型從內(nèi)容生成向復(fù)雜任務(wù)執(zhí)行和完整工作流交付的延伸。
不過,隨著模型規(guī)模持續(xù)擴(kuò)大,如何進(jìn)一步提升推理效率、降低使用成本,并縮小與頂級閉源模型在實(shí)際體驗(yàn)上的差距,仍是開源模型后續(xù)發(fā)展需要解決的問題。
來源:Kimi、X
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.