Kimi正式發佈2.8萬億大模型K3,這是屬於我們的榮光。

數字生命卡茲克
數字生命卡茲克2026年7月17日
今天凌晨,Kimi K3,終於正式跟大家見面了。
2.8萬億參數,百萬上下文。
而且,官宣7月27號,全面開源。
沒啥可說的,讓我們此刻一起歡呼吧。
月之暗面昨天下午就發了預告,片子也非常的藝術,在他們心中,這是一個能證明自己、將整個月之暗面,帶向新一個時代的模型。
如果說智譜是做後訓練的神,把GLM-5系列帶到了一個全新的高度。
那在我心中,其實國內做預訓練的扛把子,一直都是Kimi。
而且一直都是大參數的代表。
K2是幾個月前國內第一個把模型推到1T級別的。
過去還有很多人說,大模型的Scaling Law要見頂了,要失效了。
可如今發現我們發現,大依然就是好,大依然就是牛逼,大依然就是智能。
就像我至今依然覺得Claude Opus 4.6是我心中最水桶級別的白月光,寫作創意認知Agent代碼能力都極強,因爲那可是個5T的模型啊。
後面Opus 4.7和4.8就強化學習一路強化歪了,Coding能力確實提升了,但是創意和規劃能力拉完了,非常明顯的一路下滑,口碑一路崩塌。。。
至於現在最牛逼的Claude Fable 5的參數量,目前沒人知道,但是跟一些朋友討論和猜測,可能到了10T級別,因爲現在Grok內部訓得最高參數量的模型也是10T級別,感覺應該差不多。。。
再把眼光放回到國內,Kimi之後,DeepSeek V4 pro和美團的LongCat 2.0也都邁入了萬億級別,逐漸的,萬億參數模型,已經快成了標配。
而今天,Kimi K3來了。
這一次,他們把模型的參數量推到了2.8T級別,這是國內的第一個3萬億參數級別的模型,而且更是全世界,第一個面向所有人開源的3萬億參數級別的模型。
開心,爲Kimi感到自豪。
老規矩,再看下Kimi K3的跑分。
先看AA給的智能分數,Kimi K3來到了第三,僅次於Fable 5和GPT-5.6 Sol,超過了其他所有的模型。
這一下,kimi代替Google,成爲新一代御三家了。。。
然後再看Coding。
也正好趁着這個機會,我想用這些評測集來結合我的體感,簡單給大家看看一個模型的性格和特點怎麼理解。
每個模型其實都是有自己擅長和不擅長的,強如Falble 5,其實也有短板,只不過它的短板的高度,比很多模型的長板甚至還要長。
先說Coding這塊,一共六個評測,其實我們可以把它們分成兩類來看。
第一類,我自己喜歡叫它精準執行型評測,大概就是測模型能不能精確地完成一個明確的任務,不多不少,不漏不錯。
你可以理解成老闆給你一個非常明確的任務清單,上面寫得清清楚楚要改什麼。這種任務考驗的就是精準度和執行力,你得理解需求、定位問題、精準修改、不引入新bug。
DeepSWE和Terminal Bench 2.1這兩個就是比較典型的,一個更偏純執行,一個更偏綜合性的執行。
GPT-5.6 Sol在這兩個評測中都拿到了第一,它在需求理解、環境操作、調試收斂和最終交付方面確實就是最穩的,跟我日常使用的體感是一致的。
至於Opus 4.8,幻覺率太高,我罵了很多回了,這個位置跟我體感也是一致。
而Kimi K3,在執行的精準度上,在DeepSWE上僅次於Claude Fable 5和GPT 5.6 Sol,而在Terminal Bench 2.1上,甚至拿到了第二名。
第二類評測就反過來了,我叫它方案規劃型。
比如FrontierSWE,這個測的是前沿級別的、特別難的軟件工程問題,需要創造性思考、深度理解複雜系統才能解決的問題。
Fable 5基本沒啥可說的,斷崖式領先所有的,GPT系列大家都知道創新型任務還有方案設計做的一直都很差,比Fable 5差了很多,是GPT系列的短板,而這次,Kimi K3直接一腳插在了Fable 5和GPT-5.6 Sol之間。
從這個就可以看出來Kimi K3的定位了,可以說非常的中庸之道。
也就是各方面都不錯,一個非常全面的水桶模型,在每一個領域裏,雖然都打不過那個最強的,但是總能排到第二或者第三。
坦誠的講,這樣的水桶模型,在日常使用中,反而體驗感可能會更好一些,我現在經常就是Fable 5和GPT-5.6 Sol來回切換,一邊做方案,一邊做執行,確實是目前最強組合,但是也麻煩啊。。。
更別提國內,有多少人用不上Fable 5的了。
海外還有人說,Kimi又是靠蒸餾啥的,但是講道理,這個級別已經不是蒸餾能蒸出來的了。
蘭伯特都看不下了,直接是這麼懟的。。。
我覺得非常有代表意義。
再來看很多人更看重的Agent能力,這個玩意主要跟Work強相關。
BrowseComp,測的是在瀏覽器環境下的複雜信息理解和處理,其實就是深度研究。你可以理解成“給模型一個瀏覽器,讓它自己去網上找信息、理解內容、完成任務”,K3拿了91.2,全場第一,GPT-5.6 Sol以90.4緊隨其後,Fable 5是88.0。
這個是kimi一貫的拿手好戲了,用過Kimi集羣的應該都感受過它的威力。
Automation Bench,測的是自動化任務的執行能力,把一系列操作串起來自動完成,K3也是第一,30.8。SpreadsheetBench 2,測的是電子表格處理能力,各種公式、數據清洗、報表生成,K3還是第一,34.8,Fable 5以34.7緊隨其後。
然後是接下來的三個綜合類的Agent任務。
AA-Briefcase Elo,這個是綜合性的Agent能力Elo評分,包含了各種辦公場景的任務,K3的1548排第二,僅次於Fable 5的1583。
JobBench,測的是完成具體工作任務的能力,K3的52.9也是第二,同樣僅次於Fable 5。
GDPval-AA v2 Elo,這是另一個綜合Agent評分體系。Fable 5以1760排第一,GPT-5.6 Sol以1748緊隨其後,K3是1668排第三,這是少數K3排在GPT-5.6 Sol後面的評測之一,但差距已經很小了。
從這幾個綜合類Agent的評測可以看出,在整體能力上,基本都還是比Fable 5差一些,跟GPT-5.6 Sol差不太多,互有勝負。
多模態這塊也得提一嘴。
Kimi的多模態是國內做的非常好的,在這方面,基本也就僅次於Falbe 5,Fable 5還是太強了。
突然有點自豪的感覺,以前我們說,國內的模型,跟Opus 4.7甚至都不說4.8掰掰手腕,大家都覺得你是個牛逼的大貨。
到了今天,我們發現,一個國產的模型,居然能跟GPT-5.6 Sol掰掰手腕了,好像Fable 5的背影,也沒有那麼遙遠了。
當然,GPT-5.6 Sol有它自己的特性在,這畢竟還是老模型強化的,不是新一代的預訓練模型搞出來的,Fable 5和Kimi k3都是全新的重做了預訓練的模型,鬼知道GPT-6出來的時候,會強的有多離譜。
我覺得如果你之前沒辦法用Claude,也沒辦法用GPT,只能用國內模型,那我今天非常推薦你開始用Kimi K3來處理你的所有工作,感受一下全新的3萬億級別的新一代模型的智力。
同時,我對國內的算力水平也不抱有任何期望,這種參數的模型,我覺得對Kimi來說,推理成本也是個巨大的挑戰。
所以我覺得,趁着現在,可以抓緊買個Kimi的Coding Plan,我感覺後面會跟GLM一樣買不到了。。。
坦誠的講,國內的模型我付費的很少,這次的Kimi K3真的也是我爲數不多的先氪爲敬的一個模型了。
我是699的會員,跑了一夜,各種測試任務還有多Agent的真實環境的開發,燒了這麼多Token,大家可以參考下。
在實測上,我覺得也是讓我沒有失望的。
我自己的體驗上,幾乎跟Kimi發出來的跑分體感一致,是一個綜合型的模型,每個地方都還不錯,可能達不到Fable 5經常給你的那種神之一手的感覺,但是也是可以把項目和規劃放心的交給他。
這次的測試上,我也沒有用Claude Code,因爲我覺得,在當今的時代裏,你的模型配上一個harness框架,纔是一個完整的產品,而且你自家的模型,配上自己的框架,肯定纔是最適配的。
所以我這次直接用的Kimi Code來跑的Kimi K3。
這裏插一句,Kimi Code其實也是有圖形界面版的,只不過他們還沒做類似Codex的那種客戶端,現在還只是一個web版。
想打開這個界面也特別簡單,直接在終端裏輸入kimi web就能啓動。
主要是當你用習慣Claude和Codex的客戶端之後,我真的不想再用CLI界面了,怎麼用怎麼彆扭= =
這次Kimi K3,還有個比較大的更新,就是上下文長度終於來到了100萬。
這個還是比較爽的,100萬現在基本也都是大家的標配了。
我讓它做的第一個事情,就是我發現,不知道爲啥AIHOT沒有抓到Kimi K3發佈的blog,所以就讓Kimi K3修一下,沒有抓到自己的問題,看看BUG出在哪裏。。。
這種感覺,又何嘗不是一種NTR呢。
發過去之後,它就立馬去找了。
接着發現了原因,是Kimi自己的官方Blog又改版了,而且就是前兩天的事。
emmmmm,然後發現我們的告警是14天斷流才告警,K3果斷給我改成了3天,然後把那個Blog給修復了一下,3分鐘修復完,正確出現在了AIHOT上。
然後還有一個複雜點的任務,是根據用戶的反饋,來優化我的AIHOT。
我的飛書每天會把用戶在AIHOT上提報的反饋推給我,比如就像這樣。
每個反饋都有一個序號,我一般都會每天過一遍,然後把說的對的,扔給Agent來去修。
這兩天正好有點忙,攢了一批,我就一次性,全部扔給Kimi Code了。
這個事你說簡單也簡單,說複雜吧也複雜,有將近10個任務,每個任務其實差異挺大的,基本都不搭嘎。
而且你還需要有一定的方案設計能力,還有判斷能力,並不是用戶說啥都是對的,而且也比較看長程和多Agent的規劃能力。
我就直接發給它了。
然後,他就讀了我的運維文檔,找到了我的服務器鏈接方式,連上去,看到了用戶的反饋。
然後,給自己列了7個待辦。
開啓了8個Agent,開始研究。
有一說一,Kimi的審美是真的好,這個Kimi Code的UI展示,我是真的喜歡,非常清晰+一目瞭然。
研究完以後,發現只有7個值得做,然後,又開了7個工作區開了7路Agent去進行執行。
在開發了大概1個半小時之後,所有的任務全部開發完畢,提了PR過了CI,合併到了主分支裏。
2個小時以後,全部做完了。
我看了一眼郵件,是真的都用我的飛書郵箱都給我發出去了。。。
完成的非常好,流程全部做完,沒有任何BUG,該完成的也都完成了,不該完成的兩個任務,也給我做了說明。
除了執行上,在方案設計上,我也把K3的方案和GPT-5.6 Sol的方案扔給Fable 5去評選,測了幾個任務,跟GPT-5.6 Sol大概是55開的級別,思考的維度和方面確實都是有差異的。
比如這個服務器性能優化的任務,最終Fable 5雖然選的是方案二也就是Kimi K3的方案,但是發現GPT的方案裏也有Kimi 沒考慮到的,大家都差不多,最終都還是得合併一下效果纔是最好的。
不過我在測試過程中,也遇到了一個小差距,就是K3有一個細節問題沒考慮到,但是正常過了CI上了線,導致AIHOT出現了將近1個小時的沒有任何新資訊進站。。。
這個細節也特別簡單,就是我在讓它做熱點榜單,背後加了大概500個熱點信源,這些熱點信源你可以理解爲是我們線上現在監控200多個精選信源的氣氛組,就看什麼事件被討論的最多的,從而評選出當前熱點。
K3非常勤勤懇懇的做完了所有的任務,推了PR,過了CI,部署上線了。
但是呢,我們網站的系統是有性能限制的,一個信息進來,要經過結構化處理 - 實體提取 - 預篩 - 正文清洗 - 精選評分 - 向量化處理 - 事件聚簇 - AI摘要等等等等,中間光大模型的調用就有好幾次,所以是有隊列這麼一說的,我們同時併發最多是處理6個資訊,一般一個資訊也就20、30秒就處理完了,平時我們是完全沒有問題的。
K3開發完了熱點之後,直接一次性把那500個熱點信源也按我們過去新監控信源的規則進行回補,直接懟了9000條信息進來,於是直接把AIHOT的信息處理隊列給堵滿了,後續進來的所有精選信息都在這9000條後面排隊,於是,就變成了AIHOT將近1個小時沒有任何抓取。。。
就這麼一個隊列併發沒有考慮到的事,但是背後的本質折射的確實我們現在的併發處理不了500條以上的新聞信源,所以這個方案必須要推倒重來,不能這麼設計,這就是現在很多模型,在做方案設計的侷限。
不過這種事,我覺得除了Fable 5之外,感覺其他的模型都很難考慮的非常全面,GPT-5.6 Sol我試了下,也完全沒有考慮到。
不過整體來說,在我這幾個小時的體驗上,在開發的精準性和完整性上,還是符合我的預期的,國內最佳,沒有之一。
而前端任務上,基本就是Kimi最擅長的舒適區了,Kimi這家公司,一直以來的審美就是真的很強,再加上Kimi自身的多模態能力,這一次K3在前端效果上,又迎來了一波飛躍。
這裏我先必須給大家看兩個,官方的前端Show Case,秀麻了。

這兩個視頻看完,我覺得都不需要我用言語來解釋什麼了,空間理解能力實在是太強了。
而且在平面的審美上,效果也很好。
我也用Kimi K3復刻了幾個最近很火的前端效果,可以說,在One Shot提示上,我個人覺得,作品的完成度和審美程度,是僅次於Fable 5的。
比如最近推特上有個作品特別特別特別火,就是一個建築的屋檐,下面掛着密密麻麻的豎排文字線繩,像珠簾一樣自然垂下來,你鼠標划過去或者手指撥過去,字體會像門簾一樣被撥動搖擺。
我就拿K3復刻了一個。
Prompt也特別簡單。
第一版出來其實就已經有那個意思了,整體的雛形是對的,但是細節上還比較粗糙。
我又提示了一下之後,搞定。

效果無敵好。
還有一個小紅書上一個非常棒的作品,我特別特別喜歡。
我就直接把教程截圖發給了K3,讓它復刻一下,看看K3的效果怎麼樣。
10分鐘左右,直出了一版,有一些小細節需要優化,我就用提示調整了一下粉魚的尺寸和遊動速度,還有藍魚的數量,還加了個BGM。
又過去大概10分鐘之後,你們自己看效果吧。

小粉魚最後被一羣藍魚最後裹挾着消失的時候,我突然一下感受到了一些身不由己的感覺。
這個我讓GPT-5.6 Sol也復刻了一下。
結果。。。
我只能說,GPT的審美,咱還是期待GPT-6吧。。。
K3在前端上應該還可以玩出非常多的花活,我時間沒有那麼多,大家如果有做出來好玩的也可以放在評論區交流~
除了Coding和審美之外,還有一個東西,我知道肯定是很多人比較關心的,也是我比較關心的,就是寫作能力。
這塊我簡單測了一下,比如我把我上週發的那篇設計人生前面大半部分給他,讓他用我的Skill續寫紅線後面的結尾。
K3寫的結尾是這樣的。
當最下面那句“祝你也逼出一點,早該被自己聽見的話”的時候,我就感覺完犢子了。
又測了一些後,我的結論非常簡單,如果你能用上Claude,那麼最好的寫作模型還是Claude Opus 4.6,吊打世界所有,如果你用不上,只能用國內的模型寫作的話,那就用DeepSeek V4 pro吧。
總體來說,K3讓我極度驚喜的,K3比我預期的效果,還要好。
不過這麼大的參數,沒辦法的一點就是,價格肯定便宜不了。
API價格基本跟Sonnet系列對標。
如果想買Coding Plan的,感覺得快點去買,要不然算力限制,我感覺大概率後面會跟GLM一樣限購,可能就又搶不到了,今天朋友圈我也發了一下。
整體K3大概就是這樣。
最後說點感性的。
2023年我剛開始做AI內容的時候,那個時候,國產模型跟GPT-4之間的差距,說實話是肉眼可見的鴻溝。
那個時候,我們聊國產AI,多多少少還是有一些,不知道怎麼追的感覺。
三年多過去了,這個行業發生的變化大到超出了所有人的預期。
我們當然跟海外頂級模型依然有差距。
但是,現在,我們有DeepSeek R1的驚鴻一瞥,有了GLM-5.2在海外口碑的驚天逆轉。
今天,我們又有了Kimi K3。
總是想起2025年DeepSeek R1發佈時,馮驥的那段話。
這些,都是國運。

無論多少風雨。

未來也必定。

國運昌隆。

以上,既然看到這裏了,如果覺得不錯,隨手點個贊、在看、轉發三連吧,如果想第一時間收到推送,也可以給我個星標⭐~謝謝你看我的文章,我們,下次再見。

>/ 作者:卡茲克

>/ 投稿或爆料,請聯繫郵箱: [email protected]