一、
這兩天,大家都被 Kimi K3 [1] 刷屏了吧,到底應該怎麼看待這個史上最大開源模型?
我來說說我的看法,分成幾點。
首先,它的性能是否真的接近 Fable 5?
根據多個國外機構的測試,以及我自己的測試(附在後文),我認爲是真的。
Arena AI 把它列爲互聯網開發的 第一名 [2] 。注意,這只是比較前端編程,其他方面還是 Fable 5 領先。
獨立評測機構 Artificial Analysis 把它列爲 第三 [3] 。
其他的幾種測試,比如辦公能力 GDPval v2 [4] 、寫作能力 Writing Elo [5] 、氛圍編程 BridgeBench [6] 、全棧編程 Next.js [7] 的測試,它都排名前三甲,甚至第一。
我認爲,可以確定它自己在發佈公告中的定位是可信的,即實力略遜於 Claude Fable 5 和 GPT 5.6 Sol,但是強於 Claude Opus 4.8。
二、
爲什麼它的能力突然變強了?
它的上一個版本 Kimi K2.7 Code 是6月12日發佈的,表現只能說是普通,在 Artificial Analysis 排名中僅僅位列17。
爲什麼僅僅過去了一個月,就有這樣巨幅的提升呢?
比起以前的版本,K3 最大不同就是參數數量從 1T 增加到了 2.8T,這大概就是它能力飛躍的原因。
這個 2.8T 的參數數量是空前的,遠遠多於其他開源模型,足以跟國外旗艦比肩。
我們知道,參數數量代表了大模型計算 Token 時,所要考慮的因素。參數越多,就表明模型所考慮的因素越多,一般來說,生成的效果就越好。
三、
那麼, Kimi 如何減少計算量?
我們知道,參數越多,意味着計算量越大,從而模型的使用成本會大幅上升,響應時間也會變長。
所以,真正困難的不是增加參數,那隻要爲方程式擬合更多變量就行了,而是如何控制計算量,不讓它隨着參數數量增長而爆炸。
Kimi K3 爲了減少計算量,充分利用了“專家混合模型”(MoE)架構。這個架構在每次運算時,只需要激活一部分參數,從而降低運算量,而 Kimi 讓激活率進一步減小。
目前爲止,他們還沒有激活參數的數量,發佈報告只提到這樣一段話:
“我們還擴展了專家混合模型 (MoE) 的稀疏性,當與 Stable LatentMoE 框架結合使用時,能夠有效激活 896 位專家中的 16 位。結合改進的訓練和數據處理方法,這些結構性變化使得整體擴展效率相比 Kimi K2 提升了約 2.5 倍,從而使模型能夠更有效地將計算轉化爲智能。”
根據這段話,Kimi K3 有896位專家,相當於每位專家對應 3.13B 參數(2800/896),那麼激活16位專家,就相當於激活 50B 參數。
這段話還說,k3 比 k2 的效率提升2.5倍。K2 共有 1T 參數,激活 32B,效率是 3.2%,除以2.5就是1.28%,相當於 2.8T 參數激活 36B。
不管 50B 還是 36B,都表明 Kimi K3 是一個相當稀疏的模型,激活參數的比例變得更小,所以公告才說“我們擴展了專家混合模型 (MoE) 的稀疏性”。
因此,K3 的實際運算量並不像表面看上去那麼大。
四、
Kimi 還使用了其他降低運算量的方法 ,除了增加參數稀疏度以外。
K3 這一次的上下文窗口也變大了,從 256K 增加到 1M,這會增加顯存佔用。他們採用一種叫做 Kimi Delta Attention(KDA)的方法,隨着新的上下文加入,會動態刪除一部分過去的信息,從而減低顯存佔用。
另外,大家知道,模型分成好多層,如果每一層都進行運算,很耗費算力。他們使用 Attention Residuals(注意力殘差)技術,動態選擇跳過一些層,這樣也就節省了算力。
我對這些技術的細節也不懂,沒法談得更深入。總之,通過種種方法,Kimi K3 極大地減少運算量,從而使得超大的參數規模不至於帶來可怕的成本。
五、
即使如此, Kimi K3 的使用成本還是很貴 。你應該有心理預期,這是一個費用較高的模型。
它在國內的 API 定價是百萬 Token 輸入輸出價格爲20元/100元,比上一個版本 K2.7 Code 的6.7元/27元翻了好幾倍,比國內的其他模型貴出很多。我覺得,它應該是目前國內最貴的模型了。
它在海外的 API 定價是3美元/15美元,與 Anthropic 公司的 Claude Sonnet 系列模型處於同一價格水平,也是迄今爲止在海外賣得最貴的中國模型。
由於定價較高,它的每次任務的成本不低。根據 Artificial Analysis 的報告,它的每次任務的成本是0.94美元,與 GPT 5.6 Sol(1.04 美元)相近,但還是比 Claude 模型便宜很多,約爲 Claude Opus 4.8(1.80 美元)的一半,更不要談 Claude Fable 5 了。
好消息是,每個任務的 Token 消耗量下降了,K3 比 K2.6 減少了21%的輸出 Token,這樣有助於節省費用。
六、
下面就是我對 Kimi K3 的測試。我參考一篇國外的 評測報告 [8] ,把同樣的測試題讓 Kimi K3 跑,直接跟現有的結果比較就行了。
我選擇兩個國外目前頂尖的旗艦模型 Claude Fable 5 和 GPT 5.6 Sol,作爲 Kimi K3 的比較對象。
所有測試的結果都上網了,點擊鏈接就能查看。
測試一:生成一個 DOOM 式的 3D 迷宮,有天花板、地板和磚牆,以第一人稱視角,可以用 WASD 四個鍵上下左右移動。
[提示詞] First-person raycaster you walk with WASD, shaded walls with depth, floor and ceiling, collision.
Claude Fable 5 [9]
GPT 5.6 Sol [10]
Kimi K3 [11]
大家可以點進去比較一下,覺得哪個更好?
我認爲,第一名是 GPT 5.6,跟原始遊戲 DOOM 最接近,加入了槍和準星,右下角還有小地圖。
Kimi K2 排名第二,迷宮感覺足,操作流暢。Fable 5 排名第三,非常普通,它的道路不知爲何特別窄,前進的時候臉都要貼着磚頭。
七、
測試二:生成一個三維魔方的遊戲,可以用動畫形式,一步步展示自動打亂和還原魔方的過程。
[提示詞] Build a colorful, 3D-looking Rubik's Cube with Scramble and Solve buttons that visibly animate the rotations.
Claude Fable 5 [12]
GPT 5.6 Sol [13]
Kimi K3 [14]
這一輪,GPT 5.6 明顯墊底,生成的魔方毫無質感。其他兩個很難分出高下,魔方都非常逼真,動畫流暢。
八、
測試三:生成一個可以運算的計算器。
[提示詞] Digits, operators, clear, equals, correct operator precedence, real calculator look.
Claude Fable 5 [15]
GPT 5.6 Sol [16]
Kimi K3 [17]
這一輪,三個計算器都能正常工作,但是細節方面都有缺失。
GPT 5.6 各方面比較均衡,但是樣式普通,Kimi K3 最漂亮,但是 C 鍵太長了,而且缺少退位鍵,可以並列第一。Fable 5 不知爲何多出了一個空的鍵位,只能排在後面了。
九、
測試題:生成一幅 SVG 圖片,內容是馬騎着宇航員,在月球上奔跑。
[提示詞] Draw a SVG (no raster, no libraries) of a scene: a horse riding piggyback on an astronaut walking on the moon.
Claude Fable 5 [18]
GPT 5.6 Sol [19]
Kimi K3 [20]
這一輪,Fable 5 明顯是最好的,不僅畫面準確和形象,還多出了旗幟和對話。
Kimi K3 排名第二,動物形象很逼真,我猜有人可能更喜歡這個實現。GPT 5.6 比其他兩個差一點,馬和宇航員的形象都挺奇怪的。
十、
通過以上四個測試,可以看到,Kimi K3 的表現,完全不比那些旗艦模型遜色,比起上一個版本進步顯著。參數數量的增大,確實對模型效果有很大幫助。
你可能會說,這些題難度不高,不足以看出模型的能力。但是橫向來看,Fable 5 也就那麼回事,並沒有明顯高出其他人一大截。
考慮到 Kimi K3 的價格不到 Fable 5 的三分之一,有這樣的表現,加上權重開源,可以自由部署,這會不會讓 Anthropic 公司創始人達里奧·阿莫迪(Dario Amodei)晚上睡不着覺,希望如此吧。
Kimi K3 的 2.8T 參數,相信只是一個開端,拉開了中國開源模型走向大型化的序幕,未來以 T 爲參數單位的模型必將層出不窮。只要算力跟上,國產開源模型趕上並超越國外旗艦模型是完全可能的。
(完)
References
[1]
Kimi K3:
https://www.kimi.com/blog/kimi-k3
[2]
第一名:
https://arena.ai/leaderboard/code/webdev
[3]
第三:
https://x.com/ArtificialAnlys/status/2077832874183860404
[4]
GDPval v2:
https://artificialanalysis.ai/
#gdpval
[5]
Writing Elo:
https://x.com/Whats_AI/status/2077860441380798908
[6]
BridgeBench:
https://x.com/bridgebench/status/2078109314074443846
[7]
Next.js:
https://nextjs.org/evals
[8]
評測報告:
https://www.tryai.dev/blog/gpt-5.6-build-off-12-models
[9]
Claude Fable 5:
https://d1md4c6gq9re9p.cloudfront.net/blog/gpt-5.6-buildoff/raycaster/claude-fable-5/attempt-1.html
[10]
GPT 5.6 Sol:
https://d1md4c6gq9re9p.cloudfront.net/blog/gpt-5.6-buildoff/raycaster/gpt-5.6-sol/attempt-5.html
[11]
Kimi K3:
https://ruanyf.github.io/ai-test-case/kimi-k3/case01/index.html
[12]
Claude Fable 5:
https://d1md4c6gq9re9p.cloudfront.net/blog/grok-4.5-buildoff/rubiks-cube/claude-fable-5.html
[13]
GPT 5.6 Sol:
https://d1md4c6gq9re9p.cloudfront.net/blog/gpt-5.6-buildoff/rubiks-cube/gpt-5.6-sol/attempt-5.html
[14]
Kimi K3:
https://ruanyf.github.io/ai-test-case/kimi-k3/case02/index.html
[15]
Claude Fable 5:
https://d1md4c6gq9re9p.cloudfront.net/blog/gpt-5.6-buildoff/calculator/claude-fable-5/attempt-1.html
[16]
GPT 5.6 Sol:
https://d1md4c6gq9re9p.cloudfront.net/blog/gpt-5.6-buildoff/calculator/gpt-5.6-sol/attempt-1.html
[17]
Kimi K3:
https://ruanyf.github.io/ai-test-case/kimi-k3/case03/index.html
[18]
Claude Fable 5:
https://d1md4c6gq9re9p.cloudfront.net/blog/gpt-5.6-buildoff/svg/claude-fable-5.png
[19]
GPT 5.6 Sol:
https://d1md4c6gq9re9p.cloudfront.net/blog/gpt-5.6-buildoff/svg/gpt-5.6-sol.png
[20]
Kimi K3:
https://ruanyf.github.io/ai-test-case/kimi-k3/case04/horse-astronaut-moon.svg