前幾天,7月24日,黃仁勳發了自己在X上的第一篇帖子。
7月17日凌晨,Kimi K3正式發佈。
2.8萬億總參數,1040億激活參數,原生視覺能力,100萬Token上下文。
最關鍵的是,Kimi當時就承諾,模型權重會在7月27日(也就是昨晚)正式開源。
一箇中國團隊,在算力遠沒有那麼寬裕的情況下,做出了一個能力逼近全球最強閉源模型的東西,還要把權重交給全世界。
也就在這個時間點,黃仁勳站出來了。
他接受採訪,公開反對封禁中國開源模型。
兩天以後,他發出了人生第一條X,用一封公開信告訴華盛頓,開放模型關乎美國的創新、競爭、安全和技術主權,你不能封禁,不能制裁,我們得鼓勵開源。
公開信剛發佈的時候,簽名的有25家公司和組織。
英偉達、微軟、Meta、IBM、戴爾、Palantir、Mistral、Hugging Face等等等等。
到了週末,名單開始瘋狂變長。
OpenAI來了,Google來了,SpaceX來了,AMD、Cisco、Cloudflare、GitHub、Linux Foundation、Mozilla、Vercel、Y Combinator、OpenClaw等等,也全都來了。
結果。
模型權重,開源。
詳細的技術報告,也放出來了。
訓練K3用到的關鍵Infra,也開源。
全都開。。。
我大概列舉一下。
Kimi K3模型權重,一個2.8萬億參數的MoE模型,一共有896個專家,每個Token激活其中16個。
然後是K3完整的技術報告,一共47頁。
這裏面公開了KDA和Attention Residuals的架構細節,解釋了他們如何用3比1的比例混合KDA與Gated MLA,如何讓信息跨越幾十層繼續流動。
還有Stable LatentMoE。
896個專家只激活16個,稀疏程度高得離譜,Kimi又用SiTU GLU、Quantile Balancing這一整套方法,把這種極端稀疏的訓練維持在穩定狀態。
還有MoonViT V2、百萬Token上下文的強化學習基礎設施、大規模任務合成、後訓練方法,接近20個內部評測集的完整結果也放了出來。
這個技術報告很詳細和紮實,推薦一讀。
除了技術報告之外,還有開源的關鍵infra技術。
MoE訓練時,經常會出現某些專家忙得要死,某些專家閒得摳腳,最後所有GPU都得等最忙的那一張卡。
MoonEP會根據當前路由結果,動態複製一小部分熱門專家,讓每張卡收到完全一樣數量的Token,同時維持靜態內存形狀,避免訓練越跑越碎,最後直接OOM。
這已經屬於超大模型訓練裏非常底層、非常值錢的東西了。
它用CUTLASS實現,在英偉達H20上,相比flash linear attention基線,prefill速度提升了1.85倍到2.31倍,還可以直接接進現有的flash linear attention後端。
再往下, 還有AgentENV。
這是Kimi和KVCache.ai一起做的分佈式Agent沙箱系統,也是K3做大規模Agent強化學習時真正跑環境的那層底座。
它可以在一堆機器上同時啓動海量Firecracker微虛擬機,環境恢復低於50毫秒,暫停低於100毫秒,還原生支持快照、恢復和fork。
一個Agent跑到某個關鍵節點以後,可以直接分叉成幾十條互不干擾的軌跡,繼續並行探索。
雖然我對底層技術不是很瞭解,只是紙上談兵的一些淺薄知識,但是從這幾個技術來說,我覺得已經能感受到真香了。
真的就是掏老底了。
MoonEP解決超大MoE模型的通信和負載。
FlashKDA解決新注意力架構的算子效率。
AgentENV解決Agent強化學習需要的海量真實環境。
開源社區要起飛了。
如今,我願將Kimi和DeepSeek並稱爲開源二聖。
我也讀了一下這次Kimi K3的許可證。
普通研究者、開發者和公司,可以免費使用、複製、修改、部署、微調、分發,也可以做衍生產品和商業化。
它只給超大規模商業使用留了兩道門檻。
如果你做模型服務生意,公司及關聯方連續12個月總收入超過2000萬美元,需要另行和月之暗面籤協議。
如果使用K3的商業產品月活超過1億,或者單月收入超過2000萬美元, 產品界面需要顯著展示Kimi K3。
對,需要顯著展示Kimi K3就行。
菩薩啊。。。
已經有人說,如果Kimi K3能給他帶來單月2000萬美元的收入,別說顯著展示Kimi K3的品牌標識了。
他可以把Kimi的logo紋在屁股上,甚至可以紋兩個。
今天這晚,隨着Kimi K3的開源,我感覺把整個事件,推向了最終的高潮,輿論基本一邊倒。
也在Hugging Face中,創造了歷史。
這一刻,美國的態度,和Kimi K3開源,有了一種神奇的化學反應。
未來,這件事有可能被史稱爲:
AI行業的薩拉熱窩事件。
這個世界,需要開源。
老黃他們擁抱開源,當然除了理想之外,還有很多金錢的氣息。
一個東西的互補品越便宜,人們對這個東西的需求就越大。
英偉達賣GPU。
開源模型越多,全球就有越多公司願意自己部署、自己微調、自己訓練,最後需要的GPU也越多。
AMD、戴爾、雲計算公司、推理服務商,邏輯差不多。
GitHub、Vercel、Replit、LangChain、OpenClaw這些開發工具和應用平臺,也天然希望底層模型越來越多、越來越便宜、越來越容易替換。
因爲模型成本每降一塊錢,應用層就多出一塊錢的空間。
我們沒有突然變成天才。
我們只是,不用從零再走一遭。
開源真正厲害的力量就在這裏。
一個團隊花掉巨大算力、無數大佬熬了很久纔得到的東西,一旦公開,第二天就會成爲全世界無數普通人的公共起點。
我覺得,這就是文明的複利。
最後,向所有爲人類世界、開源世界、AI世界的大佬們。
致以我最崇高的敬意。
謝謝你們。
以上,既然看到這裏了,如果覺得不錯,隨手點個贊、在看、轉發三連吧,如果想第一時間收到推送,也可以給我個星標⭐~謝謝你看我的文章,我們,下次再見。
>/ 作者:卡茲克
>/ 投稿或爆料,請聯繫郵箱: [email protected]