Kimi K3,我關心的三個點

昨晚 Kimi K3 發佈後,我看到參數量真的很意外,當時有點激動,隨口發了一條推。
我個人也不喜歡天天震驚體,而且我很少用「震驚」形容一個模型,之前今年唯一的一次,是在吐槽 GPT 5.6 的極醜審美,那個醜是真的震撼到我。
其實我最大的意外是,K3 的模型參數已經來到了 2.8T,我原以爲這個參數規模的開源模型,要等到 Q4 纔會有,因爲這是很多國內模型下半年最重要的計劃,而 Kimi 在 7 月中旬已經訓練完成了(通常實際訓練完成的時間比發佈時間更早,很有可能是在 6 月就訓練完成的)。
有人從推理速度和價格推斷,Opus 模型的參數量大約是 2.5T,馬斯克有一次說大概是 5T,都不一定準確,但大概率就是在 2-5T 之間,GPT 5.6 Sol 也差不多這樣,大差不差。
而 Mythos/Fable 明顯是 next level 的模型參數量,很多人預估接近 10T,估計下個月發佈的 GPT 6 也會差不多。
所以我說,K3 這個參數量,已經達到了 Opus 的級別,代表了中國開源模型追平了今年年初 Opus 4.5/4.6 的參數量。也就是說中國模型距離世界一線開源模型的差距,可能縮短到了半年左右。
訓練超大參數模型這件事絕非易事,預訓練做大,除了需要很多錢之外,還需要充足的算力是多次的試錯,參數量翻1倍,訓練成本和風險可能要翻3倍。一次訓練崩掉,數千萬美元可能就蒸發了。
這就是爲什麼 K3 的發佈,意義是非常重大的,因爲在今年上半年, Opus 是一座高山,人人都說超越 Opus,但要真正超越 Opus,2T 以上的參數幾乎是必須的,全球能把模型訓練到這個規模的公司也是一隻手能數的過來的。
K3 是第一個有望全面對齊甚至在部分領域超越 Opus 的開源模型。
如果真的如此,那 K3 就把大模型兩個代差縮短到了一個代差。
這也是爲什麼我會說,Kimi 接下來的模型,是要照着 Fable 去了。
越過一座山丘,望向下一座更高的山,next level。
模型的指標方面,其實業界都知道指標意義沒那麼大,看看就好,相對和體感比較共識的是 AA 的指標,Kimi K3 排名第三,能和世界頂級的兩個模型 Fable 5 和 GPT 5.6 Sol 掰掰手腕。
一個模型的真實能力,最終還是得放到真實的複雜項目裏實測一段時間才能給出論斷,所以姑且再用幾天再給出結論。
像 Coding 和 Agent 這類的的指標相對客觀,大家可以參考一些指標來做判斷,不過在 Coding 之外,我確實還有三個特別關心的點。
這個我真的很 care,模型本來就有幻覺,很容易順着人的話往下走,這樣的模型會給人也造成很大的幻覺。
比如我們把一句有爭議的話,放到美國豆包 Gemini 裏試試
emmm,就很美國豆包,用更通俗的話來說,就是極度諂媚。
我們再放到 Kimi K3 裏試試,模型明顯在以獨立思考的方式來判斷,並且指出了這句話的盲區。
在此之前,獨立思考最強的模型是 Opus,連 GPT 5.6 都有一點略帶迎合。
雖然大家都知道 coding 是第一生產力,但程序員這個羣體的 AI 滲透率已經很高了,人羣也就那麼少,Agent 最終突破 DAU 還要靠白領,白領的工作裏就是有很多文字工作。
之前的開源模型,在 coding 方面有些能達到 Opus 水平,但沒有一個能在寫作方面接近。
要寫好一篇文章,比想象的更難,因爲缺乏明確的獎勵信號,也沒有人專門去訓練這方面的能力(相比 coding,ROI太低了),一般都是靠模型參數和語料的 scaling 自然變好。
現代模型都太厲害了,寫的文章信息密度過高了,看起來都很難受,我想到可以讓他們寫散文來測試文風。
這是我讓 K3 和 GPT 5.6 Sol 對同一個主題寫的一篇散文,都讓他們寫完之後第一版之後反思 AI 味兒再寫第二版。
散文寫得很有畫面感,不是流水賬也不是議論文,同時一些詞的用法非常之地道。
下面這篇是 GPT 5.6 寫的,可以對比感受下。
另外令人意外的是在海外的英文寫作評估中,Kimi K3 竟然超過了 Fable 5,這也是第一次有開源模型成爲寫作領域的第一。
第三個我在意的點,就是模型的產品設計能力和工程能力。
在用 K3 的時候,我能明顯感覺到模型的「雄心」,它具備自主規劃長程任務,且不怕給自己找麻煩的能力傾向。
我讓它基於1000條筆記做一個筆記成長看板,它發現我沒給它筆記之後,爲了真實模擬,先給自己安排了任務,生成了1000條筆記(這種認真的態度大爲震撼)。
在設計看板時,它自己規劃了超過5種成長系統的展現方式,這些都不是我要求的,是它主動給自己加的難度。
在進行風格設計方面,只需要說清楚參考標的,整個網站的風格都會自主設計,並且遇到素材不足時,會自動創建素材。
這是成品的視頻演示,審美也是極好的,我給的參考是幾個遊戲的名字,它自己總結的風格是「
冒險手帳風」。
海外那邊,Arena 的前端盲測,Kimi K3 甚至超過了 Fable 5 成爲最強前端模型,可見審美的調教很有水平。
價格方面,Kimi K3 對齊了 Sonnet,是 Opus 的三分之二,我認爲是個公允的定價,但直接用 API 一般人消費不起,還是建議大家去買個 Coding Plan 來用,根據我對國內算力的預估,這個很快也會和 GLM 一樣限購。
總而言之,Kimi K3 是綜合模型實力達到世界第一梯隊的模型,也
已經成爲我日常的模型選擇之一,
值得在真實的項目裏多試試。
更多文章
- 太震驚了,Kimi K3 竟然是一個超大的 2.8T 的開源模型。
2.8 T 這個參數量可能已經超過了 Opus...照着 Fable 去了
這是很多國內公司在下半年的計劃...現在 Kimi 已經訓出來了
中國開源模型距離世界一線模型的差距可能已經減少到 6 個月內
- Cola 全新改版,沉浸地去創造吧!
- A 社的算盤是,Fable 5 太佔 GPU 了,他們 GPU 又不夠,因此放 coding plan 裏沒有 ROI,就搞了個限時體驗,然後按 API 的售價銷售並且大賺。
結果 GPT 5.6 sol 出了,把用戶都搶走了,Fable 5 的 GPU 問題也徹底解決了,那就繼續放在 coding plan 裏吧。
一個物品的價格是由可替代品決定的。
Claude 的各種變相漲價騷操作是時候結束了
另外 Grok 的新模型口碑很好
馬斯克也追上來了
- GPT 5.6,Codex 吞噬一切,然後呢?
- 我靠這個雖然是傳聞但信息量有點大,看着玩吧
- GPT5.6 是 5 系最後一代,再見了,海外已經進入下一個超越 4T 的階段
- GPT6 馬上就來了,規模更大,對標 Fable 5.1
- GPT6 和 Fable 5.1 未來幾周就回來,下半年是全新一代預訓練模型的大戰了
- DeepSeek 即將發佈 V4 GA,對標 GLM 5.2
- DeepSeek 正在開發下一代更大的模型,估計也是 2T+
- MiniMax 正在開發下一代 2.7T 的 MiniMax Pro 模型
國產模型也都要進入 2T+新架構時代了
原文
🚨 SCOOP(s):
- GPT-5.6 will be the final model in the 5.x series. GPT-6 is slated to launch in about a month, earlier than expected, and possibly even later this month
- GPT-6 will be based on a new, significantly larger pretrain (versus the ~4T 5.5/5.6 'Spud' base)
- There is lots of excitement at OpenAI over this new base, which they believe will be much better able to compete with both Fable 5 and upcoming 5.1, targeting a similar release window. OpenAI initially intended to continue with Spud through GPT-6, but decided against it
- On the topic of Fable 5.1, it is in the late stages of the pipeline at Anthropic and a release is expected "in the coming weeks"
- On the other side of the globe, DeepSeek are preparing for an imminent launch of V4 GA, which seems likely to be on par with or better than GLM-5.2, and have begun work on a new, larger model that will compete with the upcoming 2.7T MiniMax Pro
Kimi K3,我關心的三個點 - 今日精華