Anthropic給Opus 5的定位非常清楚,它在很多領域已經逼近Fable 5了。
就像上面那張跑分圖。
甚至在ARC-AGI-3上,是最誇張的,Opus 5是30.2%,GPT-5.6 Sol是7.8%,Opus 4.8只有1.5%,可惜Fable 5沒有這塊的跑分,不知道能到都多少。
它相當於直接做到了第二名的接近四倍。
這種抽象推理、動態適應和陌生任務泛化,一直是模型最容易露怯的。
因爲過去的模型經常能複述世界,能模仿答案,但是一旦規則沒見過,立刻開始犯蠢了,所以ARC-AGI-3,在現在的時間點,挺能代表一個模型真正的智力和泛化程度的。
甚至在AA的跑分上,居然比Fable 5還要強。
但是價格只有Fable 5的一半。
輸入每百萬Token 5美元,輸出每百萬Token 25美元,價格跟Opus 4.8一樣。
還有一個Fast Mode,速度大約提升到2.5倍,價格翻倍。
所以如果只問Opus 5有沒有把Fable 5徹底淘汰,答案很簡單,暫時沒有。
可如果問它是不是當前最適合大規模拿來幹活的Claude,我個人已經準備直接切了。
尤其是那些過去覺得Fable最好用,又實在捨不得額度,最後只能咬牙退回Opus 4.8的任務,主要還是每週的Token額度Fable 5只能用50%,另外50%不用光,那是真的就浪費掉了。
這次終於有一個舒服得多的中間解了,50%額度的Claude Fable 5+50%額度的Claude Opus 5,而且效果確實不錯。
比如我今天重構了一下AIHOT的整個API、RSS還有Skill,那玩意其實之前推出的太倉促了,效果不是很好,所以呢,就是爲了讓大家請求起來體驗更好,同時也降低對我服務器的請求次數,讓我壓力更小點,就重搞了一下。
因爲Fable 5我的額度用完了,於是我用了一個邪修的方式,直接讓ChatGPT網頁版的GPT-5.6 Sol Pro來幹了,這個其實是一個小技巧,就是在Review深度、思考深度上,都比Codex本地的Max或者Ultra更好用,而且,還不燒你的Codex額度。
這個東西搞完以後,我其實把方案扔給了Codex上的GPT-5.6 Sol、Kimi K3、Opus 4.8,讓三者來深度Review,看看這個方案對不對,是不是能解決本質問題,還有沒有可以優化的空間。
這三者給的答覆幾乎就是沒啥問題,只能硬挑一點小問題。
然後我就直接給GPT-5.6 Sol Ultra設了個目標,讓他自己去幹了,大概3個小時,不知道開了多少個Agent,幹完了。
又用K3、GPT-5.6 Sol自己開了對抗式審查,看看有沒有BUG和漏洞啥的,基本也就一些小的無關痛癢的,我以爲就沒啥問題了。
結果剛剛用Claude Opus 5跑了一下,給我嚇得一身冷汗,驗證了一下,確實對的,趕緊改。。。
而且這個問題還挺嚴重的。。。
除了體驗之外,又發現了漏洞。
第一個漏洞給我嚇尿了,我現在看到什麼擊穿邊緣緩存幾個字我就PTSD,兩週前被各種攻擊爬流量給我賬單幹崩就是這麼幹出來的。。。
立馬就直接開修去了。
確實能感覺到,更聰明一點,有一點Fable 5那個味了,雖然Fable 5經常看完我之前做的東西,就會跟我說,你之前做的是一坨屎,有更好的辦法,我覺得你可以重構。。。
而且在配合Claude Design以後,我覺得UI設計的細節也變得更好了一些,比如爲了配合新的API啥的上線,我就把Agent接入界面也給重做了一些,之前GPT-5.6 Sol真的設計的就是一坨屎,給我幹完長這樣,我人都麻了,我想罵人。
Opus 4.8設計了一版,也不是特別好看,晚上拿Claude Opus 5重設計了一下,正常多了。
寫作這塊大家也不用看了,繼續拉完了。
依然還是Claude Opus 4.6最好。
文章第一張核心圖,畫的是一個Claude真正看到的完整上下文。
System Prompt裏寫着根據情況留下文檔,Skill裏寫着禁止添加註釋,用戶又說做得跟舊版本一樣。
模型當然可以理解,可它必須花思考Token去調和衝突,猜哪條優先,猜所謂舊版本到底包括哪些東西。
上下文越長,類似的小衝突越多。
所以呢,Anthropic把Claude 5時代的變化總結成六組心法:
過去給規則,現在給判斷空間。
過去給大量示例,現在設計好接口。
過去把全部內容塞在最前面,現在按需展開。
過去在不同地方重複提醒,現在把工具說明寫得簡單清楚。
過去把記憶塞進CLAUDE.md,現在交給自動記憶。
過去只寫一份簡單規格,現在直接提供代碼、測試、HTML原型和完整參考物。
其實你會發現,就是從手冊制,你給模型規劃好任務的方案,變成了設計Harness,設計一個讓模型自己完成目標的工作環境。
真正強的Harness,會把狀態、權限、約束和反饋做進環境裏,把目標和判斷留給模型。
X上的大佬其實也提到了。
我因爲一直幾乎是裸的,除了幾個自己的Skills,幾個MCP,幾個官方的插件,一些規範化的文檔,其實就沒啥了,所以我一上手的體驗反而非常好。
這裏其實官方也感受到了這個問題,所以他們非常推薦大家在Claude Code裏,先運行一下/doctor這個命令,來幫大家清除一些垃圾。
是時候,簡化你的Agent和工作流了,模型,會吞噬一切。
最後,在今天這個時間點,也簡單的再給大家分享一下我的工作流和使用的模型吧。
大體量重構方案規劃和底層研究:Claude Fable 5。
常規方案設計+Review:Claude Opus 5。
代碼執行+BUG修復:Claude Opus 5或GPT-5.6 Sol(看人在電腦前還是不在電腦前,在電腦前我選Claude,人在外面我選GPT)
大型代碼Review:ChaGPT網頁版上的GPT-5.6 Sol Pro。
UI設計:Claude Design + Claude Opus 5。
部分項目的展示站:Kimi K3(直出前端太好看了)。
大概就是這樣。
感覺這個列表,未來會輪動的越來越快,模型進化的速度,好像邁過了某種奇點。
就像Grok在收購了Cursor之後,模型能力瞬間起飛,迭代速度也變得極其恐怖,接下來,真的就是兩週一更新了。
幾乎每天一睜眼,我們就有新模型用,我們的能力邊界,又再進一步擴寬。
真的,好像沒有比這更幸福的事了。
以上,既然看到這裏了,如果覺得不錯,隨手點個贊、在看、轉發三連吧,如果想第一時間收到推送,也可以給我個星標⭐~謝謝你看我的文章,我們,下次再見。
>/ 作者:卡茲克
>/ 投稿或爆料,請聯繫郵箱: [email protected]