英偉達創始人黃仁勳在社交媒體發表公開信,拉上 Meta、微軟等科技巨頭/機構,爲開源模型鼓勁打氣。但眼尖的網友很快發現,
Anthropic、OpenAI 和 Google 都沒有簽字。
幾家公司的缺席,很容易被外界解讀爲 AI 陣營之間的又一次分野。
而就在剛剛,Anthropic 也正式發佈了新的閉源模型 Claude Opus 5,
也讓這種矛盾擺在明面上。
它沒有講太多宏大敘事,賣點相當務實:
性能逼近 Fable 5,價格卻只有後者的一半,頗有幾分丐版的價格,享受準頂配服務的意思。
在 Frontier-Bench、GDPval-AA 等編程和知識工作評測中,Opus 5 已經登上榜首。少數沒有拿下的項目集中在網絡安全領域,目前仍落後於能力更強的 Mythos 5。
比起單純談論 Opus 5 的紙面參數,在官方宣傳之外,它到底強在哪、以及「半價旗艦」有沒有隱藏代價,纔是我們更值得關注的部分。
Anthropic 此次重點強調了一個概念:effort,也就是思考檔位。
用戶可以自行調節。需要更強的推理能力,就把檔位調高;更在意速度、價格和 token 消耗,就降低檔位。官方公佈的大部分成績,都是在不同 effort 設置下測出來的。
在 Anthropic 內部的 Frontier-Bench v0.1 測試中,Opus 5 超過了所有參測模型。性能相比 Opus 4.8 提升一倍以上,完成單項任務的成本反而更低。
CursorBench 3.2 上,開啓 max effort 後,Opus 5 與旗艦 Fable 5 的最高分只差 0.5%,成本卻只有後者的一半。
在 high、xhigh 和 max 幾個高檔位中,同樣的預算下,Opus 5 得分也超過了所有其他模型。
大致可以理解爲,花一半的錢,完成接近 99% 的工作。
知識工作和複雜解題上,Opus 5 延續了類似表現。
ARC-AGI 3 主要測試模型處理陌生問題的能力。面對訓練中沒有見過的新任務,Opus 5 的得分達到第二名的三倍。
Zapier AutomationBench 考察模型能否從頭到尾完成一項商業任務。Opus 5 的任務通過率,大約是同等成本下第二名的 1.5 倍。即使只開啓最低 effort 檔位,它完成的任務數量也超過所有其他模型。
在 OSWorld 2.0 電腦操作測試中,Opus 5 用略高於三分之一的成本,就超過了 Fable 5 的最好成績。
GDPval-AA v2、HLE 和 DeepSearchQA 等評測裏,它也成了 Anthropic 模型中兼顧性能和成本的最佳選擇。
在生命科學的每一項評測中,Opus 5 都超過了 Opus 4.8,覆蓋結構生物學、有機化學、生物信息學等方向。
提升幅度最大的是有機化學。例如,根據光譜數據推斷分子結構,Opus 5 比 Opus 4.8 高出 10.2 個百分點;預測蛋白質序列變異對功能的影響,高出 7.7 個百分點。
在最初發布的對比圖中,FrontierCode v1.1 一欄將 Opus 5 的 53.4% 加粗標記爲最高分,而旁邊另一款模型的成績明明是 53.5%。
被網友抓包後,目前官網已經更換了圖片,將標記恢復正常。
類似場面並不陌生。OpenAI 此前也曾在圖表製作上出錯,縱軸比例與實際數據不一致,導致柱狀圖呈現出誤導性的視覺效果。
只能說,「世界是個巨大的草臺班子」這句話的含金量還在繼續上升。
換個角度看,或許從製圖者製圖的那一刻開始,就已經帶有先入爲主的心態。
Anthropic 反覆強調 Opus 5 的一種能力:遇到複雜任務時,它會主動驗證自己的結果。一次沒有成功,就重新檢查、調整方案,再次嘗試,直到任務完成。
面對機械零件圖紙,Opus 5 在沒有視覺工具的情況下,自行編寫算法並完成 3D 重建;修復開源項目 bug 時,它找到了社區補丁遺漏的邊界問題;搭建交易所行情接口時,它還自己生成模擬數據驗證代碼。
沃頓商學院教授 Ethan Mollick 提前獲得了使用權限。他的評價相對剋制:短任務中,Opus 5 可以追平甚至超過 Fable 級模型;面對長時間、複雜度更高的任務時,它顯得少了一點「雄心」,最終交付的完整度仍有差距。
儘管如此,他還是用 Opus 5 替換了此前長期使用的 Opus 4.8,因爲新模型在整體能力上明顯更強。
唯一讓他不太滿意的是,Opus 5 繼承了 Fable 的部分語言習慣,比如對高密度表達的異常偏好,以及一股很明顯的「Fable 味」。
比如他讓 Opus 5 製作了一個哥特風格着色器,還生成了一款可以在山寨中土世界修建鐵路的遊戲。
還有網友 Chetaslua 用它製作了一套阿波羅登月模擬,全部內容由程序生成。
Harshith 留下一句「Opus 5 max 簡直逆天」的評價,隨後展示了一架帶有帝國風格雙離子引擎的星際戰鬥機。
再比如網友 Charlie Hills 轉發的官方案例:用 Opus 5 搭建出了一套可以實際運行的風洞模擬系統,能夠將空氣流過物體表面的過程進行可視化。
技術能力之外,Anthropic 此次也花了大量篇幅討論安全問題。
自動化行爲審計結果顯示,Opus 5 是 Anthropic 目前行爲最符合預期的模型。
與 Opus 4.8、Sonnet 5 和 Fable 5 相比,它對 Claude 行爲準則的遵循程度更高,欺騙行爲更少,也更難被誘導執行危險操作。
面對可能造成不可逆後果的任務時,它也更傾向於先檢查風險,再採取行動。
Opus 5 的整體失準行爲得分爲 2.3,是 Anthropic 近期模型中的最低值。在生物研究和攻擊性網絡安全任務中,它依然落後於能力更強的 Mythos 5。
Anthropic 表示,與 Opus 4.8 一樣,沒有專門使用網絡攻擊任務訓練 Opus 5。但隨着模型綜合能力提升,它發現漏洞的水平已經逐漸逼近 Mythos 5。發現漏洞與將漏洞轉化爲真實攻擊工具,仍然存在明顯差距。
簡言之,Opus 5 已經能夠判斷一把鎖存在什麼問題,但距離真正撬開它還有很遠。
Anthropic 使用 OSS-Fuzz 評測展示了這種差異。在漏洞發現任務中,Opus 5 與 Mythos 5 接近;到了編寫漏洞利用代碼的階段,成績便明顯落後。
基於這一風險邊界,Opus 5 會對網絡安全請求進行額外審覈。一旦請求涉及高風險攻擊行爲並觸發安全限制,系統會將任務回退到 Opus 4.8 處理。
今天起,Opus 5 已在所有平臺同步上線。API 模型名稱爲 claude-opus-5。價格方面,
每百萬輸入 token 爲 5 美元,每百萬輸出 token 爲 25 美元,與 Opus 4.8 完全相同。
🔗 https://platform.claude.com/docs/en/about-claude/pricing
需要更快響應速度的用戶還可以開啓 Fast 模式,推理速度約爲默認模式的 2.5 倍,價格則提高至兩倍。
在 Claude Platform 上,Fast 模式按照基礎價格的兩倍計費;在 Claude Code 中,則通過使用額度進行抵扣。計費規則與 Opus 4.8 時期保持一致。
伴隨模型發佈的,還有兩個仍處於 beta 階段的更新。
第一項更新面向 Claude Platform。開發者可以在對話進行過程中,動態修改 Claude 能夠使用的工具,同時不會導致 prompt 緩存失效。
開發者可以選擇將被安全分類器攔截的請求,自動轉交給其他模型處理。
開啓後,請求默認會交給當前可用的最強模型,數據保留方面,Opus 5 延續了以往 Opus 系列的規則,普通訪問沒有強制數據保留要求。
此次發佈中,還有一個頗爲反直覺的經驗,來自 Anthropic 工程師 Thariq Shihipar。
團隊發現,爲 Claude 5 系列編寫指令時,可以大幅減少系統提示詞。Claude Code 的系統提示詞被刪除了 80% 以上,編程評測成績卻沒有出現可測量的下降。
Thariq 隨後總結了幾條過去被廣泛採用、如今可能已經過時的提示詞規則。
🔗 https://x.com/trq212/status/2080710971228918066
過去強調給 Claude 制定詳細規則,如今更傾向於讓 Claude 根據上下文自行判斷。例如,舊版系統提示詞會明確規定「默認不要編寫註釋」。面對複雜代碼時,這條規則很容易產生問題。
新版本只保留一句要求:生成的代碼應當融入周圍代碼,註釋密度、命名方式和整體風格都參考現有項目。
Anthropic 發現,示例有時會限制模型的探索範圍。相比之下,將工具參數設計得更能準確表達意圖,效果反而更好。
過去習慣一次性提供全部信息,如今更提倡按需加載,也就是 progressive disclosure。暫時用不到的代碼審查和驗證流程,會被放進獨立 skill 中,需要時再調用。
過去傾向於反覆強調關鍵要求,如今只要工具說明足夠清楚,寫一次通常已經足夠,沒有必要在系統提示詞中重複。模型能力提高後,許多原本用於限制錯誤行爲的繁複規則,逐漸變成了新的約束。
Anthropic 還爲此推出了一個名爲 claude doctor 的命令。用戶在 Claude Code 中輸入 /doctor,系統便會自動檢查過度臃腫的 skill 和 CLAUDE.md 文件,並給出精簡建議。
從事無鉅細地教模型做事,到逐漸將判斷權交給模型,或許纔是 Opus 5 此次發佈中最值得留意的變化。而
當模型越來越聰明,人類寫下的那些「經驗」,反倒可能成爲它首先需要擺脫的包袱。
https://www.anthropic.com/news/claude-opus-5
https://support.claude.com/en/articles/16049681-why-claude-switched-models-in-your-conversation-with-opus-5
https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models