剛剛,F(xiàn)able 5解禁!Anthropic連夜發(fā)“性價(jià)比”新模型,網(wǎng)友:感謝中國開源嚴(yán)父_Sonnet_Opus_Claude
智東西
編譯 | 李水青
編輯 | 云鵬
智東西7月1日消息,剛剛,Anthropic宣布Claude Fable 5解禁。就在6小時(shí)前,Anthropic推出一款新模型Claude Sonnet 5,面向所有套餐用戶開放。
Anthropic在推文中稱:“我們已收到通知,美國商務(wù)部已解除對Claude Fable 5和Mythos 5的出口管制。我們將于明日開始恢復(fù)訪問權(quán)限,并盡快發(fā)布最新消息。感謝用戶的耐心等待,也感謝所有與我們合作的人員。”
▲Anthropic宣布Fable 5解禁
此前6月13日,Anthropic因美國***發(fā)布一項(xiàng)出口管制指令,終止了所有用戶的Fable 5和Mythos 5訪問權(quán)限。而后兩周,Anthropic在全球范圍內(nèi)封禁了一大批賬號(hào),使得大批原Claude用戶轉(zhuǎn)向?qū)ふ姨娲a(chǎn)品。
Fable 5回歸的關(guān)注度雖高,但Claude最新的Sonnet 5也值得一看。據(jù)悉,其最大進(jìn)步在于能夠自主運(yùn)行長時(shí)間任務(wù),用戶可以制定***、使用瀏覽器和終端等工具。幾個(gè)月前要達(dá)到這樣的水平,還需要更昂貴的模型。
從測評成績來看,Sonnet 5性能接近Opus 4.8,但價(jià)格更低;同時(shí),它比其前代產(chǎn)品Sonnet 4.6有了顯著的改進(jìn),在推理、工具使用、編程和知識(shí)工作等Agent性能方面更強(qiáng)。
▲Sonnet 5與Sonnet 4.6和Opus 4.8測評得分對比
Sonnet 5在Agent環(huán)境中使用更安全,不良行為發(fā)生率總體低于Sonnet 4.6,但高于Opus 4.8和Claude Mythos Preview。但在網(wǎng)絡(luò)安全類任務(wù)上,該模型的能力遠(yuǎn)不及現(xiàn)有Opus系列模型。
從今天起,免費(fèi)版和專業(yè)版Claude用戶默認(rèn)使用Sonnet 5,Max版、團(tuán)隊(duì)版和企業(yè)版用戶也可使用,該模型還可通過Claude Code和Claude Platform使用。在Claude Platform上,Sonnet 5的首發(fā)價(jià)格為每百萬個(gè)輸入token 2美元(約合人民幣13.6元),每百萬個(gè)輸出token 10美元(約合人民幣67.9元),優(yōu)惠期至2026年8月31日。
優(yōu)惠結(jié)束之后,價(jià)格將調(diào)整為每百萬個(gè)輸入token 3美元(約合人民幣20.4元),每百萬個(gè)輸出token 15美元(約合人民幣101.8元);這一價(jià)格仍低于Opus 4.8的輸入5美元、輸出25美元的定價(jià)。開發(fā)者可通過Claude API使用claude-sonnet-5模型。
模型一經(jīng)發(fā)布,一些網(wǎng)友認(rèn)為這是一次“巨大的更新”。有網(wǎng)友稱:“有趣的不是它與Opus的算法接近,而是算法接近但token的價(jià)格卻便宜60%。”有網(wǎng)友稱:“既然它本身就能處理多步驟Agent工作流程,再去構(gòu)建更大的模型就不太劃算了。”也有人稱:“終于有一個(gè)能自我檢查的模型了,它讓我們免于在長時(shí)間運(yùn)行的循環(huán)中時(shí)刻關(guān)注每一個(gè)輸出結(jié)果。”
▲網(wǎng)友對Sonnet 5的評論(圖源:社交媒體X)
但也有網(wǎng)友認(rèn)為這款模型頗為“雞肋”。一位網(wǎng)友稱:“你自己也承認(rèn),這比你目前排名第二的型號(hào)要弱。訂閱用戶想要的是性能更強(qiáng)的模型,而不是價(jià)格便宜幾分錢卻只會(huì)給出虛***答案的玩具。”也有網(wǎng)友擔(dān)心所謂自主運(yùn)行,反而讓用戶擔(dān)心模型犯傻、刪錯(cuò)文件。有人吐槽:“促銷價(jià)過后,它的價(jià)格和Opus差不多。”也有網(wǎng)友認(rèn)為,Sonnet 5就是面向6月17日新開源的智譜GLM-5.2展開價(jià)格戰(zhàn)。
GLM-5.2在OpenRouter等第三方API平臺(tái)定價(jià)為每百萬token輸入1.40美元,輸出4.40美元,Sonnet 5依然高出不少。
▲網(wǎng)友對Sonnet 5的評論(圖源:社交媒體X)
一、性能對標(biāo)、價(jià)格骨折,Sonnet 5拳打自家Opus 4.8
下圖比較了Sonnet 5、Sonnet 4.6和Opus 4.8在不同工作量水平下,在BrowseComp智能搜索評估和OSWorld-Verified計(jì)算機(jī)使用評估中的性能表現(xiàn)。
Sonnet 5(橙色線)相比Sonnet 4.6(灰色線)有了顯著提升,并且比Opus 4.8(***線)涵蓋了更廣泛的性價(jià)比選擇。它在中等工作量下提供了更高的成本效益;在某些任務(wù)中,其高工作量下的性能可以與Opus 4.8相媲美。用戶可以在Sonnet 5和Opus 4.8之間調(diào)整工作量水平,以找到成本和性能的最佳平衡點(diǎn)。
下圖顯示了不同投入水平下的性價(jià)比曲線。前代產(chǎn)品Sonnet 4.6遠(yuǎn)遜于Opus 4.8,但Sonnet 5提供的性價(jià)比選擇范圍比Sonnet 4.6更廣,在某些情況下甚至可以與Opus 4.8的性能水平相媲美。
▲Agent搜索
▲Agent計(jì)算機(jī)使用
圖表顯示了Sonnet 5的定價(jià),但其實(shí)際成本甚至比圖中所示還要低。Opus 4.8的定價(jià)為每百萬輸入token 5美元,每百萬輸出token 25美元。xhigh表示,Opus 4.8達(dá)到了超高投入水平。
來自早期體驗(yàn)合作伙伴的反饋一致,Sonnet 5比其前代產(chǎn)品更具自主性。測試人員描述了它如何完成以往Sonnet型號(hào)無法完成的復(fù)雜任務(wù),如何在無需明確要求的情況下檢查自身輸出,以及它如何以極具吸引力的價(jià)格完成所有這些自主工作。
一位網(wǎng)友對比了Claude Sonnet 5與Claude Opus 4.8的體驗(yàn)結(jié)果,讓它們分別創(chuàng)建一個(gè)關(guān)于Claude Sonnet 5的HTML落地頁,認(rèn)為就輸出質(zhì)量而言,Opus勝出;就模型速度和成本而言,Sonnet 5勝出。
其中Sonnet 5使用token:輸入20.9k,輸出14.2k,總成本:3.36美元,耗時(shí):2分11秒。Opus 4.8:使用token:輸入96.3k,輸出73.8k,總成本:20.66美元,耗時(shí):20分15秒。
▲左圖為Opus 4.8生成網(wǎng)頁,右圖為Sonnet 5生成網(wǎng)頁
二、安全防御提升,網(wǎng)絡(luò)安全任務(wù)執(zhí)行遠(yuǎn)遜于Opus與Mythos
Anthropic的部署前安全評估發(fā)現(xiàn),Sonnet 5總體上比Sonnet 4.6有所改進(jìn)。在Agent安全方面,該模型能夠更好地拒絕惡意請求,并抵御即時(shí)注入攻擊中的劫持嘗試。與Sonnet 4.6相比,該模型表現(xiàn)出更低的幻覺和奉承行為發(fā)生率。
在Anthropic的自動(dòng)化行為審查中,該審計(jì)測試各種不協(xié)調(diào)行為,例如濫用和欺騙等,Sonnet 5的總體得分更低(即更安全)。然而,與Opus 4.8和Claude Mythos Preview相比,Sonnet 5在此項(xiàng)評估中表現(xiàn)出的不協(xié)調(diào)行為發(fā)生率略高。
▲Claude模型中不一致行為的發(fā)生率
Anthropic并未刻意訓(xùn)練Sonnet 5執(zhí)行網(wǎng)絡(luò)安全任務(wù)。它可以執(zhí)行一些常規(guī)的、無害的網(wǎng)絡(luò)安全任務(wù),但在測試潛在危險(xiǎn)網(wǎng)絡(luò)安全技能的評估中,例如開發(fā)軟件漏洞利用程序,它的表現(xiàn)遠(yuǎn)遜于Opus 4.8和Mythos 5等模型。
下圖展示了一項(xiàng)評估的得分,該評估測試了模型開發(fā)針對Firefox瀏覽器漏洞的利用程序的能力。Sonnet 5從未成功開發(fā)出完整的可用漏洞利用程序,但其部分成功率略高于Sonnet 4.6。后者的變化很可能是由于其通用智能的提升,而非特定訓(xùn)練的結(jié)果。
▲衡量Claude模型在開發(fā)針對Firefox 147軟件漏洞的利用程序方面的成功率
如上圖所示,對于每個(gè)模型,左側(cè)條形圖顯示模型在無安全措施的情況下,開發(fā)出有效利用程序的頻率;右側(cè)條形圖顯示模型部分成功的頻率。Sonnet的兩個(gè)模型均未能成功開發(fā)出有效利用程序,得分均為0.0%;Sonnet 5的部分成功率略高于Sonnet 4.6。Sonnet的兩個(gè)模型的網(wǎng)絡(luò)安全能力均遠(yuǎn)遜于Opus 4.8和Mythos 5。
由于Sonnet 5在這些任務(wù)上比其前代產(chǎn)品功能更強(qiáng)大,Anthropic默認(rèn)啟用了網(wǎng)絡(luò)安全防護(hù)功能。這些防護(hù)功能可以實(shí)時(shí)檢測并阻止危險(xiǎn)的網(wǎng)絡(luò)攻擊,與Claude Opus 4.7和4.8中的防護(hù)功能相同。因?yàn)锳nthropic評估Sonnet 5的總體網(wǎng)絡(luò)安全風(fēng)險(xiǎn)較低,所以其防護(hù)措施比Fable 5的防護(hù)措施寬松,F(xiàn)able 5會(huì)阻止更廣泛的網(wǎng)絡(luò)安全攻擊。
結(jié)語:Sonnet 5來了,但全網(wǎng)都在等Fable 5
曾幾何時(shí),Sonnet系列憑借3.5至3.7版本為開發(fā)者打開了Agent工程的大門,成為編碼與工具調(diào)用的標(biāo)桿。但隨后幾年,Opus系列在復(fù)雜推理和高端任務(wù)上持續(xù)領(lǐng)跑,讓Sonnet逐漸退居“高性價(jià)比備選”之位。
如今,Sonnet 5試圖宣告回歸:在高投入場景下性能足以比肩Opus 4.8,成本更低。不過,對于Sonnet 5這種備選方案,很多網(wǎng)友并不買賬,而是催著能力更強(qiáng)的Fable 5解禁。與此同時(shí),Sonnet 5也被認(rèn)為是面向GML-5.2等模型打響價(jià)格戰(zhàn),頭部大模型廠商之間的Agent競賽似乎已進(jìn)入肉搏階段。
來源:Anthropic、X返回搜狐,查看更多









