Claude Opus 5发布:半价逼近Fable 5,Anthropic亲手拆掉旗舰溢价

Claude Opus 5以更低成本逼近Fable 5前沿能力的概念图
Claude Opus 5正在把原本属于旗舰模型的能力推向更低价格带。图片由AI生成。

Anthropic发布了Claude Opus 5。表面上看,这又是一次模型榜单刷新;真正值得注意的却是它给新品选择的定位:以Fable 5一半的价格,逼近Fable 5的前沿智能



这句话比“更聪明”“更会编程”更有杀伤力。Anthropic不是在向OpenAI或Google喊话,而是在主动拆掉自己刚刚建立的旗舰溢价:Opus 5的API价格与Opus 4.8相同,每百万输入Token 5美元、输出Token 25美元,却在多项编码、知识工作和计算机操作评测中追平甚至超过价格更高的Fable 5。它同时成为Claude Max计划的默认模型,并被Anthropic称为Claude Pro用户能够使用的最强模型。

Claude Opus 5官方发布视觉
Claude Opus 5官方发布视觉。图片:Claude官方X账号。

Anthropic发布的不是“次旗舰”,而是旗舰价格体系的破坏者

过去的模型分层很容易理解:昂贵旗舰负责刷新能力上限,较便宜的型号负责规模化使用。但Opus 5把这条界线搅乱了。按照Anthropic给出的测试结果,它在CursorBench 3.2最高推理强度下与Fable 5峰值只差0.5个百分点,单任务成本却只有后者的一半;在OSWorld 2.0计算机操作测试中,它以略高于Fable 5三分之一的成本超过了后者的最佳成绩。

这意味着企业采购模型时,问题不再只是“谁最强”,而是“为了最后一点能力差距,是否值得支付成倍溢价”。当Opus 5足以覆盖编码代理、文档分析、浏览器操作和复杂工作流时,Fable 5可能被迫退回少数极端任务,而不再是默认选择。

跑分很强,但它并没有赢下每一张表

Anthropic公布的评测图中,Opus 5在Frontier-Bench获得43.3分,高于Fable 5的33.7分和GPT-5.6 Sol的34.4分;GDPval-AA得分1861,也处于表格首位。在计算机操作OSWorld 2.0上,Opus 5得到70.6分,高于Fable 5的66.1分和GPT-5.6 Sol的62.6分;AutomationBench则以26.0分明显领先。

Anthropic公布的Claude Opus 5与Fable 5、Opus 4.8及GPT-5.6 Sol基准测试对比
Anthropic公布的Claude Opus 5基准测试。不同模型的推理强度、工具和测试条件并不完全相同,厂商数据不应被视为独立结论。图片:Anthropic。

但这不是一场全胜。在DeepSWE v1.1软件工程评测中,GPT-5.6 Sol以72.7%领先Opus 5的68.8%;Humanity’s Last Exam无工具测试中,Fable 5也以56.5%略高于Opus 5的56.3%。在健康能力测试里,Opus 5同样没有压过表格中的所有对手。

这种“不完美”反而让Opus 5的产品策略更清楚:Anthropic并非声称它在每种任务上都是世界第一,而是试图把高水平能力、可控推理成本和代理可靠性捏合成一个更适合长期运行的默认模型。对于真正按Token、调用次数和任务时长付费的公司,成本曲线往往比单个冠军分数更重要。

最重要的升级,可能是模型终于学会检查自己的工作

Anthropic特别强调了Opus 5的“验证与迭代”能力。官方案例显示,它会在完成任务后主动建立测试流程,而不是把第一版答案直接交给用户:为了重建一个3D FreeCAD零件,它自行搭建计算机视觉管线;处理一个开源软件包管理器故障时,它找到了社区补丁没有触及的根因;面对交易所数据流任务时,它建立测试工具检查输出是否真的可用。

这正是代理型AI最容易被忽略的分水岭。会写代码不等于会交付软件,会调用浏览器也不等于能把流程跑完。模型若不能发现失败、定位原因并重新尝试,所谓“智能体”就只是速度更快的自动补全。Opus 5想争夺的不是一次回答的惊艳,而是用户离开电脑后,任务还能否可靠地继续执行。

“最安全”与“更强”被绑在同一次发布里

Anthropic称,Opus 5是其迄今行为最符合预期的模型。在自动化行为审计中,它的整体失配行为得分为2.3,是近期Claude模型中的最低值;官方还声称它在遵循Claude宪法、避免欺骗和抵抗滥用方面表现最好。

这里同样存在刻意保留。Anthropic表示,Opus 5没有把生物学和攻击性网络能力继续推向最高风险前沿,在这些方向上仍落后于Mythos 5。它能发现接近Mythos 5水平的漏洞,但在开发实际利用代码方面明显较弱。对于部分被系统识别为高风险的网络安全请求,Claude产品还会回退到Opus 4.8处理。

这不是纯粹的技术短板,也是一种产品切割:Opus 5负责成为“广泛可用的强模型”,更危险、更专业的能力被留在更严格的边界之后。Anthropic正在尝试证明,模型能力升级并不一定要等价于把所有危险能力同时放大。

价格没涨,速度和控制选项却变多了

Opus 5已经面向Claude Pro、Max、Team和Enterprise用户推出,并可通过Anthropic API、Amazon Web Services、Google Cloud和Microsoft Foundry使用。开发者调用的模型名称为claude-opus-5

除了标准模式,Anthropic还提供约2.5倍速度的Fast mode,价格为基础费率的两倍;开发者可以通过effort设置在质量、延迟与成本之间取舍。API测试功能还包括在对话中途更换工具而不破坏提示缓存,以及模型不可用时的自动回退。

这组设计透露出一个现实:下一阶段的竞争不会只发生在“模型智商”上,还会发生在同一模型能否覆盖不同预算、不同延迟和不同权限的生产环境。模型本身正在变成一条可以调速、调成本、调风险的能力曲线。

Fable 5并没有被淘汰,但它需要重新证明贵在哪里

Opus 5发布后,Anthropic的产品线出现了一个尴尬又积极的局面:Fable 5仍代表能力上限,却不再天然拥有最好的性价比;Opus 5没有在所有评测中获胜,却可能成为更多用户真正每天调用的模型;GPT-5.6 Sol等竞争者则仍在软件工程等关键项目上保持优势。

因此,这次更新最刁钻的看点不是“Claude又赢了几个榜单”,而是前沿模型的定价权正在被快速削弱。当一家厂商愿意用旧款价格出售接近自家最高能力的新模型,其他公司也必须回答同一个问题:那些昂贵旗舰究竟提供了不可替代的能力,还是仅仅依赖“最强”标签维持溢价?

从这个角度看,Opus 5最可能改变的不是排行榜名次,而是用户对“旗舰模型应该有多贵”的预期。


信息来源:Claude官方X账号Anthropic发布公告Claude Opus产品页

-=||=-收藏赞 (0)
版权声明:本文采用知识共享 署名4.0国际许可协议 [BY-NC-SA] 进行授权
文章名称:《Claude Opus 5发布:半价逼近Fable 5,Anthropic亲手拆掉旗舰溢价》
文章链接:https://topstip.com/p7650238/
转载说明:请注明来自“TopsTip”并加入转载内容页的超链接。
本站资源仅供个人学习交流,请于下载后24小时内删除,不允许用于商业用途,否则法律问题自行承担。