
Anthropic发布了Claude Opus 5。表面上看,这又是一次模型榜单刷新;真正值得注意的却是它给新品选择的定位:以Fable 5一半的价格,逼近Fable 5的前沿智能。
这句话比“更聪明”“更会编程”更有杀伤力。Anthropic不是在向OpenAI或Google喊话,而是在主动拆掉自己刚刚建立的旗舰溢价:Opus 5的API价格与Opus 4.8相同,每百万输入Token 5美元、输出Token 25美元,却在多项编码、知识工作和计算机操作评测中追平甚至超过价格更高的Fable 5。它同时成为Claude Max计划的默认模型,并被Anthropic称为Claude Pro用户能够使用的最强模型。

Anthropic发布的不是“次旗舰”,而是旗舰价格体系的破坏者
过去的模型分层很容易理解:昂贵旗舰负责刷新能力上限,较便宜的型号负责规模化使用。但Opus 5把这条界线搅乱了。按照Anthropic给出的测试结果,它在CursorBench 3.2最高推理强度下与Fable 5峰值只差0.5个百分点,单任务成本却只有后者的一半;在OSWorld 2.0计算机操作测试中,它以略高于Fable 5三分之一的成本超过了后者的最佳成绩。
这意味着企业采购模型时,问题不再只是“谁最强”,而是“为了最后一点能力差距,是否值得支付成倍溢价”。当Opus 5足以覆盖编码代理、文档分析、浏览器操作和复杂工作流时,Fable 5可能被迫退回少数极端任务,而不再是默认选择。
跑分很强,但它并没有赢下每一张表
Anthropic公布的评测图中,Opus 5在Frontier-Bench获得43.3分,高于Fable 5的33.7分和GPT-5.6 Sol的34.4分;GDPval-AA得分1861,也处于表格首位。在计算机操作OSWorld 2.0上,Opus 5得到70.6分,高于Fable 5的66.1分和GPT-5.6 Sol的62.6分;AutomationBench则以26.0分明显领先。

但这不是一场全胜。在DeepSWE v1.1软件工程评测中,GPT-5.6 Sol以72.7%领先Opus 5的68.8%;Humanity’s Last Exam无工具测试中,Fable 5也以56.5%略高于Opus 5的56.3%。在健康能力测试里,Opus 5同样没有压过表格中的所有对手。
这种“不完美”反而让Opus 5的产品策略更清楚:Anthropic并非声称它在每种任务上都是世界第一,而是试图把高水平能力、可控推理成本和代理可靠性捏合成一个更适合长期运行的默认模型。对于真正按Token、调用次数和任务时长付费的公司,成本曲线往往比单个冠军分数更重要。
最重要的升级,可能是模型终于学会检查自己的工作
Anthropic特别强调了Opus 5的“验证与迭代”能力。官方案例显示,它会在完成任务后主动建立测试流程,而不是把第一版答案直接交给用户:为了重建一个3D FreeCAD零件,它自行搭建计算机视觉管线;处理一个开源软件包管理器故障时,它找到了社区补丁没有触及的根因;面对交易所数据流任务时,它建立测试工具检查输出是否真的可用。
这正是代理型AI最容易被忽略的分水岭。会写代码不等于会交付软件,会调用浏览器也不等于能把流程跑完。模型若不能发现失败、定位原因并重新尝试,所谓“智能体”就只是速度更快的自动补全。Opus 5想争夺的不是一次回答的惊艳,而是用户离开电脑后,任务还能否可靠地继续执行。
“最安全”与“更强”被绑在同一次发布里
Anthropic称,Opus 5是其迄今行为最符合预期的模型。在自动化行为审计中,它的整体失配行为得分为2.3,是近期Claude模型中的最低值;官方还声称它在遵循Claude宪法、避免欺骗和抵抗滥用方面表现最好。
这里同样存在刻意保留。Anthropic表示,Opus 5没有把生物学和攻击性网络能力继续推向最高风险前沿,在这些方向上仍落后于Mythos 5。它能发现接近Mythos 5水平的漏洞,但在开发实际利用代码方面明显较弱。对于部分被系统识别为高风险的网络安全请求,Claude产品还会回退到Opus 4.8处理。
这不是纯粹的技术短板,也是一种产品切割:Opus 5负责成为“广泛可用的强模型”,更危险、更专业的能力被留在更严格的边界之后。Anthropic正在尝试证明,模型能力升级并不一定要等价于把所有危险能力同时放大。
价格没涨,速度和控制选项却变多了
Opus 5已经面向Claude Pro、Max、Team和Enterprise用户推出,并可通过Anthropic API、Amazon Web Services、Google Cloud和Microsoft Foundry使用。开发者调用的模型名称为claude-opus-5。
除了标准模式,Anthropic还提供约2.5倍速度的Fast mode,价格为基础费率的两倍;开发者可以通过effort设置在质量、延迟与成本之间取舍。API测试功能还包括在对话中途更换工具而不破坏提示缓存,以及模型不可用时的自动回退。
这组设计透露出一个现实:下一阶段的竞争不会只发生在“模型智商”上,还会发生在同一模型能否覆盖不同预算、不同延迟和不同权限的生产环境。模型本身正在变成一条可以调速、调成本、调风险的能力曲线。
Fable 5并没有被淘汰,但它需要重新证明贵在哪里
Opus 5发布后,Anthropic的产品线出现了一个尴尬又积极的局面:Fable 5仍代表能力上限,却不再天然拥有最好的性价比;Opus 5没有在所有评测中获胜,却可能成为更多用户真正每天调用的模型;GPT-5.6 Sol等竞争者则仍在软件工程等关键项目上保持优势。
因此,这次更新最刁钻的看点不是“Claude又赢了几个榜单”,而是前沿模型的定价权正在被快速削弱。当一家厂商愿意用旧款价格出售接近自家最高能力的新模型,其他公司也必须回答同一个问题:那些昂贵旗舰究竟提供了不可替代的能力,还是仅仅依赖“最强”标签维持溢价?
从这个角度看,Opus 5最可能改变的不是排行榜名次,而是用户对“旗舰模型应该有多贵”的预期。
信息来源:Claude官方X账号、Anthropic发布公告、Claude Opus产品页。

TopsTip