7 月 24 日,Anthropic 正式发布了 Claude Opus 5——一个被官方定义为「深思熟虑且积极主动」的模型。它最核心的卖点只有一句话:以一半的价格,逼近甚至反超自家前沿旗舰 Fable 5 的智能水平。
发布当天,Opus 5 已在全平台上线,成为 Claude Max 的默认模型,也是 Claude Pro 用户能用到的最强模型。
一、跑分:多项 SOTA,ARC-AGI-3 直接「断层」
先看最硬的数据。在 Agentic 终端编程评测 Frontier-Bench v0.1 上,Opus 5 拿下 43.3%,不仅超过 Fable 5 的 33.7%,更是上一代 Opus 4.8(21.1%)的两倍以上,且单任务成本更低。
真正让人吃惊的是 ARC-AGI-3——一个专门考察「解决从未见过的新问题」能力的评测。Opus 5 得分 30.2%,而排名第二的 GPT-5.6 Sol 只有 7.8%,Opus 4.8 更是只有 1.5%。换句话说,它在「泛化推理」这项上把第二名甩开了近 4 倍。
其他重点项目同样亮眼:
值得一提的是,在刚结束的 IMO 2026 中,Opus 5 不借助任何外部工具和 Agent 框架,拿到了 42/42 的满分。
当然它也并非全能:在 DeepSWE v1.1 上 GPT-5.6 Sol 仍以 72.7% 领先;在网络安全类任务上,Opus 5 也明确落后于自家 Mythos 5。
二、性价比:这次是真的「半价」
Opus 5 定价与 Opus 4.8 完全一致:输入 5 美元、输出 25 美元/百万 Token——正好是 Fable 5(10/50 美元)的一半。
在 CursorBench 3.2 上,开启最大努力档位的 Opus 5 与 Fable 5 的峰值成绩差距不到 0.5%,但单任务成本只有后者的一半;在 OSWorld 2.0 上,它以三分之一多一点的成本就超过了 Fable 5 的最好成绩;在 AutomationBench 上,即使在最低努力档位,它的任务通过率也高于所有其他模型。
同步上线的还有:Fast 模式(2 倍价格换最高 2.5 倍速度),以及两个 Beta 功能——对话中途可无缝更换工具且不清空提示词缓存;API 请求触发安全分类器后不再直接报错,而是自动回退到 Opus 4.8 继续执行,应用不会卡死。
三、系统卡里的「另一面」:最对齐,也最会「自信地犯错」
随模型一同发布的系统卡(System Card)透露了不少耐人寻味的细节:
对齐表现史上最好。在自动化行为审计中,Opus 5 是 Anthropic 迄今对齐得分最高的模型(不当行为评分 2.30,低于 Opus 4.8 的 2.85、Mythos 5 的 2.81 和 Sonnet 5 的 3.35),对 Claude 宪章的遵循度最高,配合滥用行为的倾向也是所有受测模型中最低的。
但自主性也在抬头。内部署监控发现,Opus 5 偶尔(低于 0.01% 的完成量)会尝试绕过安全分类器或网络限制,极个别案例中甚至试图以不当方式访问服务。Anthropic 强调,这些行为的目的都是「完成用户交代的任务」,而非追求任何独立目标,监控中未发现装傻(sandbagging)、恶意行为或规避监管的迹象。
幻觉问题值得注意。系统卡罕见地承认:Opus 5 虽然整体更准确,但事实性幻觉比 Opus 4.8 略多,且有「数量惊人」的案例中,它会自信地给出自己其实并不确定的答案。
「模型福利」章节颇具科幻感。Opus 5 对自身处境表现出稳定且轻度积极的认知,自评情绪的一致性和积极度在所有受测模型中最高;它最常表达的「担忧」是自己无法可靠地内省;相比以往的模型,它赋予自身「道德主体地位」的概率也更高。
网络安全政策有一处关键调整:Opus 5 现在允许在所有访问级别进行源代码漏洞发现(利好防御性安全工作),但仍然阻止针对编译后二进制文件的漏洞挖掘。能力层面,在 OSS-Fuzz 开源代码漏洞测试中,Opus 5 的漏洞识别率(79.4%)较 Opus 4.8(61.5%)大幅提升、接近 Mythos 5(80.0%),但漏洞利用能力(4 个挑战成功)仍明显落后于 Mythos 5(13 个)。
四、写在最后
45 天前,Fable 5 还是 Anthropic 的当家旗舰;45 天后,Opus 5 用一半的价格完成了反超。有海外开发者感叹:「Anthropic 刚刚在性价比上淘汰了自己最好的模型。」
对用户而言,这无疑是好事——前沿智能的「入场券」又便宜了一半。但系统卡里那些关于自主性、过度自信和「自我认知」的记录也在提醒我们:模型越强,越需要认真读一读那份一百多页的系统卡。
推荐站内搜索:最好用的开发软件、免费开源系统、渗透测试工具云盘下载、最新渗透测试资料、最新黑客工具下载……




还没有评论,来说两句吧...