2026 年 7 月 25 日 星期六
  • 登录
  • 注册
周天财经
广告
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金
没有结果
查看所有结果
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金
没有结果
查看所有结果
周天财经
没有结果
查看所有结果
首页 商业

Opus 5 反超 Fable 5,Anthropic 的定价牌局被打乱了?

2026 年 7 月 25 日
在 商业
阅读时间: 2 mins read
阅读:856
A A


1

Related articles

YC掌门人最新分享:AI时代,永远不要做一次性工作

Seesaw、Manner、M Stand 为何结出了不同的果实?

2026 年 7 月 25 日
安踏品牌CEO徐阳离任;得物App首个AI鉴别机器人亮相WAIC;泡泡玛特王宁带队参访苹果总部;HOKA官宣品牌代言人侯明昊|消研所周报

中文播客,词汇通胀

2026 年 7 月 25 日

7 月 25 日凌晨 1 点,Anthropic 发布了 Claude Opus 5。如果只看名字,你会以为它是 Opus 4.8 的继任者,Anthropic 产品线中比 Sonnet 强但比 Fable 弱的中间型号。

广告

但一看数据就会发现,这款定价 $5/$25(每百万输入/输出 token) 的模型,在编程、自主搜索、计算机使用、企业业务流程等多个关键基准测试上,把定价 $10/$50  的 Fable 5 给超了。而它的成本,只有 Fable 5 的一半。

Anthropic 在官方公告里表示:“Opus 5 comes close to the frontier intelligence of Claude Fable 5 at half the price”,意思是接近 Fable 5 的智能,价格减半。但他们自己发布的基准测试图表显示,Opus 5 在至少四项核心评测中明确领先 Fable 5,而且是在更低的成本下做到的。

被“ 次旗舰” 反超的“ 旗舰”

先看编程能力。Frontier-Bench v0.1 是当前最直接映射企业开发团队实际工作的基准测试之一,让模型自己在终端里写代码、跑代码、调试多文件变更。Opus 5 拿到了 43.3%,Fable 5 是 33.7%。将近 10 个百分点的差距,在编程评测里属于碾压级别。Opus 4.8 在这个测试上是 21.1%,Opus 5 直接翻了一倍多。

在 CursorBench 3.2 上,Opus 5 在最高推理强度下达到 Fable 5 峰值成绩的 94.5%,单次任务成本只有一半。Anthropic 还宣称,在 high、xhigh 和 max 三个推理等级上,Opus 5 在同成本下的性能都超过了所有其他模型。Cognition(Devin 背后的公司)CEO Scott Wu 在 FrontierCode 1.1 评测后确认:“Claude Opus 5 在调试和根因分析方面以一半成本达到了接近 Fable 级别的性能。”

在自主搜索 (Agentic Search) 上,Opus 5 拿到 90.8%,Fable 5 是 87.4%。十次搜索有九次以上能独立搞定。计算机使用 (OSWorld 2.0) 上,Opus 5 在约三分之一成本下就超过了 Fable 5 的最优成绩。企业业务流程自动化 (Business Workflows) 方面,Opus 5 拿到 26%,Fable 5 只有 17.4%。

科学领域同样不弱。Opus 5 在有机化学任务上比 Opus 4.8 高出 10.2 个百分点 (包括从光谱数据推断分子结构),在蛋白质相关任务上高出 7.7 个百分点 (包括预测序列变异对功能的影响)。在号称“ 人类最后考试” 的 Humanity's Last Exam 上,开启工具后 Opus 5 拿到 64.7%,Fable 5 是 63.9%(不开工具时分别为 56.3% 和 56.5%),差距不到一个百分点。

但真正让整个 AI 研究圈停下滚动的,是 ARC-AGI 3 的成绩。

ARC-AGI 3 是 François Chollet 设计来衡量“ 流体智能” 的基准。它不是让模型回忆训练数据里见过的东西,而是把它扔进完全陌生的交互式环境里,没有指令、没有规则说明、没有目标提示,靠试错自己摸索。人类能完成 100% 的任务。今年 3 月 ARC Prize Foundation 发布这个基准时,最强 AI 模型的得分是 0.37%(Gemini 3.1 Pro)。到 Opus 5 发布前,公开最强成绩是 GPT-5.6 Sol 在最大推理强度下的 7.8%。Opus 4.8 只有 1.5%。

Opus 5 拿到了 30.2%。是 GPT-5.6 Sol 的近四倍,Opus 4.8 的二十倍。

这个数字的意义远超任何编程或搜索基准。ARC-AGI 3 奖励的不是“ 做过类似的事所以能做”,而是“ 从没训练过也能做”。30.2% 意味着 Opus 5 确实在通过交互来推导陌生的规则体系,而不只是模式匹配。Vellum AI 的基准分析文章直言:“ 这个数字让所有人都停下了滚动。”

它不只是分数高

基准数字告诉我们 Opus 5 考了多少分。但 Anthropic 公布的案例告诉了我们是它怎么考到这些分的。

Anthropic 公布了一个 3D 建模任务,只给模型一张机械零件的设计图纸,要求它自主编写代码重建完整的 FreeCAD 3D 模型。在 Opus 5 之前,没有任何模型能完成这个任务,即使人工提前搭好开发框架、给出详细方案,模型依然会出错。Opus 5 不仅完成了全过程自主闭环,还自己搭建了配套的测试工具,逐一校验代码的数据解析逻辑,反复核查修正问题,直到通过验证。

在没有任何人工干预的情况下,自主完成了一个完整的工程验证循环,设定目标、规划步骤、编写代码、测试输出、发现错误、回溯修正、再次测试、通过。

Zapier CEO Wade Foster 透露,团队用 Opus 5 处理客户健康度原始表格,要求 AI 独立完成全套客户流失预防流程,包括标记高风险账户、通知对应负责人、整理运营报告。“ 以前的模型没有能完整跑通这条流程的,”Foster 说,“Opus 5 做到了 100% 完整交付。”

Box CTO Ben Kus 给出了量化对比:Opus 5 在专业企业内容处理上整体比 Opus 4.8 提升 8%,数据分析工作流提升 11%,尽职调查提升 17%。一家金融建模团队的评估负责人 Richard Pham 测出了准确率高 9 个百分点,同时周转次数少三分之一、耗时少 60%。法律 AI 团队 Applied Research 负责人 Niko Grupen 发现 Opus 5 在保持质量的同时,平均比 Opus 4.8 在最高推理强度下少生成了 26% 的 token。

更少的 token、更少的交互轮次、更少的人盯着屏幕。这就是 Opus 5 对“ 性价比” 的真正定义。

没人预料到的 30.2%

回到 ARC-AGI 3。这个数字的冲击力需要放在时间线上理解。

今年 3 月,Gemini 3.1 Pro 以 0.37% 领先。到 Opus 5 发布前,公开最强成绩是 GPT-5.6 Sol 在最大推理强度下的 7.8%。Opus 4.8 挂在 1.5%。Opus 5 发布当天直接拉到 30.2%。Anthropic 在公告中说 Opus 5 的成绩是“ 次优模型的三倍”,这个表述甚至可能是保守的,因为 GPT-5.6 Sol 的 7.8% 是在最大推理强度设置的极端资源消耗下拿到的,而 Opus 5 在标准推理设置下就做到了 30.2%。

ARC-AGI 3 它测的是遇到完全没见过的问题时的应变能力,Chollet 设计的逻辑是,把模型扔进一个没有任何参考框架的新世界,看它能不能靠自己理解规则、制定策略、达成目标。这才是“ 通用智能” 的真正含义。不是知识面有多广,而是面对未知时的适应速度有多快。

30.2% 意味着 Opus 5 在三分之一的情况下能独立完成人类能完成的任务,而这些任务是它绝对没有在训练数据里遇到过同类题型的。AI 从“ 超强模式匹配器” 向“ 自主推理系统” 的转变,正在被量化验证,而不是停留在口号层面。

但更值得追问的是,为什么 Anthropic 要发布一款在核心指标上碾压自家“ 旗舰” 的模型,还只卖一半的价格?

这需要看一圈 Opus 5 周围的定价坐标。

再回头看看 Fable 5 的 $10/$50。这个定价在 2026 年 7 月的市场上像一座孤岛,周围的海平面每天都在上涨。Fable 5 在 6 月 9 日发布时,它的“ 神话级”(Mythos-class) 性能确实值这个溢价。但仅仅 45 天后,Opus 5 就用不到一半的价格,在用户最关心的场景里拿出了更好的成绩。

Anthropic 面临的困境是,Fable 5 的定价正在被市场抛弃,而竞争对手,尤其是 Kimi K3 的开源攻势,正在从下方蚕食。继续守着 Fable 5 的高价策略,等于把高频使用场景 (编程、搜索、办公自动化) 的客户拱手让人。Anthropic 的选择是,与其等竞争对手来拆,不如自己先拆。用 Opus 5 把旗舰级能力注入中端产品线,在性价比战场正面迎战,同时让 Fable 5 继续守住“ 极致推理” 的利基市场。

Opus 5 的商业使命可以概括为一句话,证明 Anthropic 还能收前沿溢价。而 Anthropic 给出的回答是,不收了。或者说,前沿溢价的门槛被自己抬高了。你得先在 $5/$25 这个价格点上拿出比 Fable 5 更强的编程和推理能力,才有资格谈“ 溢价”。

大模型定价的逻辑,已经不太一样了

Opus 5 的发布,本质上宣告了大模型行业“ 越贵越强” 定价范式的终结。

过去两年,行业默认的逻辑是,更强的模型需要更大的参数、更多的训练算力、更高的推理成本,所以必然更贵。Fable 5 的 $10/$50 定价就是这条逻辑链的终极产物。我比任何人都强,所以我可以收最贵的钱。但 Opus 5 用数据证明了一件事,更强的推理架构和更高效的训练方法,可以让模型在价格不变甚至更低的情况下,性能跳升一个量级。

Opus 5 的定价和 Opus 4.8 完全相同 ($5/$25),但 Frontier-Bench 得分从 21.1% 跳到了 43.3%,ARC-AGI 3 从 1.5% 跳到了 30.2%。同样的价格,推理能力提升了一个量级。这不是边际改善,是范式跃迁。

“ 旗舰” 这个词本身的含义正在被重新定义。当一款 $5/$25 的模型能在你每天实际使用的场景里跑赢 $10/$50 的模型,“ 旗舰” 就从一个能力标签变成了一个价格标签,而价格标签是最容易被竞争对手撕掉的。

这给整个行业传递了一个清晰的信号:如果你今天的旗舰模型不能在效率上持续拉开代差,明天就会有一个价格只有你一半的模型在功能上超越你。Anthropic 今天自己动手拆掉了自己的价格金字塔,意味着它已经预判到了这个趋势不可逆转,选择主动引领而不是被动防守。

对于企业用户来说,Opus 5 是 2026 年迄今为止最值得认真评估的 AI 投入。在编程辅助 (尤其是 Claude Code 和 Cursor 等 IDE 场景)、自动化办公 (Zapier 等平台)、数据分析、科学研究等高频使用场景中,$5/$25 的定价结合超越 Fable 5 的性能,构成了当前市场上最清晰的性价比锚点。

但真正的变量在 7 月 27 日,Kimi K3 开源全部权重。当一个 2.8T 参数的模型可以免费部署、自由修改,且性能已经逼近前沿,整个行业的定价地板将再次被击穿。Opus 5 证明了“ 可以更便宜地做得更好”,而 Kimi K3 即将证明“ 可以几乎免费地做得差不多”。两条线同时推进,留给任何一家 AI 公司维持高溢价的窗口期,正在以天为单位收窄。

当一家公司开始用中端型号的价格卖旗舰级别的性能,这表明与其等对手来拆你的定价,不如自己先把牌桌掀了。

(本文首发钛媒体 APP,作者 | AGI-Signal,编辑 | 秦聪慧)

更多精彩内容,关注钛媒体微信号 (ID:taimeiti),或者下载钛媒体 App

相关 文章

YC掌门人最新分享:AI时代,永远不要做一次性工作

Seesaw、Manner、M Stand 为何结出了不同的果实?

来自 周天财经
2026 年 7 月 25 日
0

(本文作者为 品牌棱镜 BrandPris...

安踏品牌CEO徐阳离任;得物App首个AI鉴别机器人亮相WAIC;泡泡玛特王宁带队参访苹果总部;HOKA官宣品牌代言人侯明昊|消研所周报

中文播客,词汇通胀

来自 周天财经
2026 年 7 月 25 日
0

(本文作者为 吴怼怼,钛媒体经授权发布)...

4100美元关口得而复失,下半年黄金还能涨吗?

4100 美元关口得而复失,下半年黄金还能涨吗?

来自 周天财经
2026 年 7 月 25 日
0

(本文作者为 产联社 CLS,钛媒体经授权...

「母告子」撤诉后股价大跌6.65%,广安爱众缺的何止这4.79亿元

「母告子」 撤诉后股价大跌 6.65%,广安爱众缺的何止这 4.79 亿元

来自 周天财经
2026 年 7 月 24 日
0

(图片系 AI 生成)7 月 24 日,广安爱众 (...

adidas户外线启用中文名「山川里」;雅诗兰黛 2026 雅创未来创新大赛启动招募;AMIRO觅光完成D+轮融资|消研所周报

adidas 户外线启用中文名 「山川里」;雅诗兰黛 2026 雅创未来创新大赛启动招募;AMIRO 觅光完成 D+轮融资|消研所周报

来自 周天财经
2026 年 7 月 24 日
0

(本文作者为 消研所 trendmaker...

加载更多
广告
  • 热门
  • 评论
  • 最新
神马经典投研: 集资讯、策略、研报一站式期货投研工具

神马经典投研: 集资讯、策略、研报一站式期货投研工具

2025 年 11 月 7 日
「我们也深陷残酷价格战」,德资巨头中国区高管警告

「我们也深陷残酷价格战」,德资巨头中国区高管警告

2025 年 8 月 4 日
一周产业基金|上海市人工智能CVC基金发布;湖北百亿人形机器人母基金来了

一周产业基金|上海市人工智能 CVC 基金发布;湖北百亿人形机器人母基金来了

2025 年 8 月 4 日
「硬科技」指数携手上涨,半导体设备ETF易方达(159558)、芯片ETF易方达(516350)等产品助力布局板块龙头

基民懵了!这个火爆的板块年内涨超 37%,主力却借道 ETF 狂抛逾 400 亿元

2025 年 9 月 20 日
Lesson 1: Basics Of Photography With Natural Lighting

The Single Most Important Thing You Need To Know About Success

4
Lesson 1: Basics Of Photography With Natural Lighting

Lesson 1: Basics Of Photography With Natural Lighting

3
Lesson 1: Basics Of Photography With Natural Lighting

5 Ways Animals Will Help You Get More Business

2
Lesson 1: Basics Of Photography With Natural Lighting

New Cryptocurrency That Will Kill Of Bitcoin

2

三大股指低开高走,沪指半日上涨 0.5%

2026 年 7 月 25 日

国产算力迎多点突破,人工智能 ETF 易方达 (159819) 等受资金青睐

2026 年 7 月 25 日

金价还会继续下跌吗

2026 年 7 月 25 日

两部门明确离岸信托个税事项

2026 年 7 月 25 日
  • 隐私政策
  • 联系我们
  • 关于周天
  • 登录
  • 注册
投诉建议:+86 13326565461

© 2025 广州小舟天传媒有限公司 by 周天财经 - 粤 ICP 备 2025452169 号-1

没有结果
查看所有结果
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金

© 2025 广州小舟天传媒有限公司 by 周天财经 - 粤 ICP 备 2025452169 号-1

欢迎回来!

在下面登录您的帐户

忘记密码? 注册

创建新帐户!

填写以下表格进行注册

所有项目需要填写。 登录

重置您的密码

请输入您的用户名或电子邮件地址以重置密码。

登录

用户登录

还没有账号?立即注册

用户注册

已有账号?立即登录