Anthropic 于 2026 年 7 月 25 日发布 Claude Opus 5,这是本站赖以立足的论点迄今遇到的最强反例。先上数字:每百万 token 输入 $5 / 输出 $25——与 Opus 4.8 完全同价——而这个模型现在以 61 分登顶 Artificial Analysis 智能指数,高出 Claude Fable 5 一分、GPT-5.6 Sol 两分、Kimi K3 四分。按 AA 的任务核算,它的成本还比 Fable 5 低 26%。"半价买到贴脸旗舰"——这正是国产模型霸占了一整年的"每块钱买能力"话术。那么性价比论还站得住吗?站得住——但阵地挪了,值得把挪到哪里说精确。截至 7 月 26 日,首日信息,注意事项照标。
这次发了什么
| Claude Opus 5 | |
|---|---|
| 发布 | 2026 年 7 月 25 日 |
| 价格/百万 | 输入 $5.00 · 输出 $25.00(与 Opus 4.8 持平);Fast 模式约 2.5 倍速、2 倍价 |
| 上下文 | 100 万 token · 知识截止 2026 年 5 月 |
| 推理档位 | 五档——AA 打分从 51(low)到 61(max),输出 token 相差约 8 倍 |
| AA 智能指数 | 61,新科榜首,前压 Fable 5(60)、GPT-5.6 Sol(59)、Kimi K3(57) |
| Agent 知识工作 | GDPval-AA v2 与 AA-Briefcase 双登顶;配 Claude Code 并列 AA 编程 Agent 指数第一;Terminal-Bench 2.1 约 89%,追平 Sol |
首日实测圈的风向,为平衡也要放上:工程能力是共识项("一年以来 A 社模型的集大成"是有代表性的评语);槽点是话痨、安全甲太厚、写作文风退步,以及一个真正反直觉的发现——多位测试者认为 mid 档才是甜点位,max 档烧掉大量 token 换边际提升。AA 自己的数据补了一刀更狠的:事实性知识仍落后 Fable 5,AA-Omniscience 幻觉率比 Opus 4.8 升了 14 个百分点、达到 50%。榜首是真的;但不是全维度的榜首。
对国产阵容,把账算诚实
跑我们一贯的参考负载——每月 6000 万输入 + 1200 万输出 token,牌价,不计缓存:
| 模型 | 月成本 | AA 指数 | 相对 Opus 5 |
|---|---|---|---|
| Claude Fable 5 | $1,200 | 60 | 2.0× |
| GPT-5.6 Sol | $660 | 59 | 1.1× |
| Claude Opus 5 | $600 | 61 | — |
| Kimi K3 | $360 | 57 | 0.60× |
| GLM-5.2 | $137 | 51 | 0.23× |
| DeepSeek V4-Pro | $37 | — | 0.06× |
这张表要读两遍,因为两种读法都成立:
Opus 5 真正改变的。闭源前沿给自己重新定了价。Opus 5 让 Fable 5 在多数负载下变得难以辩护(能力同一档,账单两倍),又从上方挤压 GPT-5.6 Sol。如果你的预算在每月 $500 以上这一档,闭源选项之间的算盘有了新默认——而"国产模型 or 白给"那个偷懒版本的性价比论,死了。其实 K3 定出 $3/$15 时它就已经在晃;Opus 5 确认了"闭源躺着贵十倍"的时代结束。
它没有改变的。在那一档以下,梯子完好,价差依然是决定性的。Opus 5 的输出 token 价格是 GLM-5.2 的 5.7 倍——而 agent 负载烧钱恰恰烧在输出上。GLM-5.2 用 Opus 5 约 23% 的月成本,交出它 84% 的指数分;单看编码,2.5 分的 SWE-bench Pro 差距对着 4.4 倍的账单。K3 在两项 token 价上都比 Opus 5 便宜 40%,指数差四分——而 K3 自己的独立成本问题也说明:旗舰真实成本跑过牌价的,不止 Anthropic 一家。至于 DeepSeek V4 的地盘——大多数批量工作真正生活的 $12–37/月档——Opus 5 根本没打算来争。
降价碰不到的那个维度
发布周还有一件事,而且不是跑分。就在这一周,近 200 家硅谷公司——包括 Y Combinator——联名致函白宫,要求不要禁止美国企业调用中国开源模型,点名 Kimi K3 和 Qwen 3.8;英伟达黄仁勋、Pichai、Altman 相继公开为开源权重站台(禁令问题的完整追踪)。而所有这些信上都缺席的唯一主要实验室:Anthropic。
这就是降价碰不到的结构差异。Opus 5 是租的——出色,但可被收回。GLM-5.2 今天就是 MIT 许可;K3 权重承诺 7 月 27 日前;国产阵容可以自部署、可审计、无论政策和定价接下来怎么走都能继续跑。对美国创业公司,那封联名信关乎访问权风险;对其他所有人,它关乎锁定。半价的闭源,依然是闭源。
实际怎么办
- 非前沿不可的负载(最难的 agent 工作、深度研究):Opus 5 现在是理性的默认席位——同等或更高的分数,Fable 5 一半的价。该给的认可照给。
- 那道杠以下的 90% 工作:梯子照赢。编码性价比 GLM-5.2,重浏览 agent 等 K3 容量恢复,批量走 DeepSeek V4——排位全图依然成立。
- 无论哪种:做路由,别结婚。OpenAI 兼容端点让"难的 10% 给 Opus、其余给国产"变成一个配置文件而不是架构决定——混合方案在成本上打赢任何单模型答案,自己的量拿价格计算器算。
上面每个国产模型,今天就在 Turiloop 一个 OpenAI 兼容 Key 背后——国际卡、免中国手机号。
常见问题
Claude Opus 5 多少钱? 每百万 token 输入 $5、输出 $25——与 Opus 4.8 同价,买到的是登顶指数的能力。另有 Fast 模式,约 2.5 倍速、双倍价格。
Opus 5 比 Kimi K3 强吗? 综合评分是的——AA 给 Opus 5 61 分对 K3 的 57,且 Opus 5 登顶了 K3 此前排第二的 agent 知识工作榜。K3 的还手牌是低 40% 的 token 价格和承诺 7 月 27 日前的开源权重。月预算 $500 以上 Opus 5 是更强席位;以下,K3 和 GLM-5.2 守住性价比王座。
Opus 5 比 GLM-5.2 划算吗? 按每块钱算,不。GLM-5.2 用约 23% 的月成本交出 Opus 5 84% 的指数分,输出 token 便宜 5.7 倍。任务真需要前沿级推理时 Opus 5 赢;其余场合,账单归 GLM-5.2。
Opus 5 是否终结了用国产模型的理由? 它终结的是偷懒版本("闭源永远贵十倍")。它碰不到结构性理由:开源权重、可自部署、不暴露在单一厂商的定价与政策之下——本周美国那场联名信之争,恰恰把中国开源模型点名为值得保住访问权的东西。