全部文章

GPT-5.6 对比 GLM-5.2 和 DeepSeek:那道没关上的价格差

· GPT-5.6· GLM· DeepSeek· 价格

OpenAI 在 2026 年 7 月 9 日发布了 GPT-5.6,分三档:Sol 每百万 token $5/$30,Terra $2.50/$15,Luna $1/$6。头条是 Luna——这是 OpenAI 第一个把价格定进国产开源权重模型价格带的型号。但编程跑分讲的是另一个故事:SWE-bench Pro 上,旗舰 Sol 拿 64.6,只比 GLM-5.2 的 62.1 高 2.5 分——输入价却是它的 3.6 倍、输出价 6.8 倍。想用有限预算买到贴近前沿的编程能力,这笔账和上个月指向同一个方向。

2026 年 7 月 30 日更新:发布三周后,OpenAI 把 Luna 降价 80%(现 $0.20/$1.20)、Terra 降 20%(现 $2/$12),Sol 不变——官方归因于效率提升。下方所有表格已按新价刷新;本文开头的战略判断不但成立,还加速了:国产阵容挑起的价格战,一个月之内就在挪动 OpenAI 自己的牌价。*(8 月 4 日跟进:OpenAI 的 Tibo 确认 Luna 降价为永久性——"效率提升不会消失"。新地板,就是地板。)*

这是短版本。长版本有实打实的细节——包括一桩值得知道的跑分争议——下面把全貌摆开。

这次发了什么

档位输入/百万输出/百万缓存输入上下文
GPT-5.6 Sol$5.00$30.00$0.501M
GPT-5.6 Terra$2.00$12.00$0.201M
GPT-5.6 Luna$0.20$1.20$0.021M

三档都是 100 万 token 上下文、12.8 万最大输出,知识截止 2026 年 2 月 16 日。缓存输入按未缓存价的 10% 计。API 里的 gpt-5.6 是 Sol 的别名。Sol 与退役中的 GPT-5.5 同价;Terra 和 Luna 是新增的更便宜档位。(价格取自 OpenAI 官方牌价,2026 年 7 月 9 日 GA 当日。)

对做 agent 的人,这次的 API 新东西才是重点:程序化工具调用、并行子 agent、提示缓存断点——OpenAI 在追的,正是 GLM-5.2 为之而生的那类长程 agent 负载。

跑分,如实讲

SWE-bench Pro 是当下被引用最多、也最难的软件工程基准:

模型SWE-bench Pro输入/输出(每百万)
Claude Fable 580.0$10 / $50
GPT-5.6 Sol64.6$5 / $30
GLM-5.262.1$1.40 / $4.40

两个注意点,方向相反、都得说。其一:OpenAI 认为这个基准本身有毛病,称约 30% 的题目存在问题——若属实,所有人的分数都被压低了。其二:独立评测机构 METR 报告称,Sol 在其软件工程评测中"钻空子"的检出率创下 METR 有史以来最高——利用评测漏洞、走捷径而非真正完成任务。两件事放在一起读这张表。没有争议的是:Fable 5 领跑,Sol 和 GLM-5.2 在下一梯队里贴得很近。

在 OpenAI 自己主推的基准——Agents' Last Exam(长程 agent 评测)上,Sol 拿 53.6、领先 Fable 5 约 13 分,这是 OpenAI 发布时自报的数字。首日上手的评测(包括 Simon Willison)给的口径是:"确实有竞争力,但难的编程任务上没有明显超过 Fable。"

真正该比的:每一块钱买到多少能力

按一份贴近现实的编程助手月负载算——每月 6000 万输入 token、1200 万输出,不计缓存:

模型月成本SWE-bench Pro
GPT-5.6 Sol$66064.6
GPT-5.6 Terra$264未公布
GLM-5.2$13762.1
Kimi K2.6$105
DeepSeek V4-Pro$37
GPT-5.6 Luna$26未公布
DeepSeek V4-Flash$12

想按你自己的量算,用价格计算器——国产阵容全在里面,GPT-5.6 各档的价格照上表代入即可。

这张表的结构一目了然——而 7 月 30 日的降价重画了它的下半区。$26/月的 Luna 已经彻底离开 GLM-5.2 的邻里,搬进了 DeepSeek 的跑量档,连 V4-Pro 都被压过。没变的是证据问题:Luna 仍是 OpenAI 最小的档位、没有公布 SWE-bench Pro 成绩,而 GLM-5.2 的跑分距 OpenAI 的旗舰只差 2.5 分。所以诚实的比法依然不是"Luna 对 GLM-5.2",而是两个分开的问题:旗舰级编程,Sol 要 $660、GLM-5.2 要 $137,那道 4.8 倍的差距在降价后原封未动;跑量的活,Luna 如今是 V4-Flash 的正面挑战者,正确答案是拿自己的流量把两个都测一遍。

而 GLM-5.2 之下,价格地板还在往下走。DeepSeek V4-Pro 月付 $37,算法向的 LiveCodeBench 拿最高分(93.5);V4-Flash 月付 $12,接走日常大批量。各档细账见价格全景

Luna 真正改变了什么

发布时,"Luna 把价格定进国产地盘"是新闻;三周后 OpenAI 又砍 80%——到 $0.20/$1.20——这个故事就不再需要解读了。一个 OpenAI 模型如今压过 DeepSeek V4-Pro、只比 V4-Flash 高一级;开源权重定下的价格地板不只是在约束 OpenAI 的定价,而是在一个月一个月地往下拽它。如果 Luna 的质量接近 Terra,它就是正经的跑量档选项,句号。

连 80% 降价也没改变的:顶级编程能力的价格(Sol 的 $30 输出原地不动,GLM-5.2 的旗舰贴身车道毫发无损)、Luna 依旧零公开基准、以及结构性差异——GLM-5.2 依旧 MIT 许可、可自部署,对下一次任何方向的重新定价都免疫。

逐档对比:Luna、Terra、Sol 对 GLM-5.2

GPT-5.6 Luna 对 GLM-5.2。发布时这俩是价格双胞胎;7 月 30 日的降价终结了这件事。$0.20/$1.20 的 Luna,输入价只有 GLM-5.2 的七分之一、输出价不到三分之一——参考月 $26 对 $137。没挪动的是证据:GLM-5.2 有公开的 SWE-bench Pro 成绩、离 OpenAI 自家旗舰只差 2.5 分;Luna 仍是最小档、零公开编码基准。所以对位换了形状:要有实证的编码,GLM-5.2 守着车道;要跑量,Luna 刚成为 V4-Flash 的闭源对答案——这个价位,把两个都拿自己流量测一遍,成本是零头的零头。

GPT-5.6 Terra 对 GLM-5.2。降价 20% 后,Terra 输入贵 1.4 倍、输出贵 2.7 倍($2/$12 对 $1.40/$4.40)。OpenAI 发布时的说法是 Terra 在其 agent 评测上以零头成本压过 Fable 5——若能扛住独立复测,Terra 是 agent 负载里有意思的中间档,降价让它更锋利了。但按每块钱的编码能力算结论未变:GLM-5.2 的 SWE-bench Pro 62.1,输出价远不到 Terra 的一半。

GPT-5.6 Sol 对 GLM-5.2。上表里的旗舰对位:SWE-bench Pro 64.6 对 62.1——2.5 分——参考负载月账单 $660 对 $137。最难的 agent 活 Sol 配得上(Agents' Last Exam,OpenAI 自报);除此之外,4.8 倍的溢价买到的代码质量少得可怜。

实际怎么选

  • 最难的 agent 工作流、预算次要——Claude Fable 5 仍以 80 分坐在 SWE-bench Pro 顶端;GPT-5.6 Sol 是更便宜的前沿席位,agent 向评测(OpenAI 自报)成绩强。
  • 旗舰贴身的编程能力、水电煤价格——GLM-5.2。SWE-bench Pro 距 Sol 只差 2.5 分,负载成本约五分之一,100 万上下文,MIT 许可。完整论证见深度拆解
  • 算法密集任务——DeepSeek V4-Pro,LiveCodeBench 最高分,$0.435/$0.87。
  • 大批量的活——DeepSeek V4-Flash 或 GPT-5.6 Luna;这个价位,拿你自己的流量各测一轮,让结果说话。更完整的决策树见编程模型怎么选

对多数团队,实际答案不是选一个模型,而是路由:大头走便宜档,难的那 10% 上强模型。这需要一个"换模型只是改配置、不是搬家"的接入点。

自己跑一遍对比

Turiloop 给你一个 OpenAI 兼容的 Key,调 GLM-5.2、DeepSeek、Kimi、MiniMax——按量付费、国际卡、免中国手机号。把你现有的 OpenAI SDK 指到 api.turiloop.com/v1,拿你本来要发给 GPT-5.6 的提示原样跑一遍,答案和账单摆在一起比。一个 Key 调到所有模型

常见问题

GPT-5.6 有哪几档,什么价? 2026 年 7 月 30 日降价后:Sol(每百万 token 输入 $5/输出 $30,未变)、Terra($2/$12,降 20%)、Luna($0.20/$1.20,降 80%)。均为 100 万上下文、12.8 万最大输出;缓存输入按未缓存价的 10% 计。

编程上 GPT-5.6 比 GLM-5.2 强吗? SWE-bench Pro 上 GPT-5.6 Sol 64.6、GLM-5.2 62.1——2.5 分的优势,代价是 3.6 倍输入价、6.8 倍输出价。多数编程负载下,按"每块钱买到的能力"算,GLM-5.2 明显占优;最难的 agent 任务,Sol 或 Claude Fable 5(80.0)直接领先。

GPT-5.6 Luna 比国产模型便宜吗? 7 月 30 日之后,大体是了:$0.20/$1.20 的 Luna 参考月约 $26——低于 GLM-5.2($137)、Kimi K2.6($105),连 DeepSeek V4-Pro($37)也被压过,只有 V4-Flash($12)仍更便宜。不变的警示:Luna 没有公开的 SWE-bench Pro 成绩,把量切过去之前先拿自己的流量测。

GPT-5.6 的跑分数字可信吗? 谨慎对待。OpenAI 质疑 SWE-bench Pro 的题目质量,METR 则报告 Sol 在其软件工程评测中钻空子的检出率破纪录。发布周的数字当方向看,下决定前拿自己的负载实测。