全部文章

2026 年 7 月国产大模型排位:Kimi K3、GLM-5.2、DeepSeek V4,各强在哪

· 选型· 国产模型· GLM· 对比

2026 年 4 到 6 月,国产实验室接连放出好几个强开源模型。它们不做同一件事,所以有用的问题不是"哪个整体最好",而是"手头这个活该用哪个"。下面把它们怎么分工讲清楚,带上跑分和价格。

一句话结论

要一个名字,就是 GLM-5.2。智谱 6 月 13 日发布,它成了第一个领跑 Artificial Analysis 智能指数的开源模型:51 分,综合第四,前面只有 Fable 5、Opus 4.8、GPT-5.5。SWE-bench Pro 拿 62.1,100 万 token 上下文,MIT 开源。完整拆解见 GLM-5.2 深度

这是你的默认选择。其余的看你在做什么:DeepSeek V4-Pro 仍在纯算法编程上最强,V4-Flash 赢在成本,Kimi 赢在长上下文工具调用。

*2026 年 7 月 17 日更新:*能力王冠易主了。Kimi K3(7 月 16 日发布)以 Artificial Analysis 总榜第三的位置压过其余所有国产模型,前面只剩 Fable 5 和 GPT-5.6 Sol。但它的定价也是旗舰级($3/$15),开源权重承诺了但还没放出。放进这份指南的语境里就是:K3 是新的天花板,GLM-5.2 仍是性价比默认。两者下面都有各自的段落。

DeepSeek V4-Pro:代码与推理旗舰

1.6 万亿参数、490 亿激活。它在 LiveCodeBench 上以 93.5 登顶,Codeforces 评分 3206,已是大师级别,压过多个闭源 API。agent 任务上 Terminal-Bench 2.0 拿 67.9%,高难推理上 GPQA Diamond 拿 90.1%。

正经代码生成、竞赛级逻辑、质量决定成败的 agent 循环,用它。在 Turiloop 上它只是闭源价格的零头,当前全模型还有折扣。看实时价格

DeepSeek V4-Flash:成本杀手

2840 亿总参、130 亿激活——而自正式版 0731(7 月 31 日发布)起,它牺牲的能力已经不多了:完整重训把它抬到 Terminal-Bench 2.1 的 82.7、Agents' Last Exam 贴脸 Opus 4.8 的区间,价格仍是约 $0.14 / $0.28 每百万 token,命中缓存约 $0.014。

把不需要深推理的活交给它,也就是大多数大批量的活:分类、抽取、摘要、初稿。在 Turiloop 上每 token 的成本基本可以忽略。

GLM-5.2:新的综合王者

智谱 6 月 13 日的 GLM-5.2,是市面上最强的开源模型。它 Artificial Analysis 智能指数 51 分(开源第一)、SWE-bench Pro 62.1,在跨多文件的 GitHub issue 上压过 DeepSeek V4-Pro 的 55.4。它带 100 万 token 上下文和 MIT 权重。底层是 7440 亿 MoE、约 400 亿激活,这就是它能用非前沿的价格给你贴近前沿质量的原因。

把它设成正经编程和长程 agent 的默认。它现在既是全能选手,也是要被挑战的那个标杆。如果用不上这点优势,更老的 GLM-5.1 是更省的日常档。在 Turiloop 上按量付费、用国际卡。完整拆解见 GLM-5.2 深度

Kimi K3:新的能力天花板

月之暗面 7 月 16 日发布的 K3,是 2.8 万亿参数 MoE、100 万上下文,坐上 Artificial Analysis 总榜第三——综合能力最强的国产模型,BrowseComp 已发布最高分(91.2),长程 agent Elo 只输 Fable 5。价格每百万 $3/$15(缓存输入 $0.30),输入约是 GLM-5.2 的两倍、输出三倍多,且只有"max"一档推理、思考 token 是实打实要付的。重浏览、重工具、长程的 agent 硬活,便宜档啃不动时,用它。完整规格、基准和诚实成本账见 K3 发布拆解

Kimi K2.6:长上下文 agent

月之暗面为长文档和多步 agent 造了 K2.6。它 Terminal-Bench 2.0 拿 66.7%SWE-Bench Pro 约 58.6%,提示缓存定价(缓存读取约 $0.16/M)让一段长而复用的 system prompt 在整个会话里都很便宜。

大上下文分析、agent 流水线、任何复用一大段稳定提示的场景,用它。在 Turiloop 上它比任何闭源前沿模型都便宜。

MiniMax M2.5:性价比通用选手

MiniMax 的 M2 系列是聊天和助手类工作的性价比通用选手,在 Turiloop 上也是个低成本全能档。想要便宜又能打、又不想在选型上多费脑筋的通用助手流量,用它。

每种活一句话

  • 性价比默认,编程与 agent → GLM-5.2
  • 能力天花板,最难的 agent 活 → Kimi K3
  • 纯算法难代码 → DeepSeek V4-Pro
  • 大批量便宜任务 → DeepSeek V4-Flash
  • 预算有限的日常代码 → GLM-5.1
  • 长上下文与提示复用 → Kimi K2.6
  • 通用助手流量 → MiniMax M2.5

最省又好的配置几乎从来不是单一模型,而是把每种活路由给合适的那个。在 Turiloop 上它们都在一个 OpenAI 兼容的 Key 背后,切换只是改一行 model,国际卡按量付费。