DeepSeek 预告了一个半月的正式版,7 月 31 日终于开始落地——落了一半,而且是没人想到会当头条的那一半。DeepSeek-V4-Flash-0731 进入正式公测:架构与预览版完全一致(总参 284B、激活 13B),官方说法是"只重做了后训练"——而这次重训把它带进了小模型不该到达的区域:Agents' Last Exam 拿 25.2,Claude Opus 4.8 是 25.7。一个每百万 token $0.14/$0.28 的模型,在 agent 基准上贴脸一个 $5/$25 的旗舰,差半分。权重当天跟进上了 Hugging Face。V4-Pro 正式版定档 8 月初。以下是已核实的全部,截至 8 月 1 日。
数字
以下全部为 DeepSeek 发布材料里的成绩——厂商数字,待独立复测,按此标注:
| 基准 | V4-Flash-0731 | 参照 |
|---|---|---|
| Agents' Last Exam | 25.2 | Opus 4.8 为 25.7——约 1% 的价格,贴脸的分数 |
| Terminal-Bench 2.1 | 82.7 | 距 Kimi K3 的 88.3 只差六分——而体量是它的十分之一 |
| CyberGym | 76.7 | — |
| Toolathlon(verified) | 70.3 | — |
| NL2Repo | 54.2 | — |
| DeepSWE | 54.4 | — |
媒体的框架很直白:重训后的 Flash 在九项 agent 基准上击败了自家的 V4-Pro 预览版。社区的震惊集中在一个数字——284B——和一个问题:它凭什么打体量五到十倍的模型?发布本身给出的答案是:基模底子本来就好,而拉开差距的手艺已经挪到了后训练。架构没动,体量没动,训练配方动了,值这么多。
对用户真正变了什么
- 升级的是 agent 行为。整张基准表全是 agent 项——终端、工具、仓库、攻防靶场。如果你在 agent 循环里跑 Flash,0731 和预览版是两种动物。
- 支持 Responses API、已适配 Codex——正式版原生说新接口。
- 价格没动。未宣布任何调价:牌价仍是输入 $0.14 / 输出 $0.28,缓存命中约 $0.014。能力挪了位,地板价还是地板价。
- 权重当天上 Hugging Face。公告在前、上传当天稍后——但就是当天。对照 K3 的"承诺-兑现"弧线和 Qwen3.8 至今悬着的"即将",DeepSeek 是把"发布日开源"保持为事实、而非路线图条目的那家。
时机本身就是话
它落在模型市场有史以来最锋利的价格周正中间。二十四小时前,OpenAI 刚把 GPT-5.6 Luna 砍价 80% 到 $0.20/$1.20——一枪正瞄着 DeepSeek 统治的跑量档。Flash-0731 就是还击,而且改变了那场对决的形状:Luna 拼价格的对手,刚交出贴脸 Opus 的 agent 成绩、两项 token 价还都更便宜。市场的地板不再是弱模型住的地方;它是最锋利的工程现身的地方。
对本站从七月中旬追到现在的 V4 转正传奇,记分卡是:滑过窗口、一拆为二、Flash 先行——而从证据看,值得等。V4-Pro 正式版定档 8 月初,平台公告显示 Pro 缓存价 8 月 3 日起调整——社区把那个日期读作大概率的发布日。
72 小时后:社区的判词
正式版的第一个周末,给出了比发布表更完整的画面——两个方向都有料。
赢的部分是真的。在 VulcanBench 的 Eval Suite 3 上,V4-Flash-0731 拿了 91 分、排名第一,压过 Grok 4.5、Claude Fable 5 和 GPT-5.6——不过社区对第三方野榜的信任已经薄到,高赞回复在要"一个排行榜置信度的排行榜"。成本账也被人群复核了:一篇高赞拆账帖算出,低用量 API 场景下它比 GPT-5.6 Luna 便宜约六倍——即便在 Luna 降价 80% 之后。而最锋利的背书来得很侧面:有人问"编码能力比 Claude Opus 4.6 强的模型有哪些",最高赞的回答只有一个 model id:*deepseek-v4-flash-0731*。
输的部分也是真的。一位开发者把 Flash-0731 当执行子代理跑生产任务,6 个候选里只有 1 个首轮验收通过——83.3% 的不合格率,退件全部升级给 GPT-5.6 Sol 收尾。一个工作负载,不是终审——但它恰恰是厂商表格永远不给你看的规律:发布 harness 里的精英分数,你的 harness 里的毁誉参半。本文开头就挂着这句免责;周末补上了实例。
还有一笔真实的交换浮出水面:正式版拒答变多了。买来 agent 分数的那次重训,也把内容护栏拧得明显比预览版紧——流传最广的抱怨是"再也不是那个指哪打哪的模型了",同时也有用户表示完全没撞过墙。社区有一种理论,把新的拒答反射归因于训练数据里 Claude 语料过重,依据是模型偶尔自认是 Claude;未经证实,但这场争论本身已经是这个模型公开档案的一部分。如果你的用例贴着内容边界,迁移前先测;如果不贴,这次升级仍然是白拿的能力。
*8 月 5 日更新:*需求端的判决也到了,还顺手压垮了交付它的基础设施——OpenRouter 一周超 7 万亿 token(全平台第一)、8 月 4 日官方 API 至少四波故障、503 文案直接建议用户"暂时切换其他大模型 API 服务商"。完整拆解(包括它对 V4-Pro GA 的信号意义、以及怎么围绕它搭故障转移)见过载分析。
拿它做什么
- 已经把跑量活路由给 Flash 的(我们的指南整个夏天都在推荐的套路):你白拿了一次升级——同一个 id、同一个价、更强的模型。在 Turiloop 上,
deepseek-v4-flash走 DeepSeek 官方伺服线,0731 会落在你已经在调的那个 id 下,零接入改动。 - 在中档模型上跑 agent 栈的:重新测一轮。一个 $0.28 输出价、82.7 Terminal-Bench 的模型,重置了"够用的 agent 模型"该花多少钱——按习惯付旗舰价之前,先拿自己的轨迹跑一遍。价格计算器里有全阵容。
- 等 V4-Pro 的:8 月初,盯 8 月 3 日。追踪页落地即更新。
常见问题
DeepSeek V4-Flash-0731 是什么? DeepSeek V4 Flash 的正式版,2026 年 7 月 31 日公测发布:与 4 月预览版完全相同的 284B/13B MoE 架构,完整重做后训练,agent 能力大幅跃升(Terminal-Bench 2.1 82.7、Agents' Last Exam 25.2),权重当天开源。
V4 Flash 价格变了吗? 没有——牌价仍是每百万 token 输入 $0.14、输出 $0.28,缓存命中约 $0.014。正式版在价格不变的前提下升级了能力。
V4-Flash-0731 真的接近 Claude Opus 4.8 吗? 在 Agents' Last Exam 上,DeepSeek 公布的数字是 25.2 对 Opus 4.8 的 25.7——单项 agent 基准贴脸,输出价约为对方的 1%。这是待独立复测的厂商数字,单一基准也从不代表全貌——但它声称的差距,在这个体量级前所未有。
DeepSeek V4-Pro 正式版什么时候来? 按 DeepSeek 文档是 2026 年 8 月初;平台公告里 Pro 缓存价 8 月 3 日起调整,社区把这一天读作大概率的发布日。
要拿到新版本,我需要改什么吗? 不需要。model id 未变——任何 OpenAI 兼容端点(包括 Turiloop)下的 deepseek-v4-flash,随官方铺开即伺服正式版。