全部文章

DeepSeek 官方 API 开口劝用户"先用别家":V4 Flash 的七万亿 token 周

· DeepSeek· 可靠性· 基础设施

8 月 4 日,全世界最火的模型有大半天处于够不着的状态。DeepSeek 官方 API 一天之内至少崩了四次,它的 503 报错里写着一句几乎不可能出自前沿实验室之口的话:*"Service is too busy. We advise users to temporarily switch to alternative LLM API service providers."*(服务过于繁忙,建议用户暂时切换其他大模型 API 服务商。)不是"稍后再试"——是"去别家"。原因不神秘。V4-Flash-0731 转正四天后,OpenRouter 周榜把它加冕为全平台调用量第一:7 月 28 日至 8 月 3 日一周超过 7 万亿 token,周环比再涨 13%。市面上最便宜的能干活的模型,现在也是最供不应求的。什么在崩、为什么、以及怎么照常在它上面干活——截至 8 月 5 日核实如下。

挤爆背后的数字

  • 仅 OpenRouter 一家,一周超 7 万亿 token——全平台调用量第一,距正式版发布只有四天。
  • OpenRouter 之外:一家 AI 编码工具报告 V4 Flash 单日烧掉约 8 万亿 token——约 5 万亿来自免费额度、3 万亿来自付费套餐——比 OpenRouter 全平台约 6.6 万亿的日均还多。
  • 崩溃侧:一块社区监控面板记录到官方端点 3 小时 20 分钟内 605 个请求失败 144 个(约 24%);用户数出 8 月 4 日至少四波报错。
  • 企业侧的疼痛准时到账:把内部服务直连官方 Key 的团队,一整天都在接故障工单。

结构性原因就是价格本身。$0.14/$0.28、缓存命中约 $0.014,V4 Flash 重置了"够用的 agent 模型"的价钱——而编码工具伙伴的免费档,把几乎不计量的 agent 流量灌进了同一条伺服线。社区情绪已经开始心疼实验室:"该把那些免费服务限一限了,要被薅秃了。"当免费档吃掉付费的基础设施,所有人排在同一个 503 后面。

乐观的读法:这就是 Pro 发布前的样子

与抱怨并行流传的,是第二种读法:频繁的维护窗口和状态页的折腾,像是在为 V4-Pro 正式版(GA)做准备。DeepSeek 自家文档把 Pro 正式版定档 8 月初,平台公告里 Pro 缓存价 8 月 3 日起调整——这个日子如今已过、发布没来,追踪页把它记为一个滑掉的信号,而非撕毁的承诺。如果这些容量工程是在为 Pro 铺路,那这几天的崩溃就是下一场发布的症状,而不只是上一场的后遗症。这是推测,如实标注——但它是与维护规律最自洽的那种推测。

可靠性现在是价格的一部分

503 逼着你算的那笔不舒服的账:模型的牌价,不等于它在凌晨两点、agent 跑到一半时宕机的成本。三条实用笔记,重要性递增:

  1. "换别家"不是免费的。DeepSeek 官方的缓存命中价,比同一个模型在各大云厂商上的托管价便宜得多——社区比价把第三方缓存价放在官方的约 10 倍。盲目切换,你的缓存经济学当场蒸发。
  2. 超时和重试是基本功。请求超时拉过 60 秒、指数退避、把 503 当路由信号而不是死循环重试的理由。生产可靠性指南有全套模式——写在这个星期让它变成热点之前。
  3. 真正的保险是模型级故障转移,不是端点级。当源头本身饱和,通往它的每条路共享同一场故障。真正兜得住的 fallback,是同一接口后面的第二个模型家族——GLM-5.2($1.40/$4.40)或 Qwen 接住你 Flash 车道掉下来的流量。在 Turiloop,全阵容躺在同一个 OpenAI 兼容 Key 后面,正是为了让故障转移是路由配置里改一个 model id,而不是凌晨两点接一家新供应商。诚实的免责照旧:我们的 deepseek-v4-flash 走 DeepSeek 官方伺服线——源头噎住时,这条车道同样有感。差别在于:同一把 Key、同一种请求形状,还能到达什么。

这一周真正证明了什么

剥掉宕机的戏剧性,OpenRouter 的王座说出了跑分口水战说不出的事:市场已经用一周七万亿 token 投了票——地板价上的准前沿 agent 能力,就是新的默认选项——而"当所有人的默认"的基建账单,以四波 503 的形式到期了。V4 Flash 发布文说这次重训是"市场地板上最锋利的工程";8 月 4 日证明,市场的地板现在有了承重问题。接下来盯两件事:DeepSeek 会不会给免费水龙头装表,以及维护规律会不会收束成一场 V4-Pro GA。本页和追踪页两头都更新。

常见问题

DeepSeek API 为什么崩了? 需求。V4-Flash-0731 于 7 月 31 日转正后,仅 OpenRouter 周调用量就超 7 万亿 token,编码工具免费档每天再灌数万亿。2026 年 8 月 4 日,官方 API 至少四波 503,报错文案直接建议用户暂时切换其他供应商。

DeepSeek 503 怎么处理? 请求超时拉到 60 秒以上、指数退避重试、持续饱和时改路由而不是硬砸。生产 agent 应在同一 OpenAI 兼容接口后配好备用模型(GLM-5.2、Qwen),让故障转移只是改一个 model id。完整模式见可靠性指南

这些故障和 V4-Pro 发布有关吗? 有可能。社区把频繁维护读作 V4-Pro GA 的铺路——Pro 定档 8 月初,原定 8 月 3 日的缓存价调整已过期未发。DeepSeek 官宣之前都算未证实;追踪页持续记录信号。

这么不稳,V4 Flash 还值得用吗? $0.14/$0.28 配贴脸 Opus 的 agent 成绩,值——这笔经济账扛得住一个糟糕的星期。可行的姿势:Flash 当跑量主车道,配超时、重试和第二个模型家族做故障转移,让 503 浪冲掉的是吞吐量,而不是你的在线率。

故障期间第三方 DeepSeek 端点更便宜吗? 通常相反。社区比价显示主要云厂商的缓存命中价约为 DeepSeek 官方的十倍。第三方容量买到的是可用性,不是经济性——把跑量流量改道之前,先把缓存价差算进去。