全部文章

Qwen3.8-Max 正式发布:2.4 万亿参数、$2/$6——以及 Max 级史上首次开源权重

· Qwen· 发布· 阿里

阿里在 2026 年 8 月 3 日把 Qwen3.8-Max 转正,并把本站从 7 月 19 日预览期追到现在的问题几乎全部作答。规格表落定:总参 2.4 万亿、每 token 激活约 95B,上下文 1M(最大输入 991K、最大输出 131K),原生文本+视觉输入,API 定价每百万 token 输入 $2、输出 $6、缓存命中 $0.25。然后是没人押注的那句话:权重下周开源——2.4T 旗舰和蒸馏版 Qwen3.8-27B 一起——上 Hugging Face 和 ModelScope。Max 级 Qwen 从未开源过。上一代旗舰说完"即将"就再无下文的实验室,刚刚承诺要交付市面上最大的开源模型。以下是已核实的全部,截至 8 月 4 日。

数字,以及它们瞄着谁

以下成绩全部出自阿里的发布材料——厂商数字,待独立复测。阿里自己的材料也注明:外部模型用的是各自偏好的 harness,部分基准是 Qwen 自家新出的;跨实验室对比只当方向参考。

基准Qwen3.8-Max参照
Terminal-Bench 2.186.6高于 Claude Opus 4.8 的 84.6——也高于 DeepSeek V4-Flash 的 82.7
SWE-bench Pro67.7Opus 4.8 为 69.2;Claude Fable 5 为 80.0
PaperBench93.0高于 GPT-5.6 Sol 的 90.5
FrontierSWE73.5高于 Opus 4.8 的 70.0
GPQA Diamond92.6
OSWorld-Verified86.1
DeepSWE 1.156.6

有一组数字不归厂商管:Arena。Qwen3.8-Max 上榜即 WebDev Arena 第 4(1668 Elo)——第 1 是 Opus 5 Max 的 1705——Text Arena 第 5(1496)Vision Arena 第 2(1305)。人群盲评的榜有自己的偏差,但它不归任何人的市场部管,三张榜全进前五,弱模型做不到。

整张基准表的取向很明白:终端、仓库、长程 agent、研究任务。阿里的演示也押在同一边——连跑多天的自主编码、500 轮的芯片设计会话。这是一个瞄着 Kimi K3 七月插旗的工作负载类别打的模型,输出价是 K3 的一半以下。

开源的转向

两周前,我们的预览追踪页把 Qwen3.8 的开源承诺归档在"惯犯风险"下:Qwen3.6-Max 说过类似的话,最后没开;我们当时写道,宣布开源买到的是光环,交不交付是另一个决定。这份怀疑现在有了到期日。这次的承诺是具体的——下周,权重上 Hugging Face 和 ModelScope,2.4T 的 Max 和 27B 蒸馏版一起——动机也被社区一眼点破,论坛上流传最广的一句读法是:*K3 把阿里逼开源了——再不开,开源王座就坐不住了。*

光环落定之前,两条实际提醒:

  • 2.4T 的开源,是许可证意义上的开源,不是实践意义上的。伺服它起步就是 8×H100/B300 级的多卡节点。对几乎所有人,真正要紧的交付物是 Qwen3.8-27B——那才是能跑在你自己硬件上的那个。K3 权重发布的规律原样适用:旗舰权重的意义是可审计性、议价筹码和托管服务商;小模型才是给你的。
  • 上传落地之前,许可证没有名字。七月的教训上了两遍课:K3 在承诺日交付了权重,但路上把 Modified MIT 换成了卡 MaaS 的收紧许可。Qwen3.8 用什么条款发、"下周"守不守得住,是仅剩的悬念,落地后本页更新。

诚实的两种读法

看多的读法。Terminal-Bench 压过 Opus 4.8、Arena 三榜前五、原生多模态(视觉进了 agent 循环,单图成本估算不到一美分)、1M 上下文、$2/$6 的定价同时压过所有西方旗舰档和 Kimi K3。只要厂商表里的大部分能扛住独立复测,这就是中国实验室发过的最完整的前沿套装。

看空的读法。预览期两周的记录教人谨慎,转正没有抹掉它。社区里钉得最牢的那句评语——*"跑分没输过,实测没赢过"*——是两周毁誉参半的实测攒出来的。著名的鹈鹕作画测试终于画出了惊艳的图——在思考了 12 分钟之后。早期测试者反复指认同一笔交易:分数是拿巨额推理预算买来的,而推理按输出 token 计费、以延迟的形式被你感受。而在 $2/$6 这个价位,它比 GLM-5.2 的 $1.40/$4.40 贵约 40%——后者的每块钱编码能力仍然贴着天花板。Qwen3.8-Max 得用多模态和长程耐力来赚回这个溢价——而这恰恰是厂商演示最难被验证的地带。

两种读法收进一句话:规格是前沿级的、现在是公开的;效率是还没人独立量过的那部分。

价格落在哪一格

模型每百万 token 输入/输出备注
DeepSeek V4-Flash$0.14 / $0.28地板价,刚重训完
GLM-5.2$1.40 / $4.40性价比默认,MIT 权重
Qwen3.8-Max$2 / $61M 上下文、原生视觉、缓存 $0.25
GPT-5.6 Terra$2 / $127 月 30 日降价后
Kimi K3$3 / $15中国实验室最贵
Claude Opus 5$5 / $25西方旗舰价格地板

这个卡位是刻意的:压在性价比档之上、所有旗舰之下——还带着便宜档国产模型没有的 1M 上下文和多模态循环。八月的价格战,多了一个中量级选手。

拿它做什么

  • API 已经上线,$2/$6——不像预览那几周,不再需要 Token Plan 订阅包。在 Turiloop,Qwen3.7-Max 和 Qwen3.7-Plus 今天就在一个 OpenAI 兼容 Key 背后伺服(国际卡、免中国手机号),Qwen3.8 随 API 铺开加入阵容——切换只是改一个 model id。价格计算器同日收录。
  • 如果你的负载是长程 agent 类,把它和 K3、V4-Flash-0731 放进同一张候选表——并用你自己的轨迹测,因为这个级别的每一个模型,眼下都是厂商表上的分数好过别人 harness 里的分数。
  • 等权重的:下周,据称。追踪页记录交付——或者跳票——两种结局都记。

常见问题

Qwen3.8-Max 是什么? 阿里的旗舰模型,经两周预览后于 2026 年 8 月 3 日正式发布:2.4 万亿参数 MoE、每 token 激活约 95B、1M 上下文、原生文本+视觉输入,定价每百万 token $2/$6,缓存输入 $0.25。

Qwen3.8 开源了吗? 还没有——但承诺这次是具体的:Qwen3.8-Max(2.4T)和 Qwen3.8-27B 的权重承诺在 8 月 3 日发布后一周内上 Hugging Face 和 ModelScope。这将是 Max 级 Qwen 的史上首次开源。许可条款尚未公布。

Qwen3.8-Max 和 Kimi K3 怎么比? 厂商基准上互有胜负——K3 守住 Terminal-Bench 2.1(88.3 对 86.6),Qwen3.8 在研究和系统操控类任务上还手——但 Qwen3.8-Max 卖 $2/$6,K3 卖 $3/$15,输出价不到对方一半。K3 的数字已经过一个月的独立检验;Qwen3.8 的才几天大。

Qwen3.8-Max 编码强吗? 厂商数字说强、但不是最强:SWE-bench Pro 67.7 低于 Opus 4.8 的 69.2、远低于 Fable 5 的 80.0;Terminal-Bench 2.1 的 86.6 则是真正的第一梯队。预览期的社区实测结论是质量真实、思考时间成本沉重。纯论编码性价比,GLM-5.2 的 $1.40/$4.40 仍是默认推荐。

海外怎么用上 Qwen3.8-Max? 官方 API 已上线,$2/$6。通过 Turiloop 这类 OpenAI 兼容网关,现役 Qwen 阵容(3.7-Max、3.7-Plus)今天就能用国际卡调用、免中国手机号——见 Qwen 接入指南——3.8 随上架加入。