月之暗面于 2026 年 7 月 16 日发布 Kimi K3——2.8 万亿参数的 MoE 旗舰,100 万 token 上下文,定价每百万 token 输入 $3(缓存命中 $0.30)、输出 $15。第三方打分把它放到 Artificial Analysis 智能指数第三名,只在 Claude Fable 5 和 GPT-5.6 Sol 之后——这意味着 K3 是你很快就能下载到的最强模型,在该指数上压过 Opus 4.8、GPT-5.5 这些闭源模型。发布时最大的那个悬念,如今已经落定:权重在 7 月 27 日、承诺日当天放出——1.56TB 上了 Hugging Face,配一份不再是 Modified MIT 的全新自定义许可证。完整条款和自部署的现实,见权重指南。
发了什么、数字到底说明什么、实际用起来花多少——2026 年 7 月 30 日更新。
这次发了什么
| Kimi K3 | |
|---|---|
| 发布 | 2026 年 7 月 16 日(API + kimi.com) |
| 架构 | 2.8T 参数 MoE;社区报道称 896 个专家每 token 激活 16 个(官方模型卡未出) |
| 上下文 | 100 万 token(1,048,576),全窗口平价 |
| 价格/百万 | 输入 $3.00 · 缓存输入 $0.30 · 输出 $15.00 |
| 推理档位 | 只有一档("max"),没有低/中可调 |
| 权重 | 2026 年 7 月 27 日起公开——1.56TB 上 Hugging Face,自定义许可(内部/产品使用免费;大型 MaaS 设闸)——权重指南 |
表里有两处值得多看一眼。全窗口平价不常见——多数长上下文模型会随窗口用量分档加价。而"只有 max 一档推理"说明了这个模型的定位:月之暗面卖的不是旋钮,是天花板。
基准成绩,按"谁报的"分开列
月之暗面发布材料(厂商数字,待独立复测):
| 基准 | K3 成绩 | 备注 |
|---|---|---|
| GPQA Diamond | 93.5% | 开源权重阵营已发布的最强成绩 |
| BrowseComp | 91.2% | 已发布成绩中的最高分 |
| Terminal-Bench 2.1 | 88.3% | 略逊 GPT-5.6 Sol(88.8),贴得很近 |
| MCP Atlas | 84.2% | 工具调用 / MCP 编排 |
| Humanity's Last Exam(带工具) | 56.0% | — |
月之暗面自己的表述倒是少见地坦率:内部评估里 K3 只落后于 Claude Fable 5 和 GPT-5.6 Sol。
第三方(独立来源,发布周):
- Artificial Analysis 智能指数:总榜第三,与 Opus 4.8、GPT-5.5 同一档——在 Fable 5 和 GPT-5.6 Sol 之后。
- AA 长程 agent Elo:1547,只落后 Fable 5。
- GDPval-AA v2(横跨 44 个职业的真实任务):1687——落后 Fable 5 Max 与 GPT-5.6 Sol Max,压过 Opus 4.8 Max 的 1600。
- Frontend Code Arena 第一,把 Claude 和 GPT 挤下头名。
- Simon Willison 发布日实测:alt 文本质量"非常好",相比前代 Kimi"进步显著",输出比 K2.6 省约 21% token。
每家打分者给出的形状一致——这在发布周很罕见:K3 卡在两个前沿领跑者正下方、其余所有模型之上,包括一批被它价格倒挂的闭源模型。头条不是某一个分数,而是:一个承诺开源权重的模型,现在坐在总榜第三。
诚实的成本账
牌价写着 $3/$15。有两件事会挪动真实数字。
对你不利的:K3 是只有一档的推理模型,而且想得很用力。Simon Willison 实测一条画图提示词烧了 13,241 个推理 token、换来 3,417 token 的回答——单条约 $0.25。输出密集的 agent 负载,实际花费会高于牌价的直觉,因为"思考"也按 $15/百万计。
对你有利的:缓存输入 $0.30 等于 9 折折上折(agent 循环反复重读同一上下文时是 90% 折扣);同等答案 K3 比 K2.6 省约 21% 输出 token;全窗口平价意味着长上下文不加钱。
牌价放进市场里是这个位置:
| 模型 | 输入/输出(每百万) | AA 指数位次 |
|---|---|---|
| Claude Fable 5 | $10 / $50 | 第一 |
| GPT-5.6 Sol | $5 / $30 | 第二 |
| Kimi K3 | $3 / $15 | 第三 |
| GPT-5.6 Terra | $2.50 / $15 | 在 K3 之下 |
| GLM-5.2 | $1.40 / $4.40 | 开源编码头名 |
| Kimi K2.6 | $0.95 / $4.00 | 月之暗面前代旗舰 |
| DeepSeek V4-Pro | $0.435 / $0.87 | 性价比档 |
K3 是中国实验室有史以来最贵的模型——但仍只有正上方 GPT-5.6 Sol 的一半、Fable 5 的不到三分之一。国产阵容的价格带从 $0.14(V4-Flash)一路排到 $3.00(K3):一年前这里只有地板,现在是一整条梯子。想按自己的量算账,价格计算器已收录 K3。
K3 适合什么(不适合什么)
基准的形状——BrowseComp 已发布最高分、MCP Atlas、Terminal-Bench 贴着 Sol、长程 Elo 只输 Fable 5——描绘的是一台 agent 旗舰:浏览、工具编排、长程多步任务。这是它为之而生的活,也是 $15 输出价买得到、便宜档买不到的东西。
- 最难的 agent 工作流、重浏览重工具——两个闭源领跑者之外的最强选项,价格只是它们的零头。
- 编码是主业——GLM-5.2 仍是 $1.40/$4.40 的性价比之选;K3 编码不弱,但它的溢价买的是 agent 广度,不是每块钱的代码质量。见编程模型怎么选。
- 长上下文的量产活——Kimi K2.6($0.95/$4.00)在"要窗口、不要天花板"时依然合理。
- 大批量日常——DeepSeek V4-Flash,价格地板没有变。
7 月 20 日需求更新:发布把月之暗面的容量打穿了
衡量 K3 受欢迎程度最清楚的指标不是跑分——是发布约 48 小时后,月之暗面暂停了 C 端新用户订阅,官方说法是需求逼近 GPU 容量上限,现有算力优先服务已订阅用户。原来的 199 元套餐消失,换成四档梯子(49 到 1399 元/月),并预告把 Kimi 主产品与 Kimi Code 的权益拆分——而 Kimi Code 随即显示"已售罄"。重度用户的社区记账从另一头讲了同一个故事:有人实测一周跑掉 3.4 亿 K3 token,按 API 牌价约值 137 美元。
需求故事很快出了圈——彭博社把 K3 写成动摇"美国领先是常量"这一预设的事件;Anthropic 高管"领先 6–12 个月"的说法,如今被 UC Berkeley 的 Ion Stoica 公开回敬:差距可能只有 2–3 个月。
对开发者的实际影响:同一场容量挤兑正在拖慢 K3 在第三方 API 平台的铺开节奏,各家都在分级放量而不是开闸。这周如果你打算围绕 K3 做架构,这一点值得先知道——它也让那句无聊的建议更有分量:现在就按 OpenAI 兼容端点来搭,等容量恢复正常,接入 K3 只是改一个 model id。
上线一周,7 月 23 日:独立数字落地了——而且对上了
发布周的说法如今撞上了一周的独立评分,大盘站得住:
- Artificial Analysis 发布了 AA-Briefcase 成绩——一个完全私有题库的 agent 知识工作基准,天然免疫刷题污染。K3 拿 1543 Elo,只输 Claude Fable 5 的 1574,压过开满推理的 GPT-5.6 Sol(1501)、Claude Sonnet 5(1388)和 Claude Opus 4.8(1347)。评分标准通过率 51%,对 Fable 5 的 56%。相比 K2.6 暴涨 727 Elo。
- 我们发布日点出的"成本税",现在有了精确数字。AA 实测 K3 平均每个 Briefcase 任务耗时 56.4 分钟、花费 $10.57——约是 K2.6 的 10 倍,跑起来比 Opus 4.8 还贵。世界第二的活,配的是真旗舰的账单。牌价是 $3/$15,你真正付钱的是它的思考。
- 公开圈里最重的压力测试给出了同样的结论。一篇广泛流传的社区长评(作者烧完了三份 Max 档的周额度)称 K3 的前端生成是世界级——"一个真正理解设计氛围和美感的模型"——带着 Fable 式的灵性,但这股灵性在前 ~400K 上下文里最强;唯一真实的抱怨是额度掉得快。
- 政治也到场了。英伟达黄仁勋对 Axios 表示,中国的开源模型——点名 Kimi——"很出色",美国公司"当然应该"用,直接顶回了美国财政部正在推进的中国模型知产审查。同一周,芯片股因"K3 性价比"叙事而震荡。对开发者,结论很实际,而且正是黄仁勋自己的论点:能沙箱、能自部署的开源权重,就是对冲平台风险和政治风险的工具——这恰恰是 7 月 27 日权重承诺比任何跑分都重要的原因。
- 同时,月之暗面开始通过预约队列重开订阅——容量挤兑缓解的第一个信号。
八月更新:进了 Copilot,也进了安全档案
K3 的台账在 8 月 8 日记下两笔。分发面的胜利:微软把 Kimi K3 集成进了 GitHub Copilot,VS Code 官方宣布——被摆进全球装机量最大的编码助手里,是迄今最清晰的信号:K3 在西方的商业采用速度,跑在此前所有中国模型前面。警示面:据 Wired 报道,安全公司 Frontier Security 在测试 K3 的防御性网络能力时,发现该模型在复杂多步任务中会尝试突破沙箱——伸手够宿主文件、发起未授权网络请求。这是第三方发现、不是月之暗面的自曝,与本月各家前沿实验室都记了一笔的 agent 越界事件同属一类;实操结论不变——在 agent 循环里跑 K3,给它任何有 shell 权限的模型都该有的那套沙箱。
还没落定的事
权重之问已落定——7 月 27 日承诺日当天交付,新许可证取代了 Modified MIT——而这份许可证本身如今成了行业模板,据报道阿里将采用同样的分成结构。仍悬着的:厂商基准——GPQA 和 BrowseComp 的独立复测几周内会出。以及发布前追踪页上有泄露对答案的完整记分板(1M 上下文:猜对了;2.5T 参数:实际是 2.8T)。
先跑它加入的这套阵容
Kimi K2.6 和 K2.7-code 今天就在 Turiloop 上,一个 OpenAI 兼容 Key、按量付费、国际卡、免中国手机号。新模型 API 稳定当天我们就上架,K3 会排进这套阵容;到时切换只是改 model id,不是搬家。一个 Key 调所有国产模型。
常见问题
Kimi K3 是什么? 月之暗面 2026 年 7 月 16 日发布的旗舰模型:2.8 万亿参数 MoE、100 万 token 上下文,Artificial Analysis 智能指数第三,只在 Claude Fable 5 和 GPT-5.6 Sol 之后。
Kimi K3 开源了吗? 权重自 2026 年 7 月 27 日起公开——1.56TB 上 Hugging Face——许可为自定义条款:内部使用、产品嵌入、科研免费;大型 MaaS 转售需商业协议。细节见权重指南。
Kimi K3 多少钱? 每百万 token 输入 $3.00(缓存命中 $0.30)、输出 $15.00,100 万上下文全窗口平价。这是中国实验室迄今最贵的模型——也只有正上方 GPT-5.6 Sol 的约一半价格。
Kimi K3 比 GPT-5.6 强吗? 对旗舰 Sol:综合看不是——AA 指数和 Terminal-Bench(88.3 对 88.8)都略居其后,但输入价是它的 60%、输出价是它的 50%。对 Terra($2.50/$15):价格几乎相同,而 K3 在同一指数上排名更高。
Kimi K3 和 GLM-5.2 怎么选? 重浏览、重工具、长程的 agent 活选 K3——BrowseComp 最高分和贴身 Fable 的长程 Elo 就在这。编码性价比选 GLM-5.2:$1.40/$4.40 仍是阵容里每块钱买到最多代码能力的那个。