DeepSeek V4 Pro 涨价 350%:五大国产旗舰横评,钱该花在哪家

文 | AI 情报站 · 2026 年 8 月 17 日

今天零点,DeepSeek 的新价格表正式生效了。旗舰模型 V4 Pro 的输出价从每百万 token 6 元涨到高峰时段 27 元,涨幅 350%;缓存命中输入从 0.025 元涨到 0.3 元,翻了 12 倍。与此同时,它还引入了峰谷计价——每天上午 9 点到 12 点、下午 2 点到 6 点按高峰价收,其余时间半价。"价格屠夫"这四个字,DeepSeek 自己摘下来了。问题来了:涨价之后的国产旗舰格局变成了什么样?我们把当下最能打的五款国产旗舰——DeepSeek V4 Pro、Kimi K3、GLM-5.3、Qwen3.8-Max、MiniMax M3——从性能、价格、速度三个维度摆在一起看了一遍,结论可能跟很多人的直觉不一样。

五款旗舰,先认个脸

这五款模型有一个共同点:上下文全部做到了 100 万 token 级别,长文档和大型代码仓库都能整包喂进去,这一项上已经拉不开差距,真正分胜负的是别处。DeepSeek V4 Pro 是 1.6 万亿参数的 MoE 架构、MIT 协议完全开源,主打 Agent 和大规模代码工程;Kimi K3 是 2.8 万亿参数的全球最大开源模型,原生多模态,还带 Swarm 智能体集群;GLM-5.3 参数只有 7430 亿,但智谱靠后训练把它的编程能力怼到了对标 Fable 5 的位置;Qwen3.8-Max 是 2.4 万亿参数的开源旗舰,综合榜单全球第二;MiniMax M3 则是五款里最"另类"的一个——MiniMax 真正的招牌在视频生成(H3 是 Artificial Analysis 视频编辑榜的全球第一),M3 是它家的文本旗舰,走的是低价实用路线。

性能:咬得很紧,各有各的强项

先说最硬核的编程。最能反映"AI 程序员"真实工作状态的 DeepSWE 基准上,Kimi K3 拿了 67.5,GLM-5.3 拿了 66.9,差距不到 1 分,基本属于毫厘之间;DeepSeek V4 Pro 紧随其后,SWE-bench Verified 上它有 80.6% 的成绩,Codeforces 3206 分,同样站在第一梯队。换句话说,编程这件事上,国产旗舰已经集体摸到了世界前沿的尾流,差距小于各家宣传稿想让你相信的程度。

拉开差距的是各自的特色项。Kimi K3 的原生多模态是五款里独一份,图像理解、跨模态检索这类任务它最稳,还有开箱即用的 Swarm 集群编排;GLM-5.3 走的是"脏活累活"路线,终端操作基准 Terminal-Bench 3.0 开源第一,网络安全测试 CyberGym 拿了 84.5%,训练过程中还真挖出了 16 个未知漏洞,Claude Code 这类终端 Agent 工作流用它最对口;MiniMax M3 的 BrowseComp 网页检索拿了 83.5 分,超过 Opus 4.7 的 79.3,在它家的产品矩阵里算是超水平发挥——但要说 MiniMax 真正的护城河,还是视频生成那一块;Qwen3.8-Max 则胜在综合,Artificial Analysis 的综合榜单上它排全球第二。要提醒一句:这些数字都是各家挑自己最强的赛道报出来的,行业常规操作,心里得有杆秤。

价格:差距最大的维度,大到离谱

性能咬得紧,价格却是另一个世界。把五款模型的 API 价格换成同一把尺子(元/百万 token,输入/输出):MiniMax M3 的 512k 以内档位永久五折,实收 2.1/8.4,DeepSeek V4 Pro 闲时 4.5/13.5、高峰 9/27,GLM-5.3 是 8/28——和上一代 GLM-5.2 完全同价,顺带说一句,5.3 的按量 API 还在上线前的最后阶段,眼下主要走 GLM Coding Plan 订阅。Qwen3.8-Max 是 12/36,Kimi K3 是 20/100,另有缓存命中输入 2 元的单独价。M3 还有个隐藏条款:输入超过 512k 的档位要按原价 4.2/16.8 计——正好是我们下面要算的那种长上下文场景。

算一笔实际的账。一个典型的 Agent 编程任务——读 100 万 token 的代码库、输出 10 万 token 的修改方案:MiniMax M3 约 5.9 元——注意,1M 输入正好落在它五折覆盖不到的超 512k 档,按原价 4.2/16.8 计;DeepSeek V4 Pro 闲时 5.85 元、高峰 11.7 元;GLM-5.3 是 10.8 元;Qwen3.8-Max 是 15.6 元;而 Kimi K3,这一单就是 30 元。同一个任务,最贵和最便宜差出 5 倍。换成日常小任务(输入不超 512k)差距还要拉开:M3 五折档 2.1/8.4,一单不到 3 元,对上 Kimi 的 30 元就是十倍。听起来不如"十几倍"震撼,但账要按月的量算:每天跑几十个任务的生产环境,几倍的单价差距一个月就是几千块的真金白银。

DeepSeek 这次涨价真正改变的是大家对它的心理预期。数字上拆开看:闲时 4.5/13.5 在国产旗舰里依然是很能打的价位,但前面已经站了一个永久五折的 MiniMax M3(常规档位 2.1/8.4),真正疼的是高峰时段的 9/27——比闲时整整贵一倍,比 GLM 还贵。它对海外模型的价差还在(高峰输出价大约只有 Anthropic 旗舰的几十分之一),但"任何时段闭眼用最便宜"的时代结束了。还有个细节值得注意:它的缓存命中输入价从 0.025 涨到 0.3 元,多轮对话、RAG 这类重度依赖缓存的场景,账单膨胀会比单次调用更明显。

速度:被低估的省钱维度

速度这个维度平时没人聊,但它直接影响两件事:你的等待时间,和按时计费场景下的真实成本。目前公开实测数据最完整的是 GLM 和 Kimi 的对线:GLM-5.2 时代实测生成速度 116.3 tokens/s,Kimi K3 是 40.4 tokens/s,差出接近 3 倍;GLM-5.3 没换基座,这个速度结构大概率延续。DeepSeek 官方没有公开吞吐数字,但它自己承认"受限于高端算力,Pro 版吞吐量有限"——这其实也是它搞峰谷计价的真实原因:算力不够,就用价格把人分流到闲时。

对普通用户这意味着什么?同样的任务,快的模型不但省时间,在包时套餐、在线协作这类场景里还省真金白银。速度和单价要乘起来看,才是真实成本——GLM 的单价只比 DeepSeek 闲时贵出一截,但速度快近 3 倍,在等结果也是成本的场景里,这笔账就没那么简单了。

结论:没有全能冠军,只有对口之选

横评做到这里,结论其实很清晰。日常主力、成本敏感,MiniMax M3 是五款里常规任务最便宜的一条路——512k 以内永久五折、2.1/8.4,比 DeepSeek 闲时还低一截,唯一要注意的是输入超 512k 的长上下文会回到原价 4.2/16.8;DeepSeek V4 Pro 闲时 4.5/13.5 是长上下文和开源部署场景的最优解要能力上限、做多模态或复杂智能体编排,Kimi K3 值它的高价,前提是你算过账、用得上它的特色项,否则等于为用不到的上限买单。GLM-5.3 走的是"贵一点但快三倍"的路线:8/28 的单价在五款里居中,速度近 3 倍于 Kimi,终端 Agent 和网安场景还是开源第一,交互式开发等不起的人值得为速度付这个差价。DeepSeek 高峰时段硬着头皮按 27 元的输出价跑日常任务,是这款里最不划算的选择。Qwen3.8-Max 适合已经在阿里云生态里、要综合能力的团队,单买略贵;至于 MiniMax,如果你要的是视频生成能力,它家的 H3 才是正主,M3 只是顺带的低价文本旗舰。

最后给三条实操建议。第一,别信单一跑分,拿自己项目里真实的 bug 单和文档,在两三款候选上各跑一轮,比看十篇横评都管用——反正 GLM、DeepSeek、Qwen 都开源,本地部署试错几乎零成本。第二,如果你的主力是 DeepSeek,从今天起把非实时任务挪到晚间和周末,官方闲时半价不是摆设,是真金白银。第三,盯紧两个时间点:GLM-5.3 的按量 API 正式上线后的定价(眼下订阅制为主,按量价格大概率参考 5.2 的 8/28),以及各家会不会跟进峰谷计价——在"电价化"计费蔓延的趋势下,价格表干净本身就是竞争力。

DeepSeek 涨价不是终点,是国产大模型从"拼低价"转向"拼价值"的信号弹。对用户来说反而是好事——当价格不再一刀切地便宜,认真对比、按需选型的人,才能把每一分钱花在刀刃上。