7 月 31 日下午,DeepSeek 的 API 更新日志里多了一行字:「DeepSeek-V4-Flash 正式版 API 上线公测」。没有发布会,没有直播,官网首页没有横幅。当天晚上,它出现在知乎热搜第一的位置。开发者社区当晚讨论里出现频率最高的词,是「斩杀线」。
这行字值得读三遍的地方在于,正式版和四月的预览版是同一个模型:总参数 284B、激活参数 13B,结构、尺寸都没变,只是重新做了后训练。一个 Flash 档位的轻量模型,靠重练「怎么干活」而不是「更大的底座」,在九项 Agent 基准上全线超过自家的 Pro 预览版。
更微妙的是时间线。7 月 24 日,deepseek-chat 和 deepseek-reasoner 两个老接口静默停用,所有流量在那之前就已经指向 deepseek-v4-flash。也就是说,在「正式」官宣之前,新模型已经在真实流量里跑了一周多,等 bug 被真实请求消化掉,再补一个正式标签。先灰度、后官宣,这件事本身就是这次发布最工程化的注脚。
斩杀线是怎么画出来的
「斩杀线」这个词来自 Artificial Analysis 那一类价格-性能坐标图:横轴是每百万 Token 的输出成本,纵轴是综合智能指数。V4-Flash-0731 拿到 50 分,比自家 V4-Pro 高 6 分,比 GPT-5.6 Luna 的 51 分低 1 分;输出价格是 $0.28/M,Luna 是 $1.2/M。社区流传的那句话是:「Codex、Claude 定上限,DeepSeek 定斩杀线。跟它持平没溢价,落后它就出局。」
图 1:斩杀线是价格-性能坐标系里的前沿。落在它右下角的模型,要么更弱,要么更贵。点位为公开报道口径的示意位置。
数据确实在支持这个说法。OpenRouter 周度调用量登顶;有编程工具厂商称发布当天平台使用量和新订阅都涨了约三成;几家海外初创把推理切过去之后,月推理成本降了六到八成。时间点也带着火药味——OpenAI 在发布前一天刚把 GPT-5.6 Luna 的 API 价格砍了 80%,第二天评论区就贴满了对比图。
但有一个前提值得单独说清楚:斩杀线是「价格-性能」坐标系里的线,坐标系本身是评测机构和媒体画的。它量的是单次任务的性价比,不是生产环境里的可靠性。它不包含你的仓库、你的工具链、你的验收口径。斩杀线是一条市场意义上的线,不是工程意义上的线。
这轮降价为什么不是价格战
如果只看「便宜」,很容易把这次发布理解成又一轮价格战。真正的信号藏在三个工程细节里。
第一个细节是 98% 的缓存命中折扣。缓存命中的输入只收 $0.0028/M,未命中是 $0.14/M,差 50 倍;行业通行的缓存折扣在 90% 左右。这不是慷慨,是对 Agent 工作负载结构的理解:系统提示词、工具定义、前几轮对话历史,每一轮都在重复发送,缓存命中对 Agent 场景来说不是优化选项,而是负载的内建属性。敢把折扣放到 98%,说明官方对命中率有很强的把握——否则这是自杀式定价。单任务成本比已经降价 80% 的 Luna 还低约 60%,关键就来自这里。
第二个细节是峰谷定价预告。定价页上写着:高峰时段(北京时间 9:00–12:00、14:00–18:00)所有计费项按两倍收取,生效时间以正式通知为准。推理负载有明显的潮汐,需要价格杠杆削峰填谷——这说明规模化运行的成本结构是真实的。「把批量任务排到夜间」很快会从省钱技巧变成基本常识。
第三个细节还是那条 changelog 本身:老接口按时停用,新模型先用 preview 标签消化真实流量,再正式宣布。回看 4 月 24 日预览版上线时预告的「三个月后停止维护」,一切都是按时发生的。灰度发布、按时切换、预算写进价格——这是运维纪律,不是营销。
可靠性提升是真的,但要看清它测的是什么
官方放出的九项基准全部上涨,每一项都超过 V4-Pro-Preview:
| 基准 | 0731 正式版 | Preview | 考的是什么 |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 真实终端里把任务办成 |
| Cybergym | 76.7 | 38.7 | 攻防场景的推理与操作 |
| Toolathlon-Verified | 70.3 | 49.7 | 正确选工具并调用 |
| DSBench-FullStack | 68.7 | 37.0 | 全栈开发(内部测试集) |
| DSBench-Hard | 59.6 | — | 高难度开发(内部测试集) |
| DeepSWE | 54.4 | 7.3 | 真实仓库读 issue、写补丁、跑测试 |
| NL2Repo | 54.2 | 39.4 | 一句话生成完整仓库 |
| Agent Last Exam | 25.2 | — | 综合智能体大考 |
| Automation Bench | 25.1 | — | 自动化流水线执行 |
DeepSWE 从 7.3 涨到 54.4 是最值得看的一行。它考的是「把真实 GitHub issue 变成通过测试的补丁」:模型在仓库里自己读代码、写改动、跑测试、失败再试。这类分数描述的不是单次回答质量,而是多步任务的完成率。可靠的 Agent 和会聊天的模型之间的分界线就在这里——任务能不能执行到底,失败了会不会带着证据继续找,工具调用是不是稳定。
但三件事必须打折看。第一,这些是官方自测:DeepSeek Harness 的 minimal mode、max effort、特定采样参数,自家框架自家卷子;第二,DSBench 两个指标来自内部测试集,口径不能和公开基准混排;第三,Agent Last Exam 只有 25.2 分——这是业内著名的地狱级卷子,各家普遍在二三十分徘徊,绝对值没有横向意义。
值得交叉验证的是第三方。Artificial Analysis 的智能指数 50 分,比四月预览版高 10 分;Arena 的前端竞技场 1586 分、开放类第三名,比预览版高 154 分。两个独立口径指向同一结论:Agent 能力是真的上来了,不是 changelog 自嗨。但「评测里能交付」和「你的仓库里能交付」之间,还隔着权限模型、工具链版本、验收口径和发布流程——这段沟,工程团队得自己填。
图 2:可靠性来自验证回路:失败带证据重试、超限转人工、结果沉淀为评测集,回灌下一次任务。
AI 具备大规模工业级应用能力了吗
我的判断是:分场景。判断标准有三个——失败成本、可验证性、任务量。
低风险、结果可以自动验收、任务量大的场景,已经具备了。补单测、批量扫描、重复性重构、日志归因,这类工作的完成率已经够用,成本结构也支持铺量:有开发者在知乎说,一个下午跑掉五个多亿 token,账单没花到一杯奶茶钱。这类活以前因为「模型不行」和「太贵」两个原因没进生产,现在两个原因同时消失了。
高风险、语义含糊、失败代价大的场景,还不具备。跨模块排障、架构判断、涉及资金和权限的改动——模型跑分再高,也不是发布审批。这里真正缺的不是模型能力,是验证手段:你能不能为「删除这条用户数据」构造一个可信的验收?不能的话,换哪个模型都不行。
所以「大规模工业级应用」不是模型的属性,是系统属性。我把它拆成四层:
| 层次 | 这次的进展 | 还缺什么 |
|---|---|---|
| 模型层 | 后训练把 Agent 完成率拉高,13B 激活参数跑 Pro 级任务 | 更强模型的真实边界仍要自己试 |
| 协议层 | 原生 Responses API,Codex 一行配置接入 | 无状态实现,历史要自己带 |
| 成本层 | 98% 缓存折扣、2500 并发、峰谷定价 | 命中率取决于提示词结构,账单要会算 |
| 治理层 | 几乎没有官方进展 | 自动验收、CI、人工门、可观测,全靠组织自建 |
模型层和成本层的进展是 DeepSeek 给的;协议层给了一半;治理层完全是组织自己的事。四层齐了才叫「可采购的服务」,否则只是「很便宜的 API」。顺着这个框架再看网上的两种说法:说「AI 已经可以大规模工业级应用」的,多半只在模型层做判断;说「跑分都是虚的」的,多半没算成本层。两者都只看见了一部分。
接下来该做什么
给团队和给自己的建议都很朴素。
先让它干能验收的活。低风险、结果可自动验证的任务优先迁移,一次只换一个变量:同一仓库、同一任务集、同一套测试,比较完成率、耗时和 token 消耗。生产、权限、资金、安全的改动保留人工 review 和 CI——便宜不改变责任。
成本账盯缓存那行。系统提示词和工具定义保持稳定、可缓存,是省钱的正解;峰谷定价落地后,批量任务排到夜间。另外 Responses API 目前是无状态实现:不支持 previous_response_id,store 恒为 false,对话历史得自己带。协议通了,生态还在早期,接入前先读文档而不是看教程截图。
斩杀线是一条市场线,它的位置由价格和跑分决定,这次被大幅前移了。验收线是一条工程线,它的位置由验证回路和发布纪律决定,它不会因为别人发布了新模型而自动移动。
7 月 31 日那行 changelog 里还带着两句没被足够讨论的话:「V4-Pro 正式版将尽快发布」「峰谷定价具体生效时间以正式通知为准」,再加上大概率会来的开源权重,接下来的变量仍然很多。但无论下一版跑分如何,这次发布把一件此前模糊的事说清楚了:在可验收的低风险场景里,AI 已经从「值得试试」变成了「默认选项」。剩下的,是工程团队自己的事。
参考与数据来源
- DeepSeek API 更新日志与定价页:https://api-docs.deepseek.com/zh-cn/updates
- IT之家:DeepSeek-V4-Flash 正式版跑分报告(Artificial Analysis / Arena 第三方数据)
- 卡码笔记:V4-Flash 正式版上线拆解(基准对比、接入与峰谷定价提示)
- AI 内参:DeepSeek V4 Flash 正式上线与「AI 斩杀线」讨论综述
- 掘金:一行 changelog 里的暗涌(九项基准逐项解读、缓存折扣与接口限制)
- 知乎:DeepSeek V4 flash 正式版发布讨论(开发者实测口径)