# 一场没有新模型的发布
7 月 31 日晚间,DeepSeek 通过 API 文档更新日志悄然官宣 V4 Flash 正式版公测。没有发布会,没有博客文章,甚至没有一条推特——但随后 48 小时内,两大独立评测平台 Artificial Analysis 和 Arena.ai 同步更新的基准测试结果,让整个 AI 行业为之一震。
V4 Flash 正式版的 MoE 架构、2840 亿总参数、130 亿激活参数、100 万 token 上下文窗口——这三个数字与三个月前的预览版完全一致。模型结构没有改变,参数规模没有变化。DeepSeek 官方明确表示:"我们只重新做了一遍后训练。"
但就是这"只做了一遍"的后训练,带来了令人难以置信的性能跃升:在代理任务(Agent Tasks)等多项核心基准上表现显著提升,token 使用量减少 12%,而在成本端更是实现了惊人的 98% 缓存折扣率。Artificial Analysis 的数据显示,V4 Flash 正式版在综合评测中仅以约六成的成本就逼近了 GPT-5.6 Luna 的性能水平。
后训练的秘密武器
后训练(Post-Training)并非新概念,但 DeepSeek 这次展示的是后训练技术的工程化极限。传统的后训练流程包括监督微调(SFT)、RLHF(人类反馈强化学习)和 DPO(直接偏好优化),通常在基座模型训练完成后进行"调优"。但 DeepSeek V4 Flash 的做法更为激进:它在不触碰模型权重骨架的前提下,仅通过优化后训练数据配比、奖励模型设计和强化学习策略,就释放出了远超预期的推理能力。
具体来说,DeepSeek 团队在后训练阶段做了三件事:
第一,数据配比重构。传统 SFT 数据集中,简单问答占比较高,而复杂推理链数据不足。DeepSeek 重新调整了训练数据分布,大幅提升了多步推理、代码生成和工具调用场景的数据比例,使得模型在 Agent 场景下的表现获得质变。
第二,强化学习策略创新。V4 Flash 采用了改良版的 GRPO(Group Relative Policy Optimization)算法,通过组内相对比较替代绝对打分,有效缓解了奖励模型自身的偏差问题。这种策略让模型在不增加参数的前提下,学会了更高效的推理路径——这正是 token 使用量下降 12% 的根本原因。
第三,缓存友好架构优化。98% 的缓存折扣率并非巧合。DeepSeek 在后训练阶段针对性地优化了提示词处理机制,使得常见指令和上下文的 KV Cache 命中率大幅提升。对 API 用户而言,这意味着频繁调用的实际成本可能比账面价格低 50 倍以上。
产业链冲击波:OpenAI 降价 80%
V4 Flash 发布仅一天后,OpenAI 紧急调整了 GPT-5.6 Luna 的 API 定价,降幅高达 80%。这不是 OpenAI 第一次降价应对竞争,但这次的幅度和速度都创了纪录。
从产业经济学角度看,这标志着 AI 模型市场的定价权正在从"领先者溢价"向"效率竞争"转移。当一家后发厂商能以约四成的成本提供接近顶级水平的性能时,价格战不可避免。OpenAI 的应对策略表明,它清楚地认识到了威胁——不是技术上的差距,而是成本结构上的劣势。
更深层的影响在于,DeepSeek 选择了 MIT 许可开源 V4 Flash 的权重。这意味着任何企业都可以自行部署、微调这个模型,而不需要向任何厂商支付 API 费用。结合后训练优化的低 token 消耗特性,企业自建推理集群的总拥有成本(TCO)可能降低到 GPT 系列的十分之一甚至更低。
启示:模型效率的"摩尔定律"正在形成
DeepSeek V4 Flash 的案例揭示了一个重要趋势:AI 模型的"智能密度"正在以超线性的速度提升。不是在参数量上膨胀,而是在每单位计算资源产出的智能水平上跃进。
这对整个产业的意义是深远的。对于开发者,选择模型时不仅要看基准分数,更要看"性价比"——每百万 token 能产出多少有效智能。对于投资者,需要重新评估算力投入的边际回报:当后训练优化能带来 6 倍性能提升时,盲目堆砌训练算力的投入产出比正在走低。
DeepSeek 用一次低调的 API 文档更新,完成了一次对 AI 产业定价体系的彻底重估。
参考来源:
- DeepSeek API 文档更新日志 (2026-07-31)
- Artificial Analysis 评测数据 (2026-08-01)
- Arena.ai 基准测试排行榜 (2026-08-01)
- OpenAI 定价调整公告 (2026-08-01)