据每日经济新闻9月10日《数智早参》与DeepSeek官方公告,DeepSeek正式发布V4.1-Flash,一个552B参数的混合专家(MoE)多模态模型。官方给出的两组数字最该被记住:KV缓存的显存需求降到上一代的四分之一,固态盘存储需求降到八分之一。缓存命中费用长期是智能体运行开支的主要构成之一,这一块被压下来之后,需要长时间连续运行的任务才真正算得过来账。
这次升级改动了三处
第一处是架构。V4.1-Flash没有沿用同规模模型的对称结构,而是采用新的因果编码器-解码器(Causal Encoder-Decoder)非对称架构:输入侧只激活8B参数,输出侧激活16B参数。参数量写在标题里是552B,真正参与每次计算的规模小得多,这是它能在保持旗舰级表现的同时把推理成本压低的原因。
第二处是注意力与缓存。压缩稀疏注意力(CSA2)配合缓存压缩,让KV缓存的显存占用与固态盘占用同时下降。官方口径是与上一代相比,缓存显存降到四分之一,固态盘需求降到八分之一。
第三处是许可与产品化。模型以MIT许可开源,并已在DeepSeek API上线,模型名deepseek-flash,原生支持多模态。此前的V4-Flash与V4-Flash-Vision-Exp下线,为兼容旧调用,deepseek-v4-flash与deepseek-v4-flash-vision-exp会临时路由到新模型。
为什么缓存是智能体的成本命门
要理解这次发布的分量,得先看智能体是怎么花钱的。一个持续运行的智能体,每一轮工具调用、每一步推理,都要把此前积累的上下文重新读一遍。这些上下文以KV缓存的形式驻留在显存中,上下文越长、对话轮次越多,占用越大,成本跟着上涨。行业里常见的一种情况是:模型单价降了,智能体账单却没怎么降,因为大头在缓存命中与长上下文的重算上。
把缓存压缩到四分之一,等于把这条成本曲线整体下移。对需要在单个任务里处理几万字材料、连续调用几十次工具的智能体来说,这是能算得过账与算不过账的区别。
性能与定价的公开口径
| 项目 | 公开数据 |
|---|---|
| 参数规模 | 552B参数MoE,原生支持多模态 |
| 架构 | 因果编码器-解码器,输入激活8B、输出激活16B |
| 缓存优化 | KV缓存显存降至上一代1/4,SSD需求降至1/8 |
| 许可 | MIT开源 |
| 闲时输入(缓存命中) | 0.02元/百万token |
| 输出 | 4元/百万token |
| 横向对比 | 官方称多方测试显示其在性能、成本、速度与总运行时间上超过V4-Pro |
需要说明的是,上述价格是官方公布的闲时缓存命中价与输出价,实际账单取决于缓存命中率、上下文长度与调用时段,不是单价相乘那么简单。
对一人公司和小团队意味着什么
一人公司的成本结构里,最刚性的一块是持续运行的自动化流程。图文批量生产、多平台分发、客服应答、数据整理,这些环节靠智能体串起来之后,成本几乎全部落在token上。缓存成本下降,直接抬高的是单人可持续运行的任务规模上限。
另一个变化在试错成本。智能体应用最贵的不是写代码,而是反复跑通一遍完整流程去验证可行性。单次全流程成本下降,意味着一个人可以在同样的预算里多试几轮,把方案调到能交付为止。
三点需要留意
- 缓存命中率决定实际成本。闲时价与输出价只是两端,中间还隔着调用时段与命中比例,先按官方口径做预算模型,再用一周真实账单校准。
- 模型路由会变。官方说明9月14日起V4-Pro的请求将路由到V4.1-Flash并按新价格计费,依赖旧模型行为的自动化流程需要提前回归测试。
- 性能口径来自厂商与多方测试,独立复现仍需时间。生产环境上量前,建议用自有业务数据做一轮小样本对照。
哪些业务最先受益
从成本结构看,受益顺序大致可以排出来。
- 第一类是多轮客服与售后。这类场景单次对话不长,但轮次密集、上下文反复加载,缓存成本占比高,压缩缓存对账单的改善最直接。
- 第二类是长文档处理。合同、报告、资料库的批量解析需要把大量文本反复放进上下文,缓存降下来之后,单份文档的处理成本随之下降。
- 第三类是自动化内容生产。选题、写作、校对、分发串成一条流水线时,中间产物会被多次回读,缓存优化带来的收益会沿着流水线逐环累积。
反过来,单轮短问答类应用几乎感受不到变化,因为它们的上下文本来就很短,缓存不是成本主体。
还要看到一个前提:缓存优化只解决成本项里的一部分。输出价格、调用次数、任务失败重试同样影响账单,把流程本身做短、减少无效轮次,与换上更省的模型,是两件必须同时做的事。
常见问题
问:V4.1-Flash和之前的V4-Flash是什么关系?
答:是替代关系。V4.1-Flash属于新的架构家族,V4-Flash与V4-Flash-Vision-Exp已下线,旧模型名会临时指向新模型,便于存量调用平滑迁移。
问:缓存降到四分之一,API账单也会降到四分之一吗?
答:不一定。缓存占用下降影响的是缓存相关部分的成本,账单还取决于输入长度、输出量、调用时段与命中率。长上下文、高缓存的智能体受益最明显。
问:一人公司现在适合把业务切到这个模型上吗?
答:如果业务依赖长上下文或高频智能体调用,值得先做小范围迁移测试;如果只是简单问答,收益有限,不必为搬家而搬家。
参考来源
- [1] DeepSeek.《Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient》. 2026-09-10
- [2] 每日经济新闻.《数智早参》. 2026-09-10
- [3] AI225.《AI日报(2026年9月11日)》. 2026-09-11