导航菜单
首页 服务 OPC项目 AI资讯 AI应用市场 OPC市场 OPC导航 工具推荐 关于 OPC城市 北京OPC 上海 广州 深圳 杭州 注册指南 OPC完全指南 AI副业
⚡ 创客OPC ← 返回资讯
DeepSeek V4.1-Flash开源 KV缓存降至四分之一 | 创客极点

据每日经济新闻9月10日《数智早参》与DeepSeek官方公告,DeepSeek正式发布V4.1-Flash,一个552B参数的混合专家(MoE)多模态模型。官方给出的两组数字最该被记住:KV缓存的显存需求降到上一代的四分之一,固态盘存储需求降到八分之一。缓存命中费用长期是智能体运行开支的主要构成之一,这一块被压下来之后,需要长时间连续运行的任务才真正算得过来账。

这次升级改动了三处

第一处是架构。V4.1-Flash没有沿用同规模模型的对称结构,而是采用新的因果编码器-解码器(Causal Encoder-Decoder)非对称架构:输入侧只激活8B参数,输出侧激活16B参数。参数量写在标题里是552B,真正参与每次计算的规模小得多,这是它能在保持旗舰级表现的同时把推理成本压低的原因。

第二处是注意力与缓存。压缩稀疏注意力(CSA2)配合缓存压缩,让KV缓存的显存占用与固态盘占用同时下降。官方口径是与上一代相比,缓存显存降到四分之一,固态盘需求降到八分之一。

第三处是许可与产品化。模型以MIT许可开源,并已在DeepSeek API上线,模型名deepseek-flash,原生支持多模态。此前的V4-Flash与V4-Flash-Vision-Exp下线,为兼容旧调用,deepseek-v4-flash与deepseek-v4-flash-vision-exp会临时路由到新模型。

为什么缓存是智能体的成本命门

要理解这次发布的分量,得先看智能体是怎么花钱的。一个持续运行的智能体,每一轮工具调用、每一步推理,都要把此前积累的上下文重新读一遍。这些上下文以KV缓存的形式驻留在显存中,上下文越长、对话轮次越多,占用越大,成本跟着上涨。行业里常见的一种情况是:模型单价降了,智能体账单却没怎么降,因为大头在缓存命中与长上下文的重算上。

把缓存压缩到四分之一,等于把这条成本曲线整体下移。对需要在单个任务里处理几万字材料、连续调用几十次工具的智能体来说,这是能算得过账与算不过账的区别。

性能与定价的公开口径

项目公开数据
参数规模552B参数MoE,原生支持多模态
架构因果编码器-解码器,输入激活8B、输出激活16B
缓存优化KV缓存显存降至上一代1/4,SSD需求降至1/8
许可MIT开源
闲时输入(缓存命中)0.02元/百万token
输出4元/百万token
横向对比官方称多方测试显示其在性能、成本、速度与总运行时间上超过V4-Pro

需要说明的是,上述价格是官方公布的闲时缓存命中价与输出价,实际账单取决于缓存命中率、上下文长度与调用时段,不是单价相乘那么简单。

对一人公司和小团队意味着什么

一人公司的成本结构里,最刚性的一块是持续运行的自动化流程。图文批量生产、多平台分发、客服应答、数据整理,这些环节靠智能体串起来之后,成本几乎全部落在token上。缓存成本下降,直接抬高的是单人可持续运行的任务规模上限。

另一个变化在试错成本。智能体应用最贵的不是写代码,而是反复跑通一遍完整流程去验证可行性。单次全流程成本下降,意味着一个人可以在同样的预算里多试几轮,把方案调到能交付为止。

三点需要留意

  • 缓存命中率决定实际成本。闲时价与输出价只是两端,中间还隔着调用时段与命中比例,先按官方口径做预算模型,再用一周真实账单校准。
  • 模型路由会变。官方说明9月14日起V4-Pro的请求将路由到V4.1-Flash并按新价格计费,依赖旧模型行为的自动化流程需要提前回归测试。
  • 性能口径来自厂商与多方测试,独立复现仍需时间。生产环境上量前,建议用自有业务数据做一轮小样本对照。

哪些业务最先受益

从成本结构看,受益顺序大致可以排出来。

  • 第一类是多轮客服与售后。这类场景单次对话不长,但轮次密集、上下文反复加载,缓存成本占比高,压缩缓存对账单的改善最直接。
  • 第二类是长文档处理。合同、报告、资料库的批量解析需要把大量文本反复放进上下文,缓存降下来之后,单份文档的处理成本随之下降。
  • 第三类是自动化内容生产。选题、写作、校对、分发串成一条流水线时,中间产物会被多次回读,缓存优化带来的收益会沿着流水线逐环累积。

反过来,单轮短问答类应用几乎感受不到变化,因为它们的上下文本来就很短,缓存不是成本主体。

还要看到一个前提:缓存优化只解决成本项里的一部分。输出价格、调用次数、任务失败重试同样影响账单,把流程本身做短、减少无效轮次,与换上更省的模型,是两件必须同时做的事。

常见问题

问:V4.1-Flash和之前的V4-Flash是什么关系?

答:是替代关系。V4.1-Flash属于新的架构家族,V4-Flash与V4-Flash-Vision-Exp已下线,旧模型名会临时指向新模型,便于存量调用平滑迁移。

问:缓存降到四分之一,API账单也会降到四分之一吗?

答:不一定。缓存占用下降影响的是缓存相关部分的成本,账单还取决于输入长度、输出量、调用时段与命中率。长上下文、高缓存的智能体受益最明显。

问:一人公司现在适合把业务切到这个模型上吗?

答:如果业务依赖长上下文或高频智能体调用,值得先做小范围迁移测试;如果只是简单问答,收益有限,不必为搬家而搬家。

参考来源

  • [1] DeepSeek.《Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient》. 2026-09-10
  • [2] 每日经济新闻.《数智早参》. 2026-09-10
  • [3] AI225.《AI日报(2026年9月11日)》. 2026-09-11
*本文仅代表作者个人观点(仅供参考)* 来源:创客OPC原创整理
微信搜一搜「北京安迪哥OPC」
上一篇
连续五年送iPhone:影视飓风的"老规矩"背后,是人心工程...
下一篇
京东开源JoyAI-EchoWM 视听世界模型可交互 | 创...
需要落地支持?

从网站 / 小程序开发到 AI 工具链企业培训,提供全栈交付与落地方案;也可以先看看一个人如何用 AI 工具链撑起专业级交付。本页内容整理的是一线实践,具体项目按需评估。

查看服务与报价 → AI 工具链 + FDE 实战 →