中信证券:DeepSeek-V4.1-Flash发布,关注三条投资主线

14 小时前6.9k
模型能力超越DeepSeek-V4-Pro
本文来自格隆汇专栏:中信证券研究 作者:杨泽原  丁奇  潘儒琛  马庆刘

DeepSeek-V4.1-Flash发布,在实现Coding与Agent能力提升的同时强化多模态理解能力。模型创新采用CED架构,结合CSA2跨层缓存共享、索引复用及FP4量化,全局KV Cache降至V4-Flash的约1/4。架构优化释放推理降本空间,DeepSeek宣布继续下调API价格。中信证券认为,国产模型将沿高性价比与前沿智能两条路径继续展开竞争,DeepSeek深度适配下国产算力基础设施与国产模型同步受益,同时高性价比推理将加速FDE及企业级Agent落地。

DeepSeek-V4.1-Flash:采用CED新架构,模型能力超越DeepSeek-V4-Pro。

2026年9月10日,DeepSeek发布DeepSeek-V4.1-Flash,采用全新“因果编码器-解码器”(CED)架构,具备多模态理解能力,支持百万Token上下文,并同步开放API及模型权重。模型主干参数5520亿,预填充与解码阶段每Token分别激活80亿、160亿参数,进一步降低长上下文与Agent场景的推理开销。据DeepSeek官方微信公众号,考虑到V4.1-Flash 在性能、费用、速度、总用时等各项指标上已全面超越V4-Pro,因此DeepSeek计划有序下线V4 Pro模型,但现阶段考虑到V4-Pro仍保有较大调用量且Infra迁移需要时间,截至9月15日,V4-Pro仍维持服务状态。

编程与Agent能力显著提升,多模态理解拓展任务执行边界。

据DeepSeek微信公众号,1)Coding能力方面,最高思考强度下,V4.1-Flash在Terminal-Bench 2.1达到90.6分,高于Opus 5的89.1分及GPT-5.6 Sol的88.8分,在难度进一步提升的Terminal-Bench 4.0中,V4.1-Flash得分为31.2分,低于GPT-6 Astra的57.9分和Fable 5.1的55.8分;DeepSWE v1.1测试中达到74.2分,与GPT-6 Astra的74.1分基本持平,并高于Fable 5.1的67.4分。

2)Agent能力方面,AutomationBench与Agent’s Last Exam分别取得54.8分、31.8分,均高于Opus-5的50.3分、28.6分及GPT-5.6 Sol的45.8分、26.7分,体现了在视觉理解能力增强后,通用自动化任务与复杂任务的执行能力有所提升。

架构创新:CED架构与CSA2协同优化计算路径和缓存复用,延续长上下文推理的极致降本。

1)创新“因果编码器-解码器”(CED)架构,全局KV Cache占用降至V4-Flash的约1/4。模型的40层Transformer网络被划分为前20层因果编码器(Causal-Encoder)和后20层解码器(Decoder),由编码器末层输出直接投影生成解码器所需的全局 KV,无需依赖解码器各层的隐藏状态逐层生成,因此大多数输入token仅需完成编码器计算。为保留局部信息,解码器额外处理提示末尾128个token,近似重建各层滑动窗口注意力(SWA)缓存,使长输入场景下的预填充计算量接近减半,参考DeepSeek官方技术报告,预填充(Prefill)阶段每token激活参数由解码阶段的160亿降至80亿。缓存精度方面,模型将全局主KV Cache由前代FP8降至FP4,并在后训练中引入量化感知训练控制精度损失,使该部分存储占用接近减半,SWA KV则保留FP8。模型架构创新结合CSA2的跨层缓存共享机制,全局KV Cache占用降至V4-Flash的约1/4,同步带动新模型对HBM的需求减少到V4-Flash的1/4,对SSD需求减少到1/8。

2)CSA2通过分层共享KV及复用Top-K token检索结果,同步压低缓存占用与浮点运算量。模型前两层仅使用SWA,其余层采用压缩稀疏注意力CSA2,并配置Full、Reindex、Reuse三种模式:Full模式下模型通过计算生成全局主KV与索引键,并筛选Top-K历史位置;Reindex在下一层共享上一层Full模式下的KV,但重新计算相关性更新Top-K token;Reuse同时共享KV与Top-K结果,省去重复缓存生成及索引计算。具体而言,编码器其除了2层SWA外的其余18层按每6层一组配置“1层Full+5层Reuse”;解码器20层分为5组,首组为“1层Full+3层Reuse”,后4组为“1层Reindex+3层Reuse”,使后20层共享首个Full层生成的全局KV。上述设计将减少KV Cache与减少Indexer检索计算相结合,据DeepSeek官方技术论文,模型上下文由4K扩展至1M时,单Token解码FLOPs仅增加约25%,体现出长上下文推理效率的显著改善。

推理优化向API降价传导,维持国产开源模型高性价比优势。

据DeepSeek官方定价,V4.1-Flash每百万Token闲时缓存命中输入、未命中输入及输出价格分别为0.02元、1元、4元,较前代0.05元、1.5元、4.5元分别下降60.0%、33.3%、11.1%,高峰时段价格为闲时的两倍。

应用影响:新模型延续极致降本方向,利好FDE及企业级Agent应用落地

中信证券认为,模型在编程、Agent和多模态能力提升的同时继续降低调用价格,有望减轻企业级Agent的多轮工具调用、长上下文处理的成本负担,推动FDE加速落地。同时,具备行业知识积累、深度嵌入企业业务流程,或拥有垂直私域数据壁垒、能够在强监管场景交付可靠结果的专业软件公司,有望率先将模型能力转化为产品价值与商业化增量。

风险因素:

AI核心技术发展、应用拓展不及预期;算力降本不及预期;AI被不当使用造成严重社会影响;数据安全风险;信息安全风险;行业竞争加剧等。

投资策略:建议关注以下三条投资主线。

1)AI基础设施:DeepSeek深度适配国产算力,国产算力与国产模型相向而行。

2)AI应用:模型延续开源策略,推理进一步提效降本,利好FDE及有壁垒的软件应用公司。

3)模型原厂:一方面,架构创新持续释放推理提效降本空间。近2个月内发布的DeepSeek-V4.1-Flash、GLM-5.3-Flash、Qwen3.8-Flash均通过架构优化显著降低长上下文推理开销,验证了架构升级仍具备进一步降本潜力。另一方面,国产模型将围绕高性价比与前沿智能水平两条路径继续展开竞争。Flash系列以较低激活参数量和调用成本覆盖日常编程、办公及通用Agent需求,大参数量旗舰模型则有望继续提升复杂推理、专业知识及长程任务能力上限。


注:本文节选自中信证券研究部已于2026年9月16日发布的《计算机行业智能领军(AI SOTA)系列报告14—DeepSeek-V4.1-Flash:CED新架构带来推理端进一步提效降本》报告,杨泽原S1010517080002;丁奇S1010519120003;潘儒琛S1010520110001;马庆刘S1010522090001

相关主题/热点

格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。

App内直接打开
商务、渠道、广告合作/招聘立即咨询

相关文章

安徽储能1MW起参与调频......|新能源产研

产联社 · 1小时前

cover_pic

“宁王”跌了35%,市场在担心什么

独行侠 · 2小时前

cover_pic

高盛跑遍两岸三地,把光通信产业链15家老板问了个遍:需求上修39%背后,真正值钱的信号藏在这三个"缺"字里

我们对A股的思考 · 4小时前

cover_pic
我也说两句