中金:DS V4.1 Flash释放硬件潜能 国产卡迈向10T模型时代

DeepSeek V4.1 Flash的核心意义,是通过架构和推理系统优化,以更低的计算、存储和访存成本,实现更高的任务完成效率与单位GPU产出。

智通财经APP获悉,中金发布研报称,DeepSeek V4.1 Flash的核心意义,是通过架构和推理系统优化,以更低的计算、存储和访存成本,实现更高的任务完成效率与单位GPU产出。以V4.1 Flash的优化逻辑推演,该行看到原本需在NVIDIA Blackwell系列64卡系统承载的10T模型,有望在64卡Hopper系列系统完成部署,即2026-2027年主流性能的国产算力芯片(如昇腾960系列)有望支持国产模型向10T-20T参数量平台持续扩张,国产算力需求的逻辑闭环再一次被印证。

中金主要观点如下:

降本:V4.1 Flash并非简单缩小模型,而是系统性减少长上下文推理中的重复计算、存储和数据搬运

CED将40层Transformer拆分为20层Encoder与20层Decoder,使长Prompt无需完整经过后20层Decoder,从而降低Prefill计算量。CSA2通过Full、Reindex、Reuse三类层分工复用Global KV与Top-K;叠加FP4 Main KV和SWA Bounded Replay后,Global KV Cache降至V4 Flash的约1/4,Persistent KV Cache降至约1/8。同时,Single-Pass mHC通过Kernel Fusion减少Activation重复读写,进一步缓解HBM带宽压力。

增效:V4.1 Flash通过更小动态计算、外置记忆和更高Decode吞吐,以更低单位资源消耗获得更高任务完成效率

其Prefill和Decode阶段每Token分别仅激活约8B和16B参数;Engram将部分静态知识从主干动态计算中剥离并按需检索;DSpark则通过轻量Draft、置信度预测和动态调度提升Decode效率。

风险

模型价格竞争风险,硬件供应链风险,AI商业化风险。

智通声明:本内容为作者独立观点,不代表智通财经立场。未经允许不得转载,文中内容仅供参考,不作为实际操作建议,交易风险自担。更多最新最全港美股资讯,请点击下载智通财经App
分享
微信
分享
QQ
分享
微博
收藏