DeepSeek V4.1 Flash落地 国产算力芯片迎10T模型新机遇

时间:2026年09月22日 08:38:40 中财网
  CFi.CN讯:数据显示,DeepSeek V4.1 Flash通过架构与推理系统深度优化,显著降低GPU资源消耗:Global KV Cache压缩约75%,Persistent KV Cache压缩达87.5%,使原本需NVIDIA Blackwell 64卡承载的10T参数模型,有望在Hopper系列64卡系统部署。这意味着2026—2027年主流国产芯片如昇腾960系列,已具备支撑10T—20T大模型的能力。

  
  近期机构研报指出,V4.1 Flash并非简单模型瘦身,而是系统性降本增效:CED结构拆分减少Prefill计算量,CSA2+FP4+SWA组合将KV Cache降至前代约1/4—1/8;Single-Pass mHC缓解HBM带宽压力。同时,Engram外置知识、DSpark动态调度提升Decode吞吐,单位GPU任务完成效率明显增强。

  
  研报认为,该技术路径强化了国产算力芯片与本土大模型的协同逻辑,硬件需求闭环进一步夯实。壁仞科技等国产AI芯片厂商有望加速进入模型厂商采购清单,算力替代节奏或超预期。

  中财网
各版头条