← 资讯列表
资讯

DeepSeek 发布 V4.1 Flash:552B 参数、百万上下文,KV Cache 压缩至 1/437

📅 2026/9/10 08:00:00👁 1 阅读⏱ 约 3 分钟

一句话:DeepSeek 发布全新模型结构系列最小型号 V4.1 Flash:总参数量 552B、原生多模态视觉理解、百万 token 上下文,并以非对称结构大幅压缩 KV Cache 需求。

背景

  • 在长上下文与 agent 任务中,KV Cache 占用成为并发与成本瓶颈。DeepSeek 以 Causal-Encoder-Decoder 非对称结构(输入激活 8B、输出激活 16B)降低缓存需求。

核心要点

  • V4.1 Flash 总参数 552B,采用新的 Causal-Encoder-Decoder 结构,输入/输出分别激活 8B/16B 参数。
  • 原生支持视觉理解,文本与图像进入同一调用入口。
  • 支持最高 100 万 token 上下文。
  • KV Cache 较上一代降至 1/4、固态存储降至 1/8,较初代缩小 437 倍;缓存命中输入价降 60%。

为什么重要

  • 缓存压缩直接降低长程 agent 与多轮对话的推理成本,推动高并发实时服务与自托管部署的经济性。

关键事实速记

  • 发布:2026-09-10
  • 参数:552B(激活 8B/16B)
  • 上下文:1M token
  • KV Cache:较初代 1/437

📂 原文链接:查看原文 →

← 返回资讯列表 AI8899 · 内容仅供学习参考