
资讯
DeepSeek 发布 V4.1 Flash:552B 参数、百万上下文,KV Cache 压缩至 1/437
一句话:DeepSeek 发布全新模型结构系列最小型号 V4.1 Flash:总参数量 552B、原生多模态视觉理解、百万 token 上下文,并以非对称结构大幅压缩 KV Cache 需求。
背景
- 在长上下文与 agent 任务中,KV Cache 占用成为并发与成本瓶颈。DeepSeek 以 Causal-Encoder-Decoder 非对称结构(输入激活 8B、输出激活 16B)降低缓存需求。
核心要点
- V4.1 Flash 总参数 552B,采用新的 Causal-Encoder-Decoder 结构,输入/输出分别激活 8B/16B 参数。
- 原生支持视觉理解,文本与图像进入同一调用入口。
- 支持最高 100 万 token 上下文。
- KV Cache 较上一代降至 1/4、固态存储降至 1/8,较初代缩小 437 倍;缓存命中输入价降 60%。
为什么重要
- 缓存压缩直接降低长程 agent 与多轮对话的推理成本,推动高并发实时服务与自托管部署的经济性。
关键事实速记
- 发布:2026-09-10
- 参数:552B(激活 8B/16B)
- 上下文:1M token
- KV Cache:较初代 1/437
📂 原文链接:查看原文 →
← 返回资讯列表
AI8899 · 内容仅供学习参考