← 资讯列表
|

arXiv 新作 Declarative Attention:让 LLM 声明要读哪段上下文,解码 token 减少 52%

📅 2026/9/2 08:00:00👁 5 阅读⏱ 约 4 分钟

一句话:9 月 2 日,KAIST AI 与 Google DeepMind 的 arXiv 论文提出 Declarative Attention:让模型在思维链中声明要读取的上下文区域,Gemma-4-31B 解码注意力 token 减少 52%,准确率仅降 1.27pp。

背景

2026 年 9 月 2 日,KAIST AI 与 Google DeepMind 研究者发布 arXiv 论文(2609.02737),提出 Declarative Attention 协议,解决百万级上下文推理的 KV 缓存瓶颈。传统做法每生成一个 token 都要扫描整段历史(1M 上下文约 15GB KV 缓存);该协议让模型在自己的思维链中以类 XML 标签声明下一步要读哪段上下文,推理引擎像工具调用一样解析声明并跳过其余 KV 块。在 Gemma-4-31B 上,解码注意力 token 减少 52.0%,15 项长上下文任务平均准确率仅降 1.27pp;Qwen-3.6-27B 减少 31.1%、降 2.75pp。无需微调,已与 vLLM 高效注意力内核集成。

核心要点

  • Declarative Attention 把瓶颈变提示问题
  • 模型声明要读哪段上下文(XML 标签)
  • 引擎跳过其余 KV 块,降内存读取
  • Gemma-4-31B 注意力 token -52%,准确率 -1.27pp
  • Qwen-3.6-27B -31.1%,-2.75pp
  • 无需微调,已接 vLLM

为什么重要

长上下文推理的成本主要来自每步全量 KV 扫描;让模型「自己决定读什么」可大幅削减算力,使百万级上下文在消费级部署成为可能。该方法零微调、即插即用,是推理优化的实用突破,对 agent 长程记忆与检索场景尤其关键。

关键事实速记

  • arXiv:2609.02737
  • 发布:2026-09-02
  • 机构:KAIST AI + DeepMind
  • Gemma-4-31B:注意力 -52%
  • 准确率损失:1.27pp
  • 集成:vLLM,无需微调

📂 原文链接:查看原文 →

← 返回资讯列表 AI8899 · 内容仅供学习参考