|
arXiv 新作 HeRo:给动态路由加「记忆」,Llama 3.1-8B 跳过 38.8% 参数仍保 97% 性能
一句话:9 月 8 日,arXiv 论文 HeRo 提出历史感知路由:用路由器记忆跨层维护路由状态,Llama 3.1-8B 跳过 26.87% 参数仍达稠密模型 100.24% 性能,跳过 38.82% 仍保 97.01%。
背景
2026 年 9 月 8 日,arXiv 论文《Do Dynamic Routers Need Memory? HeRo: History-Aware Routing for Efficient LLM Inference》(2609.08189)指出:动态层路由通过学习为单个 token 跳过层来降低推理成本,但现有方法把每次路由决策当成仅依赖当前隐藏状态的局部操作,忽略了跨深度的序列化、路径依赖本质——早先决策塑造下游路由器所见表征,层使用目标又耦合所有决策。HeRo 引入路由器记忆机制,用线性注意力增量聚合先前路由分数及其诱导的残差更新,形成紧凑的历史表征;在每个路由层,路由器联合该历史状态与当前隐藏表征选择执行分支。HeRo 仅在冻结主干上训练轻量路由器与适配器,不改预训练参数。在 Llama 3.1-8B / Llama 2-7B / Llama 2-13B 上,HeRo 在十个基线中取得最高聚合性能保持。
核心要点
- HeRo:历史感知路由,给动态路由器加记忆
- 线性注意力聚合路由史+残差更新
- 仅训练轻量路由器/适配器,冻结主干
- Llama 3.1-8B:跳过 26.87% 参数仍 100.24%
- 跳过 38.82% 仍保 97.01%
- 多步推理与代码生成受益最明显
为什么重要
动态路由长期把决策当「无记忆的局部操作」,HeRo 证明跨层路由历史能显著提升自适应跳层的准确度与适应性,在大幅降本同时几乎不损性能。对长上下文、agent 等推理密集场景,这类「路由即节省」的方法正成为部署侧降本的关键杠杆。
关键事实速记
- arXiv:2609.08189
- 提交:2026-09-08
- 方法:路由器记忆(线性注意力)
- Llama3.1-8B:跳过 26.87%→100.24%
- 更紧预算:跳过 38.82%→97.01%
- 受益:多步推理/代码
← 返回资讯列表
AI8899 · 内容仅供学习参考