
|
arXiv 新作 ACE:免训练、免标定的 MoE 专家跳过,Qwen3.6 上困惑度降 7.96%
一句话:9 月 4 日,arXiv 论文 ACE 提出免训练、免标定、保留权重的 MoE 专家跳过框架:仅靠门控/投影统计与运行时门控,Qwen3.6-35B-A3B 在 50% 跳过率下困惑度降 7.96%、下游精度 +4.15pp。
背景
2026 年 9 月 4 日,arXiv 论文《ACE: Adaptive Calibration-Free Expert Skipping for MoE-based LLMs》(2609.05228)指出:MoE 固定 top-k 路由对每个 token 激活相同数量专家槽位,造成大量冗余计算。现有跳过方法常依赖路由置信度、标定数据或额外训练,难以可靠估计专家真实贡献。ACE 提出免训练、免标定、保留权重的 token 自适应专家跳过框架,含两部分:全局谱代理(GSP)从耦合的门控/升/降投影与 RMSNorm 缩放估计全局变换容量;路由条件精炼(RCR)从中心化路由权重构造专家专属方向原型,沿路由偏好方向评估专家响应。推理时两者一致判定某专家槽位低贡献才跳过,且始终保留 top-1 专家。所有专家统计离线计算,在线仅查表与轻量标量运算。
核心要点
- ACE:免训练/免标定/保留权重的专家跳过
- GSP 全局谱代理 + RCR 路由条件精炼
- 仅当两视图都判低贡献才跳过,保留 top-1
- 统计离线算,在线仅查表+标量运算
- Qwen3.6-35B-A3B:50% 跳过困惑度 -7.96%
- 下游平均精度 +4.15pp(vs 最强基线)
为什么重要
MoE 推理成本高企,ACE 在不改权重、不碰训练数据的前提下显著降本提质,对已经上线的 MoE 模型是「即插即用」的推理优化。把专家贡献估计从「路由置信度」升级为「谱+方向」双视图,工程上简单却有效,可被 serving 框架直接采纳。
关键事实速记
- arXiv:2609.05228
- 提交:2026-09-04
- 方法:GSP + RCR
- 跳过率:50%(Qwen3.6-35B)
- 困惑度:-7.96%
- 特性:免训练/免标定
← 返回资讯列表
AI8899 · 内容仅供学习参考