
|
arXiv 新作 LDA:推理时减激活专家会放大输出方差,层间分布对齐免训练修复
一句话:9 月 8 日,KAIST/Google DeepMind 等 arXiv 论文(EMNLP 2026 Findings)提出 Layer-wise Distribution Alignment (LDA):推理时动态减激活专家会放大 SMoE 输出 RMS 尺度与方差,造成表示错位,LDA 用逐层校准统计免训练修复、近乎零开销。
背景
2026 年 9 月 8 日提交 arXiv:2609.09241(EMNLP 2026 Findings),KAIST AI 与 Google DeepMind 等提出 Layer-wise Distribution Alignment (LDA)。多数 MoE 用固定 top-k 路由,给每 token 相同专家预算;推理时动态减 k 可降本且不重训,但现有方法忽视偏离训练时路由配置造成的分布漂移。作者证明减少激活专家一致放大 SMoE 输出的 RMS 尺度与方差,造成表示错位(除专家容量损失外另一独立因素)。LDA 用逐层校准统计把减路由表示对齐默认配置,跨多 SMoE LLM、基准与路由策略恢复大部分性能损失,近乎零开销,已与 vLLM 高效注意力内核集成。

核心要点
- 9-8 arXiv:2609.09241(EMNLP 2026 Findings)
- 提出 LDA 层间分布对齐
- 根因:减专家放大 RMS 尺度/方差(独立于容量损失)
- 逐层校准统计对齐默认配置
- 近乎零开销,免训练
- 跨多 SMoE LLM/基准验证
为什么重要
推理时动态减专家是降本常用手段,但分布漂移长期被忽视;LDA 免训练、即插即用,对线上 MoE 服务是直接可用的精度修复,把专家贡献估计提升到分布层面。
关键事实速记
- 提交:2026-09-08
- arXiv:2609.09241
- 录用:EMNLP 2026 Findings
- 方法:LDA
- 特性:免训练/零开销
- 机构:KAIST + DeepMind
← 返回资讯列表
AI8899 · 内容仅供学习参考