← 资讯列表
|

arXiv 新作 LDA:推理时减激活专家会放大输出方差,层间分布对齐免训练修复

📅 2026/9/8 08:00:00👁 1 阅读⏱ 约 4 分钟

一句话:9 月 8 日,KAIST/Google DeepMind 等 arXiv 论文(EMNLP 2026 Findings)提出 Layer-wise Distribution Alignment (LDA):推理时动态减激活专家会放大 SMoE 输出 RMS 尺度与方差,造成表示错位,LDA 用逐层校准统计免训练修复、近乎零开销。

背景

2026 年 9 月 8 日提交 arXiv:2609.09241(EMNLP 2026 Findings),KAIST AI 与 Google DeepMind 等提出 Layer-wise Distribution Alignment (LDA)。多数 MoE 用固定 top-k 路由,给每 token 相同专家预算;推理时动态减 k 可降本且不重训,但现有方法忽视偏离训练时路由配置造成的分布漂移。作者证明减少激活专家一致放大 SMoE 输出的 RMS 尺度与方差,造成表示错位(除专家容量损失外另一独立因素)。LDA 用逐层校准统计把减路由表示对齐默认配置,跨多 SMoE LLM、基准与路由策略恢复大部分性能损失,近乎零开销,已与 vLLM 高效注意力内核集成。

核心要点

  • 9-8 arXiv:2609.09241(EMNLP 2026 Findings)
  • 提出 LDA 层间分布对齐
  • 根因:减专家放大 RMS 尺度/方差(独立于容量损失)
  • 逐层校准统计对齐默认配置
  • 近乎零开销,免训练
  • 跨多 SMoE LLM/基准验证

为什么重要

推理时动态减专家是降本常用手段,但分布漂移长期被忽视;LDA 免训练、即插即用,对线上 MoE 服务是直接可用的精度修复,把专家贡献估计提升到分布层面。

关键事实速记

  • 提交:2026-09-08
  • arXiv:2609.09241
  • 录用:EMNLP 2026 Findings
  • 方法:LDA
  • 特性:免训练/零开销
  • 机构:KAIST + DeepMind
← 返回资讯列表 AI8899 · 内容仅供学习参考