← 资讯列表
|

arXiv 新作 Epoch:把扩散块作为编译单元服务块扩散 MoE,端到端提速 2.7×

📅 2026/9/9 08:00:00👁 2 阅读⏱ 约 3 分钟

一句话:9 月 9 日,arXiv 论文 Epoch 提出把扩散块作为编译单元的服务系统,针对块扩散 MoE 每次前向绑定到精炼迭代时钟的低效,在 8×H100 上对 7B–100B 模型端到端提速最高 2.7× 且保质量。

背景

2026 年 9 月 9 日提交 arXiv:2609.09748,提出 Epoch:把扩散块作为编译单元的服务系统。扩散语言模型通过多前向精炼固定大小 token 位置块,该循环不匹配多数 LLM 服务系统的每前向执行单元;稠密 MoE 运行时把所有工作绑到精炼迭代时钟:每前向重建相似路由、对已死 logits 位置重算专家、走稠密专家并行集合通信。Epoch 编译小 block plan 覆盖块时钟结构,沿三条密集轴:atlas 每层覆盖驱动活跃专家支撑、lsp 全序列分片仅路由活/新解码/刷新位置、freshlane 经专家并行分发/内核/合并再恢复稠密逻辑分片。在 8×H100 上对 LLaDA-MoE、LLaDA2.0-mini、LLaDA2.0-Flash(7B–100B)评估,端到端最高 2.7×,且保质量。

核心要点

  • 9-9 arXiv:2609.09748(Epoch)
  • 把扩散块作为编译单元服务
  • 针对块扩散 MoE 低效
  • block plan 三轴:atlas / lsp / freshlane
  • 8×H100 评估 7B–100B
  • 端到端最高 2.7×,保质量

为什么重要

扩散语言模型的服务系统长期套用自回归 LLM 运行时,Epoch 把块作为编译单元,是块扩散推理首个系统级加速,直接降低块扩散 MoE 部署成本,填补了新模型架构的服务层空白。

关键事实速记

  • 提交:2026-09-09
  • arXiv:2609.09748
  • 硬件:8×H100
  • 模型:LLaDA-MoE 等
  • 提速:2.7×
  • 维度:atlas/lsp/freshlane
← 返回资讯列表 AI8899 · 内容仅供学习参考