← 资讯列表
|

arXiv 新作:离散扩散让 LLM 无损提速,Uno 模型最高达基线 3× 吞吐、无需草稿模型

📅 2026/9/3 08:00:00👁 2 阅读⏱ 约 4 分钟

一句话:arXiv 论文(2609.04010)提出 diffusion-augmented LLM:在保留 AR 分布的同时用扩散并行生成多 token,8B 版 Uno 在工具使用/编程/长上下文上超越 26B DiffusionGemma 与 Mercury,最高 3× 加速且质量无损。

背景

arXiv 论文《Unlocking Lossless Speedups in LLMs via Discrete Diffusion》(2609.04010,9 月 3 日提交)提出 diffusion-augmented LLM:在定义 AR 模型分布的同时,用扩散从分布中并行抽取多个 token。方法把参数拆成两套——按标准 NTP 目标训练的 AR 权重,与经轻量「扩散蒸馏」学习的扩散权重(开销可忽略)。论文引入 Ψ-Spec 采样器族,实现无损加速与固定上下文长度下的推理时缩放,且不像投机解码需要独立草稿模型。由此得到的 Uno 可从头训练或在现有开放权重 AR LLM 上构建:8B Uno 在所有评测批大小上吞吐超过领先投机解码方案,较基础 AR 模型最高提速 3×,并在 agentic 工具使用、编程与长上下文推理上优于 26B 的开放 d-LLM DiffusionGemma 与私有 Mercury 2,已发布代码与权重。

核心要点

  • 提出 diffusion-augmented LLM 范式
  • AR 权重 + 轻量扩散权重,蒸馏开销可忽略
  • Ψ-Spec 采样器:无损加速 + 推理时缩放
  • 无需独立草稿模型(区别于投机解码)
  • 8B Uno 最高 3× 加速
  • 8B Uno 优于 26B DiffusionGemma / Mercury 2

为什么重要

在不牺牲质量前提下大幅提速,是推理成本下降的关键路径;与投机解码不同,它不依赖额外草稿模型,可直接增强现有开放权重 LLM,降低部署门槛。对高并发、长上下文服务(agent、搜索)意义直接。

关键事实速记

  • arXiv:2609.04010
  • 提交:2026-09-03
  • 方法:AR + 扩散并行解码
  • 加速:最高 3×
  • 模型:Uno 8B
  • 对比:优于 26B DiffusionGemma

📂 原文链接:查看原文 →

← 返回资讯列表 AI8899 · 内容仅供学习参考