
|
arXiv 新作:离散扩散让 LLM 无损提速,Uno 模型最高达基线 3× 吞吐、无需草稿模型
一句话:arXiv 论文(2609.04010)提出 diffusion-augmented LLM:在保留 AR 分布的同时用扩散并行生成多 token,8B 版 Uno 在工具使用/编程/长上下文上超越 26B DiffusionGemma 与 Mercury,最高 3× 加速且质量无损。
背景
arXiv 论文《Unlocking Lossless Speedups in LLMs via Discrete Diffusion》(2609.04010,9 月 3 日提交)提出 diffusion-augmented LLM:在定义 AR 模型分布的同时,用扩散从分布中并行抽取多个 token。方法把参数拆成两套——按标准 NTP 目标训练的 AR 权重,与经轻量「扩散蒸馏」学习的扩散权重(开销可忽略)。论文引入 Ψ-Spec 采样器族,实现无损加速与固定上下文长度下的推理时缩放,且不像投机解码需要独立草稿模型。由此得到的 Uno 可从头训练或在现有开放权重 AR LLM 上构建:8B Uno 在所有评测批大小上吞吐超过领先投机解码方案,较基础 AR 模型最高提速 3×,并在 agentic 工具使用、编程与长上下文推理上优于 26B 的开放 d-LLM DiffusionGemma 与私有 Mercury 2,已发布代码与权重。

核心要点
- 提出 diffusion-augmented LLM 范式
- AR 权重 + 轻量扩散权重,蒸馏开销可忽略
- Ψ-Spec 采样器:无损加速 + 推理时缩放
- 无需独立草稿模型(区别于投机解码)
- 8B Uno 最高 3× 加速
- 8B Uno 优于 26B DiffusionGemma / Mercury 2
为什么重要
在不牺牲质量前提下大幅提速,是推理成本下降的关键路径;与投机解码不同,它不依赖额外草稿模型,可直接增强现有开放权重 LLM,降低部署门槛。对高并发、长上下文服务(agent、搜索)意义直接。
关键事实速记
- arXiv:2609.04010
- 提交:2026-09-03
- 方法:AR + 扩散并行解码
- 加速:最高 3×
- 模型:Uno 8B
- 对比:优于 26B DiffusionGemma
📂 原文链接:查看原文 →
← 返回资讯列表
AI8899 · 内容仅供学习参考