← 资讯列表
1000|H100单卡每秒输出token数

谷歌英伟达联手发布DiffusionGemma:引入扩散机制,单卡推理速度提升四倍

📅 2026/6/11 08:00:00👁 1 阅读⏱ 约 2 分钟

打破传统自回归范式

2026年6月10日,谷歌(Google)与英伟达(NVIDIA)合作,正式发布了实验性开源语言模型DiffusionGemma。这款模型首次将图像AI领域的扩散机制引入到文本生成领域。

https://blog.google/static/blog/files/google-deepmind-logo.svg'/>

核心技术突破

DiffusionGemma从随机噪声开始通过多轮迭代优化,实现单步并行输出256个token块,而非严格的顺序生成,为解决长文本生成中的一致性问题提供了全新思路。

性能表现惊人

通过英伟达深度优化,在H100显卡单用户模式下输出速度可达每秒1000个token。即使在RTX5090等高端消费级GPU上也能超过每秒700个token,比同类传统模型快近四倍。

← 返回资讯列表 AI8899 · 内容仅供学习参考