1000|H100单卡每秒输出token数
谷歌英伟达联手发布DiffusionGemma:引入扩散机制,单卡推理速度提升四倍
打破传统自回归范式
2026年6月10日,谷歌(Google)与英伟达(NVIDIA)合作,正式发布了实验性开源语言模型DiffusionGemma。这款模型首次将图像AI领域的扩散机制引入到文本生成领域。
核心技术突破
DiffusionGemma从随机噪声开始通过多轮迭代优化,实现单步并行输出256个token块,而非严格的顺序生成,为解决长文本生成中的一致性问题提供了全新思路。
性能表现惊人
通过英伟达深度优化,在H100显卡单用户模式下输出速度可达每秒1000个token。即使在RTX5090等高端消费级GPU上也能超过每秒700个token,比同类传统模型快近四倍。
← 返回资讯列表
AI8899 · 内容仅供学习参考