← 资讯列表
4倍|推理速度较自回归模型提升倍数

谷歌发布DiffusionGemma:扩散技术改写文本生成范式,推理速度提升4倍

📅 2026/6/20 08:00:00👁 1 阅读⏱ 约 2 分钟

突破顺序处理的瓶颈

即便是当今最强大的大语言模型,在处理任务时依然按照从左到右的顺序依次生成内容。在本地单用户运行场景中,这种顺序处理方式往往导致GPU和TPU资源大量闲置。谷歌推出的DiffusionGemma采用扩散技术,从随机占位Token的"画布"出发,经多轮处理同时生成整段文本。

技术架构与性能

DiffusionGemma基于谷歌Gemma 4系列和Gemini Diffusion研究成果构建,是260亿参数的混合专家模型。推理时仅激活38亿参数,量化后可在18GB显存内运行。该模型具备双向注意力机制,每次前向传播可并行生成256个Token,在GPU上文本生成速度最高可提升4倍。

实际应用场景

DiffusionGemma特别适合交互式编码、代码填充、行内编辑、数学图表处理以及客服实时交互等场景。其自我修正能力通过置信度评分在下一轮处理中重新评估Token,能一次性对整段文本进行审查并实时纠正错误。模型以Apache 2.0许可证发布,已在Hugging Face、GitHub和vLLM上提供。

← 返回资讯列表 AI8899 · 内容仅供学习参考