4倍|推理速度较自回归模型提升倍数
谷歌发布DiffusionGemma:扩散技术改写文本生成范式,推理速度提升4倍
突破顺序处理的瓶颈
即便是当今最强大的大语言模型,在处理任务时依然按照从左到右的顺序依次生成内容。在本地单用户运行场景中,这种顺序处理方式往往导致GPU和TPU资源大量闲置。谷歌推出的DiffusionGemma采用扩散技术,从随机占位Token的"画布"出发,经多轮处理同时生成整段文本。

技术架构与性能
DiffusionGemma基于谷歌Gemma 4系列和Gemini Diffusion研究成果构建,是260亿参数的混合专家模型。推理时仅激活38亿参数,量化后可在18GB显存内运行。该模型具备双向注意力机制,每次前向传播可并行生成256个Token,在GPU上文本生成速度最高可提升4倍。
实际应用场景
DiffusionGemma特别适合交互式编码、代码填充、行内编辑、数学图表处理以及客服实时交互等场景。其自我修正能力通过置信度评分在下一轮处理中重新评估Token,能一次性对整段文本进行审查并实时纠正错误。模型以Apache 2.0许可证发布,已在Hugging Face、GitHub和vLLM上提供。
← 返回资讯列表
AI8899 · 内容仅供学习参考