← 资讯列表
1048576|Gemini Omni Flash支持104万Token上下文窗口

Google Gemini Omni Flash发布:首个支持视频输出的多模态模型

📅 2026/6/30 08:00:00👁 1 阅读⏱ 约 3 分钟

改写多模态规则的Omni Flash

2026年6月30日,Google发布了Gemini Omni Flash预览版,这是首个支持视频输出的商用大模型。根据benchr.org的数据,该模型拥有1,048,576 Token的上下文窗口,可同时处理文本、图像、视频和音频四种输入模态,并能生成文本和最长30秒的视频片段作为输出。

https://images.unsplash.com/photo-1674027008838-f2a59d6ef00c?w=800&q=80'/>

定价方面,Gemini Omni Flash的输入价格为$1.50/百万Token,文本输出$9/百万Token,视频输出$17.50/百万Token。这一价格水平在同类多模态模型中具有显著竞争力。

同日发布:Gemma 4 12B开源

与Omni Flash同日发布的还有Gemma 4 12B,这是Google的开源轻量级多模态模型,支持原生音频输入,可在普通终端设备上运行。Gemma 4 12B的发布将多模态AI的开发门槛大幅降低,开发者可以在笔记本电脑上完成模型微调和部署。

行业影响

Google同期发布的还有Gemini 3.1 Flash Lite Image(内部代号Nano Banana 2 Lite),定价低至输入$0.25/百万Token,图像输出$30/百万Token。CSDN的一篇前沿总结文章指出,Google正在构建从旗舰到边缘的全场景多模态模型矩阵,意图在2026年下半年的多模态竞赛中确立领先地位。

← 返回资讯列表 AI8899 · 内容仅供学习参考