
资讯
MiniMax H3 发布:全模态视频生成新基线
一句话:9 月 9 日,MiniMax 发布 H3 全模态模型,在视频生成、长时序一致性与音画同步上刷新基线,进一步把「文/图/视频/音频」统一进单一生成框架。
背景
- 多模态竞争从「单点文生视频」走向「全模态统一」:同一模型理解并生成文本、图像、视频与音频,降低跨模态管线拼接的损耗。
核心要点
- 全模态:文本、图像、视频、音频在同一框架内理解与生成。
- 视频一致性:长时序角色/场景保持能力提升,减少跳变与漂移。
- 音画同步:生成视频可配套音效与语音,向可交互内容靠近。
- 面向创作者与企业内容生产,强调可控性与批量产出。
为什么重要
- 全模态统一降低内容生产门槛,使中小团队也能产出接近专业水准的多模态素材。
- 与 EchoWM 等「可进入世界模型」形成互补:一个重生成、一个重交互。
关键事实速记
- 发布:2026-09-09
- 形态:全模态(文/图/视频/音频)
- 侧重:视频一致性 + 音画同步
- 定位:多模态生成新基线
📂 原文链接:查看原文 →
← 返回资讯列表
AI8899 · 内容仅供学习参考