← 资讯列表
|

MiniMax 开源 H3 视频模型:2K/15 秒/32kHz 立体声,实时版吞吐达原版 35 倍

📅 2026/9/2 08:00:00👁 1 阅读⏱ 约 4 分钟

一句话:9 月 2 日,MiniMax(稀宇科技)开源新一代通用视频模型 H3:文本/图像/视频/音频多模态输入,最高 2K、15 秒、32kHz 立体声;H3-Base 已开源支持本地部署。同步上线实时版 H3 Max(与 fal 合作),吞吐约原版 35 倍。

背景

2026 年 9 月 2 日,MiniMax(稀宇科技)正式开源新一代通用视频模型 H3,在 AI 视频生成领域引发关注。H3 支持文本、图像、视频、音频多模态输入,可生成最高 2K 分辨率、15 秒时长、32kHz 立体声音频的视频。模型由 H3-Context-IR(上下文图像参考)、H3-Base(基础生成)、H3-Regenerate-2K(2K 超分辨率)三模块组成,其中 H3-Base 已完全开源,支持 SGLang、vLLM 等主流框架本地部署。H3 为 33B 密集单流 Transformer(H3-Omni,Qwen3-VL-32B 主干),同一次前向联合生成画面与立体声,支持 4–15 秒、最高 2K、24fps。同步上线的实时版 H3 Max(与 fal 联合开发)5 秒 768p 生成不到 3 秒,吞吐约原版 35×,已支撑全程 AI 实时生成的直播间。社区许可限制美/欧/英/韩本地部署。

核心要点

  • 9-2 MiniMax 开源 H3 视频模型
  • 2K / 15 秒 / 32kHz 立体声
  • H3-Base 开源 + SGLang/vLLM 本地部署
  • 33B 单流,画面 + 立体声同生
  • 实时版 H3 Max(fal)吞吐 35×
  • 社区许可限制本地部署

为什么重要

在头部视频模型(Veo、Kling、Seedance)均闭源按秒付费的局面下,H3 提供可自部署、可深度定制的高质量开源基座;实时版把竞争推到实时交互与直播场景,可能是 AI 视频下一爆发点。

关键事实速记

  • 开源:2026-09-02
  • 参数:33B
  • 分辨率:2K
  • 时长:15 秒
  • 音频:32kHz
  • 实时版:35× 吞吐
← 返回资讯列表 AI8899 · 内容仅供学习参考