← 资讯列表
|

阿里地图团队开源 DreamX-Creator 1.0:图生视频原生同步生成画面与声音(Apache 2.0,2K)

📅 2026/9/3 08:00:00👁 1 阅读⏱ 约 4 分钟

一句话:9 月 3 日,阿里高德(AMAP-ML)开源 DreamX-Creator 1.0:单网络、单 pass 同时生成视频与音频并保持同步,2K 输出,Apache 2.0 许可,论文 8 月 31 日登 arXiv。

背景

2026 年 9 月 3 日,阿里高德地图团队 AMAP-ML 开源 DreamX-Creator 1.0——一个原生音视频联合生成模型。多数 AI 视频工具先生成无声片段再后期配音,口型与同步始终勉强;DreamX-Creator 在单一网络内同时去噪视频流与音频流,脚步落在脚踏地时、人声对上口型、房间声匹配房间。架构为 7B 联合生成器(视频 DiT 与音频 DiT 并行),前半段两流各自独立、后半段通过 Gated Cross-Modal Attention 让声画按 token/head 互相倾听;再用 5B 的 AR 单步 2K 精炼器上采样。基于开源 Wan2.2 底座,配套 CreatorDACVAE 音频 VAE,并以强化学习同时给画面、声音、同步三项打分。论文 arXiv 2608.31106,权重与推理代码已放出。

核心要点

  • AMAP-ML(高德)开源 DreamX-Creator 1.0
  • 单网络单 pass 联合生成视频+音频并同步
  • 7B 联合生成器 + Gated Cross-Modal Attention
  • 5B AR 单步 2K 精炼器上采样
  • Apache 2.0 许可,基于 Wan2.2 底座
  • 论文 arXiv 2608.31106,权重已放出

为什么重要

声音是 AI 视频长期被跳过的一半——无声片段只是情绪板,自带同步音频的片段才是一「镜头」。原生 A/V 生成移除了管线中最痛苦的一环;Apache 2.0 的宽松许可对 trailers、动画、游戏过场尤为友好,也显示空间智能竞赛已蔓延到地图这类非传统创意团队。

关键事实速记

  • 开源:2026-09-03
  • 类型:原生音视频联合生成
  • 基座:Wan2.2 + CreatorDACVAE
  • 许可:Apache 2.0
  • 论文:arXiv 2608.31106
  • 输出:2K
← 返回资讯列表 AI8899 · 内容仅供学习参考