
|
阿里地图团队开源 DreamX-Creator 1.0:图生视频原生同步生成画面与声音(Apache 2.0,2K)
一句话:9 月 3 日,阿里高德(AMAP-ML)开源 DreamX-Creator 1.0:单网络、单 pass 同时生成视频与音频并保持同步,2K 输出,Apache 2.0 许可,论文 8 月 31 日登 arXiv。
背景
2026 年 9 月 3 日,阿里高德地图团队 AMAP-ML 开源 DreamX-Creator 1.0——一个原生音视频联合生成模型。多数 AI 视频工具先生成无声片段再后期配音,口型与同步始终勉强;DreamX-Creator 在单一网络内同时去噪视频流与音频流,脚步落在脚踏地时、人声对上口型、房间声匹配房间。架构为 7B 联合生成器(视频 DiT 与音频 DiT 并行),前半段两流各自独立、后半段通过 Gated Cross-Modal Attention 让声画按 token/head 互相倾听;再用 5B 的 AR 单步 2K 精炼器上采样。基于开源 Wan2.2 底座,配套 CreatorDACVAE 音频 VAE,并以强化学习同时给画面、声音、同步三项打分。论文 arXiv 2608.31106,权重与推理代码已放出。
核心要点
- AMAP-ML(高德)开源 DreamX-Creator 1.0
- 单网络单 pass 联合生成视频+音频并同步
- 7B 联合生成器 + Gated Cross-Modal Attention
- 5B AR 单步 2K 精炼器上采样
- Apache 2.0 许可,基于 Wan2.2 底座
- 论文 arXiv 2608.31106,权重已放出
为什么重要
声音是 AI 视频长期被跳过的一半——无声片段只是情绪板,自带同步音频的片段才是一「镜头」。原生 A/V 生成移除了管线中最痛苦的一环;Apache 2.0 的宽松许可对 trailers、动画、游戏过场尤为友好,也显示空间智能竞赛已蔓延到地图这类非传统创意团队。
关键事实速记
- 开源:2026-09-03
- 类型:原生音视频联合生成
- 基座:Wan2.2 + CreatorDACVAE
- 许可:Apache 2.0
- 论文:arXiv 2608.31106
- 输出:2K
← 返回资讯列表
AI8899 · 内容仅供学习参考