|
京东 JDD 发布 JoyAI-Echo 1.5 并开源 EchoWM:可进入、可操作、可听见的全模态世界模型
一句话:9 月 9 日 JDD 大会,京东探索研究院升级 JoyAI-Echo 1.5(10 分钟以上音视频持续生成),并开源可交互视听世界模型 EchoWM:原生联合生成 720P 视频、环境音、音乐、语音,支持第一/第三人称与多轮探索。
背景
2026 年 9 月 9 日京东全球科技探索者大会(JDD),京东探索研究院发布 JoyAI-Echo 系列两项进展:超长音视频生成模型升级至 JoyAI-Echo 1.5,同时发布并开源可交互视听世界模型 EchoWM。Echo 1.5 基于音视频 Memory Bank 架构,在多镜头、长时程生成中保持人物、声音与故事线索连贯,支持 10 分钟以上音视频持续生成,通过长视频后训练实现最高 7.5× 推理加速,仅需 2 张 H200 即可在 480P 下平均每秒 24 帧、约 1:1 等时生成;Director Agent 完成故事展开、分镜规划、生成审核与成片组装。EchoWM 将原生视听生成与用户控制结合:同框架生成 720P 视频、环境音、音乐、语音,声音随场景、摄像机与主体运动同步变化;通过统一相机意图(6-DoF)支持第一人称导航、第三人称协同控制与多轮连续探索。WBench Navigation 综合第一(81.6/81.7),SANA-WM-Bench VBench 83.91/83.96。同场预览 JoyAI-Video(10 月发布)。
核心要点
- 9-9 JDD 京东发布 JoyAI-Echo 1.5 + 开源 EchoWM
- Echo 1.5:10 分钟+ 音视频,2×H200 近实时
- EchoWM:720P 视频 + 环境音/音乐/语音同生
- 第一/第三人称 + 多轮探索,统一相机意图 6-DoF
- WBench Navigation 综合第一(81.6)
- SANA-WM-Bench VBench 83.91/83.96
为什么重要
世界模型从能看走向能进入、能操作、能听见,把生成内容与用户实时交互结合;开源 EchoWM 吸引开发者,电商广告、短剧创作与具身智能训练是明确落点,也显示电商巨头把可进入视听世界与供应链/广告绑定。
关键事实速记
- 发布:2026-09-09
- 大会:JDD
- Echo 1.5:10 分钟+
- EchoWM:720P + 立体声
- WBench:81.6 第一
- JoyAI-Video:10 月
← 返回资讯列表
AI8899 · 内容仅供学习参考