← 资讯列表
资讯

京东开源 JoyAI-EchoWM:可交互视听世界模型

📅 2026/9/9 08:00:00👁 1 阅读⏱ 约 3 分钟

一句话:9 月 9 日京东全球科技探索者大会(JDD)上,京东探索研究院开源 JoyAI-EchoWM 与轻量流式版 EchoWM-Flash:原生联合生成 720P 视频、环境音、音乐与语音,随用户导航实时演变,WBench Navigation 综合第一。

背景

  • 世界模型竞争从「画面质量」延伸到「持续交互中的可靠性」:镜头随指令、场景保连贯、生成跟得上操作;当交互触及视听,还需声音随画面同步演变。

核心要点

  • 原生视听联合:同一框架生成 720P 视频 + 环境音 + 音乐 + 语音,声音随镜头/场景/主体运动同步。
  • 统一「相机意图」交互:离散指令与连续姿态统一映射为 6-DoF 轨迹,支持第一人称导航与第三人称协同。
  • 长时序多轮探索:反复切换视角/移动,人物样貌、物体位置、空间关系不漂移。
  • WBench Navigation 158 个多轮案例综合第一;EchoWM-Flash 四步因果流式版兼顾实时性;代码/论文/权重已开源。

为什么重要

  • EchoWM 把「好看但难交互」与「能交互但弱音频」两条路线合并,让 AI 生成世界从「能看」走向「能进、能探索」。
  • 对游戏预演、影视分镜、数字人与机器人仿真训练有直接价值。

关键事实速记

  • 发布:2026-09-09(JDD)
  • 模型:JoyAI-EchoWM / EchoWM-Flash
  • 能力:720P 视听联合 + 相机意图
  • 评测:WBench 综合第一

📂 原文链接:查看原文 →

← 返回资讯列表 AI8899 · 内容仅供学习参考