据央广财经与新浪财经报道,9月9日在京东全球科技探索者大会(JDD)上,京东探索研究院发布JoyAI-Echo系列两项进展:超长音视频生成模型升级到JoyAI-Echo 1.5,同时发布并开源可交互视听世界模型JoyAI-EchoWM,以及更轻的四步因果流式版本EchoWM-Flash。前者解决能生成多长,后者解决生成出来的世界能不能进去走一走。
两个发布要分开看
JoyAI-Echo 1.5走的是长视频路线。它基于音视频Memory Bank架构,在多镜头、长时程生成中保持人物形象、声音与故事线索的连贯,支持10分钟以上音视频持续生成;通过长视频后训练实现最高7.5倍推理加速,只需2张H200,就能在480P分辨率下平均每秒生成24帧,接近一比一等时生成;配套的Director Agent可按自然语言完成故事展开、分镜规划、生成审核与成片组装。
EchoWM走的是世界模型路线。它把原生视听生成与用户控制结合,在同一套框架里生成720P视频、环境音、音乐与语音,声音随场景、摄像机与主体运动同步变化。控制层面采用统一的相机意图表示,把键盘或手柄的离散指令映射为连续的六自由度轨迹,第一人称漫游与第三人称跟拍共用同一套意图流,不再需要分别维护角色轨迹与跟随参数。
这条赛道真正的难点是一致性
画面质量早已不是唯一瓶颈。一扇门画得逼真只是起点,用户往前走它会自然靠近,穿过走廊再回头,它应该还在原来的位置;改变路线或切换视角时,脚步声、环境音与人物说话声是否与画面同步延续,才决定这个生成世界能不能被反复进入。
行业里已有几条参照路线:谷歌DeepMind的Genie 3展示了实时探索与分钟级一致性;英伟达的SANA-WM把分钟级生成、精确相机控制与更高效率结合起来;World Labs的Atlas通过空间上下文支持沿指定相机轨迹生成新视角,维持场景几何关系。EchoWM选择的是把视听生成与交互控制放进同一个框架。
评测数字怎么读
| 指标 | 结果 | 说明 |
|---|---|---|
| WBench Navigation平均分 | 81.7(EchoWM-Flash为81.0) | 覆盖158个多轮导航案例 |
| 一致性 | 89.8 | 长时程空间关系与主体状态延续 |
| 交互性 | 87.2(EchoWM-Flash为87.9) | 指令响应与导航控制 |
| 生成规格 | 原生联合生成720P视频与环境音、音乐、语音 | 视频与音频分支在生成中交换信息 |
| 训练流程 | 音视频持续预训练、动作微调、联合微调、自回归后训练 | 配合统一轨迹尺度与蒸馏技术 |
读这类榜单要注意两点:评测集与训练数据的重合度,以及平均分掩盖的分布差异。81.7分说明在标准导航任务上表现稳定,不等于任意场景都能跑通,尤其是涉及复杂物理交互与多主体协同的场景。
对内容团队与一人公司的实际意义
开源权重是这件事对个体最实在的部分。权重开放意味着有能力的团队可以自己部署、自己微调,把模型改成贴合自身业务的样子,而不只是调用一个封闭接口。短剧、数字人直播、虚拟展厅这类内容形态,多了一条先做交互原型再决定投入的路径。
硬件门槛也要说清楚。长视频生成侧的2张H200、720P实时交互的算力需求,都不是个体创作者随手能负担的量级。现实的做法是先用云端服务验证产品逻辑,把交互设计与内容脚本打磨出来,等推理成本继续下降再考虑自建。
为什么开源这一步很关键
世界模型赛道此前以闭源演示为主,能力看得到、用不上。EchoWM选择开放权重,把竞争从展示效果推向工程落地:研究团队可以复现与对比,中小企业可以在自有数据上微调,做垂直场景的团队能把它嵌进产品,而不是只能对着演示视频想象可能性。
对国内的沉浸式内容生态来说,还有一层意义是可控。生成式视频与数字人涉及素材版权与内容合规,能够在本地部署、能够审计生成过程,往往比调用一个看不见内部机制的服务更容易通过客户与平台方的审核。
还没解决的问题
- 长时程探索后的世界记忆仍有限,反复折返与大幅改变路线时,场景漂移的风险还在。
- 生成成本与硬件门槛决定了它现阶段更适合机构用户,个体使用者需要依赖云服务。
- 沉浸式内容的版权与合规边界尚未定型,用于商业场景前需要单独评估。
常见问题
问:EchoWM与Echo 1.5是什么关系?
答:同属JoyAI-Echo系列的两个方向。Echo 1.5解决长时程音视频生成的连贯与效率,EchoWM解决可交互、可探索的视听世界生成,后者发布时即开源。
问:开源后普通开发者能直接跑起来吗?
答:能拿到权重,但需要匹配的算力与工程能力,实时交互场景对显存和推理效率要求较高,个人开发者更适合先通过云端服务体验能力边界。
问:这类世界模型对内容创业有什么实际用途?
答:目前最实际的用途是低成本产出可交互的虚拟场景原型,用于短剧分镜验证、数字人直播背景与沉浸式展示,替代一部分原本需要三维建模的工作。
参考来源
- [1] 新浪财经.《京东开源JoyAI-Echo WM世界模型,性能登顶权威测评榜单》. 2026-09-09
- [2] 央广财经.《京东发布可交互视听世界模型 长视频生成同步升级》. 2026-09-09
- [3] 机器之心Pro.《国产世界模型EchoWM开源:会发声的可探索世界来了》. 2026-09-10
- [4] 京东集团.《From AI Models to the Physical World: Highlights from JDDiscovery 2026》. 2026-09