全球报道:首款可交互音视频世界模型HelixWorld 1.0发布了!

   2026-08-17 8.2万0
核心提示:全球资源网科技频道讯:近日,Noiz AI联合来自香港科技大学、清华大学、卡内基梅隆大学(CMU)、Google DeepMind等机构的研究人

全球资源网科技频道讯:近日,Noiz AI联合来自香港科技大学、清华大学、卡内基梅隆大学(CMU)、Google DeepMind等机构的研究人员,发布可交互音视频世界模型HelixWorld 1.0。该模型可根据图片和提示词持续生成动态场景,并同步生成与画面匹配的声音,进一步推动世界模型从“生成视频”向“生成可持续交互环境”演进。

过去几年,视频生成模型在分辨率、画面质量、生成时长和稳定性方面快速提升,但多数产品仍以一次性生成固定视频为主。用户虽然可以通过Prompt设定内容,却难以在生成过程中实时改变剧情、调整视角,或让场景持续响应新的行为。

世界模型则试图突破这一限制。与传统视频生成不同,世界模型强调对环境状态的持续建模和实时生成,用户可以在生成的场景中移动、探索和交互。目前,Google DeepMind的Genie 3、腾讯WorldPlay、蚂蚁LingBot-World等均在推进相关技术。

HelixWorld 1.0此次重点补足了声音维度。按照团队介绍,该模型采用统一的原生Transformer架构生成音频与视频,并非先生成视频后再单独配音,因此能够让环境声音、人物动作和场景变化保持更紧密的同步关系。

这也意味着,世界模型正在从“可看的动态画面”进一步走向“可听、可交互、可持续运行的数字环境”。

不过,真正意义上的世界模型仍面临多项挑战。首先是多智能体交互。未来虚拟世界中可能同时存在大量拥有独立身份、目标和记忆的智能体,角色之间的合作、冲突和关系变化都需要模型持续理解和生成。

其次是多人实时交互。当多个用户和智能体同时进入同一场景后,模型不仅需要识别对话内容,还要判断说话者、交流对象、声音方位,以及停顿、抢话、表情等复杂信息。

更大的难题则是长期一致性。如果一个生成世界持续运行数小时甚至数天,角色身份、空间状态、历史事件和因果关系都需要长期保持一致。此前发生的一次对话、一次选择甚至一扇被打开的门,都需要在后续世界中继续产生影响。

进一步看,世界模型的终极方向可能是“自主运行”。即使没有新的Prompt输入、用户暂时离开,数字世界仍可以根据自身规则继续变化,角色关系、环境状态和事件进程持续演化。

一旦实时音视频生成、多智能体、长期记忆和自主运行能力逐渐成熟,世界模型有望率先影响游戏、互动影视、教育培训和虚拟仿真等领域。

从生成图片,到生成视频,再到持续生成可交互世界,生成式AI正在从“内容生成”向“环境生成”进一步延伸。未来,AI生成的或许不再只是一段预设好的视频,而是一个能够持续运行、回应用户并不断变化的数字世界。


 
举报收藏 0评论 0
  • baizi
    加关注0
  • 没有留下签名~~
推荐图文
推荐资讯
点击排行
网站首页  |  公益慈善栏目 赞助本站可以扫描支付  |  免费推广计划  |  全球资源网顾问团  |  帮助中心  |  企业文化  |  关于我们  |  全球信息中心  |  隐私政策  |  使用协议  |  版权隐私  |  广告服务  |  积分换礼  |  网站留言  |  帮助中心  |  违规举报
本站对所有发布的信息不承担任何责任,用户应决定是否采用并承担风险。