爱诗科技推出PixVerse R2,将实时世界模型能力与效率拆分为两层推进

一次生成不再以交付文件为终点,还要成为后续行动不断发生的环境。

2026年1月,爱诗科技提出“通用实时世界模型”产品方向并推出PixVerse R1。目前,PixVerse R2已全量上线,用户可直接进入网页端体验动作指令和互动影游的相关交互。该产品试图解决实时世界模型领域长期存在的核心矛盾:实时性要求模型足够快、足够高效,通用性则要求模型足够强、见过足够丰富的世界。

大语言模型已通过Scaling证明模型、数据和算力可以持续换来更强能力,但这一经验难以简单迁移至世界模型。语言模型可在接收问题后集中计算再给出答案,实时世界模型则必须一边运行,一边接收用户的动作、文字和声音,同时持续输出连贯的音视频内容。PixVerse R2给出的方案是将能力与效率拆成两层推进,把五类增长纳入同一可扩展框架,使生成质量、长程一致性和多模态控制能够共同提升。

在实时生成世界“冬日宫殿”中,用户通过WASD和方向键控制移动与视角,新指令可继续改变当前体验。技术分析显示,客户端全程只观察到一次session_init和一次generation_started,此后八轮系统推荐Prompt共享同一条内容流,提示历史从第一轮连续累积到第八轮。约119.5秒的生成窗口里,所有操作都被组织在同一条持续session中,八轮Prompt并非彼此独立的视频任务,而是当前世界下一步如何变化的连续控制输入。

多模态控制方面,每轮Prompt从发送到prompt_generated大约经历3.9至4.5秒。在第三至第八轮中,Prompt发出后约8至26毫秒,Action就继续进入控制通道,每个对应窗口内持续发送约129至152条动作帧。处理语义指令时,WASD通道仍保持开放,两类输入可同时进入一条运行中的世界会话。用户无需在动作模式和语言模式之间反复切换,可在移动、观察和探索过程中继续发出新的语义意图。

延迟数据方面,八轮推荐Prompt发出后,服务端prompt_updated的中位耗时约为1.33秒,完整prompt_generated事件的中位耗时约为4.27秒。前者代表当前世界流中的指令状态已更新,说明从接收、审核到世界流更新,R2已建立起一套秒级Prompt协议链路。

互动影游Zero Mark展示了这套能力如何进入更长、更有结构的内容产品。HAR记录确认,Winter Palace运行在r2 pipeline中,Zero Mark则使用director pipeline,后者维持了一条约20分钟的长session,53次有效状态响应始终指向同一脱敏session,状态保持为ACTIVE,媒体通道也未改变。

从产品形态看,World层已将控制信号与时间尺度Scaling外化为同一产品会话里的Text、Action和持续媒体。更多输入不再意味着更多彼此割裂的生成任务,而是共同作用于一个仍在运行的世界。实时世界模型能否沿LLM的Scaling路径持续演进,将取决于这类产品在真实场景中的用户留存与生态构建能力。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
豆包个人助理产品定名“小豆” 计划推出独立App
上一篇 3小时前
国轩高科发布低空飞行高功率电池、中欧非物流补能方案与零碳数字云平台
下一篇 3小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部