生数科技发布Vidu S2:为AI视频引入实时交互与实时编辑能力

Vidu S2-Avatar将实时输出分辨率从Vidu S1的540p提升至720p,并支持在生成过程中任意时间点更新参考图像。

2026年9月15日,生数科技正式发布Vidu S2。该版本包含两个模型:面向持续交互场景的实时交互数字人模型Vidu S2-Avatar,以及面向输入视频流的实时视频编辑模型Vidu S2-Editing。基于这两个模型,生数科技还探索了面向VR头显的实时空间视频生成与编辑能力。

从Vidu S1开始,生数科技已在视频生成的持续语音控制方向上进行探索。此次发布的Vidu S2-Avatar进一步扩展了交互自由度:用户可以在角色说话过程中引入新的参考图像,使角色能够与所引用的内容进行实时互动。与Vidu S1相比,Vidu S2-Avatar将实时输出分辨率从540p提升至720p,支持在生成过程中的任意时间点更新参考图像,并改善了对舞蹈等大幅度动作的指令遵循能力。

Vidu S2-Editing则支持对输入视频流的风格、服装、主体和背景进行实时修改。据生数科技介绍,Vidu S2的端到端研发工作由张金涛主导。张金涛是朱军教授指导的博士生,同时担任生数科技流式视频生成与推理负责人。

在S2-Avatar的交互能力方面,用户可以上传一张角色图像,并通过文本或语音与S2-Avatar进行交互。除对话过程中的面部表情和姿态外,该模型还支持包括舞蹈在内的更广泛肢体动作。动态参考图像是这一代模型的重要变化。在实时视频流的任意时间点,用户可以引入物体、服装或背景图像,例如要求角色拿起图像中显示的杯子、换上指定服装或进入新场景。

这类交互还涉及动作完成后的状态保持。例如,“拿起杯子,然后微笑”这一指令要求角色在微笑时继续持有杯子;“摘下帽子再戴回去”则要求模型生成摘下帽子、拿着帽子、重新戴上帽子的连贯序列。S2-Avatar通过视觉反馈和后续提示调整,提升连续动作与状态保持的可靠性。

在S2-Editing方面,该模型接收连续输入的视频流,并基于文本指令和可选参考图像进行编辑。当人物抬起手臂、转身或摄像机移动时,编辑后的输出需要跟随这些变化。目前该模型支持四类实时编辑任务,其中包括实时风格迁移:基于一张参考图像,S2-Editing在保留主体轮廓、姿态的前提下改变视觉风格,包括笔触和色彩。

从产品定位看,Vidu S2的两个模型分别指向AI视频的两条演进路径。S2-Avatar将视频生成从一次性输出推向持续交互,数字人不再只是播放预生成内容,而是能够在对话过程中响应新的视觉输入并保持动作状态。S2-Editing则将视频编辑从离线处理推向流式处理,使编辑结果能够实时跟随输入视频的变化。两者共同指向实时视频生成与编辑这一技术方向。

生数科技此次同步探索面向VR头显的实时空间视频生成与编辑,表明其技术布局并未局限于平面视频流。VR场景对实时性和空间一致性的要求更高,若相关能力成熟,可能为沉浸式内容创作和虚拟社交等场景提供新的工具基础。

当前,AI视频生成领域的竞争正从画质和时长向交互性与实时性延伸。Vidu S2将参考图像更新、状态保持和流式编辑作为核心能力,反映出行业对视频模型“可控性”和“连续性”的重视程度正在上升。对于数字人、直播、在线教育、虚拟制作等需要实时响应的场景而言,这类能力是否能够稳定落地,将决定其实际的商业价值。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
LinkSquares推出工作流构建智能体与蓝图,将自然语言转化为合同流程
上一篇 1小时前
Insider One推出Agent One自优化智能系统,用于自主客户互动
下一篇 1小时前

相关推荐

  • 沸腾的数字人:打响大模型产品落地第一枪

    大模型时代,真正颠覆性的产品是怎样的?它应该具备大模型的自进化能力,还是能给产业贡献新的生产力工具?抑或是重构企业的经营管理模型? 数字人,正在给出一个答案。 出品|产业家 “大模型如何往下走?” 6月底,

    2024年7月16日
  • 腾讯红杉押注,港股数字人第一股要来了

    港股数字人第一股,要来了。 10月31日,数字人智能体提供商南京硅基智能科技股份有限公司(下称:硅基智能)在港交所递交招股书,拟在香港主板上市,招银国际、星展亚洲为其联席保荐人。 此次IPO,

    2025年11月5日

发表回复

登录后才能评论
分享本页
返回顶部