2026年9月15日,生数科技正式发布Vidu S2。该版本包含两个模型:面向持续交互场景的实时交互数字人模型Vidu S2-Avatar,以及面向输入视频流的实时视频编辑模型Vidu S2-Editing。基于这两个模型,生数科技还探索了面向VR头显的实时空间视频生成与编辑能力。
从Vidu S1开始,生数科技已在视频生成的持续语音控制方向上进行探索。此次发布的Vidu S2-Avatar进一步扩展了交互自由度:用户可以在角色说话过程中引入新的参考图像,使角色能够与所引用的内容进行实时互动。与Vidu S1相比,Vidu S2-Avatar将实时输出分辨率从540p提升至720p,支持在生成过程中的任意时间点更新参考图像,并改善了对舞蹈等大幅度动作的指令遵循能力。
Vidu S2-Editing则支持对输入视频流的风格、服装、主体和背景进行实时修改。据生数科技介绍,Vidu S2的端到端研发工作由张金涛主导。张金涛是朱军教授指导的博士生,同时担任生数科技流式视频生成与推理负责人。
在S2-Avatar的交互能力方面,用户可以上传一张角色图像,并通过文本或语音与S2-Avatar进行交互。除对话过程中的面部表情和姿态外,该模型还支持包括舞蹈在内的更广泛肢体动作。动态参考图像是这一代模型的重要变化。在实时视频流的任意时间点,用户可以引入物体、服装或背景图像,例如要求角色拿起图像中显示的杯子、换上指定服装或进入新场景。
这类交互还涉及动作完成后的状态保持。例如,“拿起杯子,然后微笑”这一指令要求角色在微笑时继续持有杯子;“摘下帽子再戴回去”则要求模型生成摘下帽子、拿着帽子、重新戴上帽子的连贯序列。S2-Avatar通过视觉反馈和后续提示调整,提升连续动作与状态保持的可靠性。
在S2-Editing方面,该模型接收连续输入的视频流,并基于文本指令和可选参考图像进行编辑。当人物抬起手臂、转身或摄像机移动时,编辑后的输出需要跟随这些变化。目前该模型支持四类实时编辑任务,其中包括实时风格迁移:基于一张参考图像,S2-Editing在保留主体轮廓、姿态的前提下改变视觉风格,包括笔触和色彩。
从产品定位看,Vidu S2的两个模型分别指向AI视频的两条演进路径。S2-Avatar将视频生成从一次性输出推向持续交互,数字人不再只是播放预生成内容,而是能够在对话过程中响应新的视觉输入并保持动作状态。S2-Editing则将视频编辑从离线处理推向流式处理,使编辑结果能够实时跟随输入视频的变化。两者共同指向实时视频生成与编辑这一技术方向。
生数科技此次同步探索面向VR头显的实时空间视频生成与编辑,表明其技术布局并未局限于平面视频流。VR场景对实时性和空间一致性的要求更高,若相关能力成熟,可能为沉浸式内容创作和虚拟社交等场景提供新的工具基础。
当前,AI视频生成领域的竞争正从画质和时长向交互性与实时性延伸。Vidu S2将参考图像更新、状态保持和流式编辑作为核心能力,反映出行业对视频模型“可控性”和“连续性”的重视程度正在上升。对于数字人、直播、在线教育、虚拟制作等需要实时响应的场景而言,这类能力是否能够稳定落地,将决定其实际的商业价值。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。