10月10日,生数科技正式发布新一代视频生成旗舰模型预览版本Vidu Q4 Preview。该版本在图生视频与参考生视频两条产品线上进行了能力升级,最高支持15张参考图与3段参考音频输入,并首次实现2K、4K分辨率输出,单次最长可生成16秒视频。
从功能结构来看,Vidu Q4 Preview延续了Vidu系列的双模式架构。图生视频模式支持用户上传单张图片并结合文字描述生成动态视频;参考生视频模式则允许多张参考图片与音频共同输入,用于保持角色形象、场景风格与音色的一致性。官方信息显示,该版本最多支持3段参考音频,通过声音参考机制使角色音色在多次生成中保持统一;同时最多支持15张参考图,覆盖人物、场景、道具等创意要素的视觉参考需求。
在视频生成质量方面,Vidu Q4 Preview对动态运镜、切镜与复杂镜头衔接进行了针对性优化,并支持2K、4K分辨率输出及10bit色深。单次生成时长上限为16秒,官方定位的适用场景包括AI短剧、广告营销、社交互动与影视创作。从参数指标来看,该版本在分辨率与色深上的提升,意味着生成内容在专业制作流程中的可用性进一步增强,尤其是在需要较高画质标准的广告与影视前期环节。
价格方面,Vidu Q4 Preview首发优惠价为0.09元/秒起,支持540P、720P、1080P、2K、4K多种规格输出。生数科技方面表示,这一价格策略旨在降低用户测试多个开场、脚本与镜头版本的成本,在完成版本筛选后再以2K或4K规格输出成片,以兼顾产品质感、材质光影与视觉冲击力。按此计算,一段16秒的4K视频生成成本将显著低于同规格的传统制作流程。
生数科技成立于2023年,核心团队来自清华大学朱军教授课题组,专注于生成式AI与多模态大模型研发。公司此前推出的Vidu系列视频生成模型已在国内外市场获得一定关注,其差异化定位在于对参考图与音频输入的深度整合,试图解决视频生成中角色一致性与风格延续性的行业难题。此次Q4 Preview版本的发布,是该系列在分辨率、输入维度与生成时长上的又一次迭代。
从行业视角来看,视频生成赛道在2024年进入密集迭代期。国内方面,快手可灵、字节跳动即梦、智谱清影等产品相继推出或升级;海外方面,Runway、Pika、Luma等公司亦持续更新模型能力。竞争焦点正从早期的“能否生成”转向“生成质量与可控性”,分辨率、时长、多模态输入与生成一致性成为衡量模型能力的关键指标。Vidu Q4 Preview在参考图数量与音频参考上的扩展,反映出行业对“可控生成”需求的回应。
值得注意的是,AI视频生成在B端场景的落地正在加速。广告营销、短剧制作与影视前期可视化对视频素材的需求量大、迭代频繁,传统制作方式成本高、周期长。生成式模型若能在画质与一致性上达到可用标准,将直接切入这一部分预算。Vidu Q4 Preview以0.09元/秒起的定价策略,明显指向高频测试与快速迭代的使用场景,试图在价格敏感度较高的营销与短剧市场建立优势。
目前Vidu Q4 Preview以预览版本形式开放,正式版本的发布时间与完整功能尚未披露。随着2K、4K输出能力的加入,视频生成模型与专业制作流程的衔接将更为紧密,但生成时长、物理规律遵循与复杂叙事连贯性仍是全行业待解的技术课题。生数科技此次迭代能否在竞争激烈的视频生成市场中形成差异化壁垒,取决于其正式版本在稳定性与一致性上的实际表现。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。