当地时间8月27日,谷歌宣布推出Gemini Omni 1.1 Flash视频生成AI模型,该模型最高支持生成4K分辨率视频,并新增场景扩展、指定首尾帧、视频参考等功能。新模型在生成速度与成本控制方面较前代Omni 1.1有显著优化,适用于快速原型验证、分镜脚本迭代及高分辨率成片输出等多样化场景。
Gemini Omni 1.1 Flash的核心亮点集中在视频生成流程的灵活性与效率提升。场景扩展功能允许用户基于已有视频从结尾处无缝衔接生成后续画面,支持按每次10秒的步长逐步扩展,单条视频累计最长可达40秒。指定首尾帧功能则使用户只需设定镜头的起始帧与结束帧,即可实现平滑自然的转场效果与镜头运镜。此外,模型支持引入最长3秒的参考视频片段,以精准维持画面的上下文背景与角色一致性。
在性能与成本方面,Gemini Omni 1.1 Flash提供360p预览分辨率选项,相比标准720p分辨率,生成速度最高可提升60%,成本仅为原来的三分之一,适合快速迭代与分镜设计。同时,模型可直接输出1080p或4K分辨率的高画质成片,满足专业级视频制作需求。价格体系按输出分辨率分档:360p视频每秒0.03美元,720p视频每秒0.1美元,1080p视频每秒0.15美元,4K视频每秒0.3美元。
此次发布延续了谷歌在AI视频生成领域的布局节奏。此前,谷歌已推出Imagen系列图像生成模型及Veo视频生成模型,Gemini Omni系列则进一步整合多模态能力,面向内容创作、影视预演及广告制作等企业级应用场景。随着视频生成模型在分辨率、时长与成本控制上的持续突破,该技术有望加速渗透至营销、影视及教育培训等行业的生产流程。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。