谷歌近日宣布,在上周推出 Gemini 3.8 Live 的基础上,正式上线带有 Live Avatar 功能的 Gemini 3.8 Live,为原生实时对话模型引入接近实时的视觉呈现能力。该功能将视频生成与语音交互结合,使企业智能代理能够以动态虚拟形象与用户进行对话。
据谷歌介绍,Live Avatar 可同时处理视觉和音频输入,通过精准唇形同步、自然表情与流畅的对话轮次切换,生成更丰富的交互体验。对话本身具有多模态属性,用户通过倾听、观察、说话和面部表情进行交流,Live Avatar 旨在将这些能力赋予企业级智能代理。
在功能层面,Live Avatar 依托 Gemini 的高级推理能力,支持异步工具调用。该机制允许虚拟形象在后台触发工具调用并获取数据,同时保持对话正常进行,从而在处理复杂任务时避免对话流程中断。此外,Live Avatar 支持原生多语言语音同步,可动态适配唇形同步与表情,在 97 种语言之间无缝切换,且不会降低视频保真度或出现视觉偏移。
除预设的形象库外,企业还可自定义 Live Avatar。开发者可通过高质量参考图像生成完整动画和响应灵敏的虚拟形象,同时保留参考形象的相似度、品牌风格与角色特征。目前,自定义虚拟形象仅对企业白名单用户开放。
安全方面,谷歌为 Live Avatar 构建了保障机制,所有 AI 生成内容均通过 SynthID 添加隐形水印,直接嵌入音频与视频输出,以帮助识别 AI 生成内容,减少错误信息和错误归属问题。
目前,带 Live Avatar 的 Gemini 3.8 Live 已在 Gemini Enterprise 上线,用户可通过官方文档探索 API 并开始使用。该功能的推出意味着谷歌在企业级实时对话代理领域进一步强化了多模态交互能力,虚拟服务场景的视觉呈现与语言覆盖范围有望成为企业选择智能代理平台的新考量因素。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。