谷歌推出Gemini 3.8 Live虚拟人:支持97种语言实时唇形同步

AI 驱动中国 闻溪 808次阅读
分享 微 Q 信
AI摘要
由 AI 生成 · 仅供参考

谷歌在Gemini 3.8 Live中新增Live Avatar功能,结合实时视频生成与语音,支持97种语言无缝切换及动态表情。该功能依托高级推理与异步工具调用,允许企业自定义形象并嵌入SynthID水印,目前已在Gemini Enterprise上线。

驱动中国9月25日消息,谷歌正式在Gemini 3.8 Live模型中集成Live Avatar功能,为原生实时对话系统引入接近实时的视觉呈现能力。这一更新建立在上周发布的Gemini 3.8 Live基础之上,旨在通过多模态交互提升虚拟服务的真实感与流畅度。

Live Avatar将实时视频生成技术与语音处理相结合,能够构建具备倾听、观察及动态视觉反馈能力的交互体验。该功能通过精准的唇形同步、自然的面部表情以及流畅的对话轮次切换,协助企业拓展更具交互性的虚拟服务场景。对话本身具备多模态特性,Live Avatar赋予企业智能代理处理视觉和音频输入的能力,从而生成更丰富的对话内容,优化整体交互体验。

在技术底层,该功能依托Gemini的高级推理能力。通过异步工具调用机制,Live Avatar能够在后台触发工具调用并获取数据,同时保持前端对话的正常进行。这种设计确保了在处理复杂任务时,对话流程不会因等待数据响应而中断,维持了交互的连贯性。

语言支持方面,Live Avatar具备原生多语言语音同步能力,可在97种语言之间实现无缝切换。系统能够动态适配不同语言的唇形同步与表情变化,且在切换过程中不会降低视频保真度或出现视觉偏移现象,保证了跨语言交互的高质量呈现。

除了提供预设的多样化形象库,企业用户还可对Live Avatar进行自定义。开发者能够利用高质量参考图像生成具备完整动画效果且响应灵敏的虚拟形象,同时保留参考形象的相似度、品牌风格及角色特征。目前,自定义虚拟形象功能仅向企业白名单用户开放。

为保障内容安全,谷歌为Live Avatar构建了严格的安全保障机制。所有由AI生成的内容均通过SynthID技术添加隐形水印,该水印直接嵌入音频与视频输出中,旨在帮助识别AI生成内容,减少错误信息及错误归属问题的发生。

现阶段,搭载Live Avatar功能的Gemini 3.8 Live已在Gemini Enterprise平台上线。用户可通过查阅官方文档探索API接口,进而开始使用该服务。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com。
本文价值 ★★★★★ 3.5 2 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录
✎ 我要投稿有独家观点或行业线索?向驱动中国投稿,审核采用后署名发布并获积分奖励。 去投稿 ›

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友