谷歌为Gemini赋予面孔:实时虚拟形象以97种语言实时对话

新闻摘要
谷歌为其实时对话式AI赋予了一张面孔。2026年9月24日,该公司推出了Gemini 3.8 Live with Live Avatar,这项功能为其原生对话模型的语音添加了近实时生成的视频,谷歌云博客将其列为9月25日在Gemini Enterprise中正式可用,端点覆盖美国和欧盟。代理现在可以通过一个响应式的屏幕形象来聆听、观看和说话,而不再仅仅依靠语音。最初报道此事的The Verge页面无法为本报道获取,因此以下细节来自谷歌自己的公告和独立报道。
Live Avatar的功能
Live Avatar将谷歌的原生语音到语音对话模型与低延迟流式视频相结合。生成的面孔会执行与合成语音同步的唇形动作和面部表情。该系统还处理轮流发言,因此用户可以打断,代理会自然地恢复。
该引擎同时接收语音和视觉输入。因此,虚拟形象可以在说话时查看用户的摄像头画面或共享屏幕。谷歌表示,这使企业能够扩展客户服务和交互式导览等虚拟服务。
语言与工具使用
谷歌表示,该功能支持97种语言的母语级多语言语音到语音同步,并具备自动语言检测。当对话从一种语言切换到另一种语言时,唇形同步和表情会动态调整。一位评测者指出,多语言方面的说法尚未经过独立验证。
异步工具调用让代理可以在对话继续进行的同时在后台调用工具并获取数据。复杂任务,例如搜索库存或查询账户详情,无需中断对话。
预设与定制虚拟形象
组织可以从预设虚拟形象库中进行选择。定制虚拟形象通过允许列表仅限部分企业客户使用。根据相关条款的报道,定制虚拟形象需要参考图像获得经过验证的同意,并禁止使用未成年人、名人或冒犯性内容的图像。企业还必须确保获得所需的权利。该模型的扩展思考变体仍处于私密预览阶段。
早期客户
谷歌的公告提到了多家早期采用者。Autotrader背后的公司Cox Automotive正在构建一个AI购物助手,可在屏幕上突出显示车辆搜索和融资相关的项目。Equal AI运行着一个个人助理,每天在九种印度语言中处理超过一百万次通话。Salesforce正在将该技术与Agentforce集成,Specs报告称语音活动检测更好且延迟更低。
定价与实际限制
没有消费者订阅。定价面向企业API用户按token计费。根据一份独立分析,文本输入每百万token收费0.75美元,音频输入3美元,图像或视频输入1美元。文本输出每百万token收费4.50美元,音频输出12美元,虚拟形象视频输出1美元。虚拟形象视频以每秒24帧运行,每秒说话转换为约6,192个token,该分析估算虚拟形象说话约为每分钟0.37美元,外加音频输出每分钟约0.018美元。
同一份分析称,连续会话目前仅持续几分钟。这适合酒店入住或简短支持对话等有界任务,但不适合长时间辅导或咨询会话。会话上下文在每一轮都会重新处理并计费。
安全与透明度
谷歌AI产品生成的所有音频和视频都带有不可感知的SynthID水印,这有助于识别AI生成的内容。然而,该水印是不可见的,因此它本身并不能保证用户被告知他们正在与AI对话。部署虚拟形象的企业需要自行进行明确披露。Engadget的标题称这些虚拟形象“令人毛骨悚然”,这提醒人们,对逼真合成面孔的反应褒贬不一。
对学习者的意义
面孔让语音助手感觉更像一场对话,这可能有助于语言练习、引导式软件导览和互动培训。这项技术还表明,语音、视觉和视频生成正以多快的速度被整合到一个实时模型中。预置吞吐量可用于高容量部署,谷歌云销售团队负责定制虚拟形象的允许列表审批。开发者可以在Gemini Enterprise控制台中试用该功能,并阅读Gemini Live API文档。
来源
报道参考了谷歌的云博客和产品博客、Unite.AI、Engadget、Fone Arena、Android Headlines、TestingCatalog、TechEBlog和Choosely。除非另有说明,所有日期均指太平洋时间的公告,谷歌博客将正式可用日期定为2026年9月25日。