Google 為 Gemini 賦予面孔:即時虛擬人像以 97 種語言即時對話

新聞摘要
Google 為其即時對話式 AI 賦予了一張面孔。2026 年 9 月 24 日,該公司推出 Gemini 3.8 Live 搭配 Live Avatar,這項功能為其原生對話模型的語音加上近乎即時生成的影片,而 Google 的 Cloud 部落格將其在 Gemini Enterprise 中的正式推出日期列為 9 月 25 日,端點位於美國與歐盟。代理現在可以透過螢幕上反應靈敏的角色形象聆聽、觀看與說話,而不只是單純的聲音。《The Verge》最早報導此消息的頁面無法為本報導取得,因此以下細節來自 Google 自家的公告與獨立報導。
Live Avatar 的功能
Live Avatar 將 Google 的原生語音轉語音對話模型與低延遲串流影片配對。生成的臉孔會執行唇形同步與面部表情,並跟隨合成的語音。該系統也處理輪流發言,因此使用者可以打斷,而代理會自然恢復。
該引擎同時接收語音與視覺輸入。因此,虛擬人像可以在說話時看著使用者的攝影機畫面或共享螢幕。Google 表示,這讓企業能夠擴展虛擬服務,例如客戶服務與互動式導覽。
語言與工具使用
Google 表示,該功能支援橫跨 97 種語言的原生多語言語音轉語音同步,並具備自動語言偵測。當對話從一種語言轉換到另一種語言時,唇形同步與表情會動態調整。一位評論者指出,這些多語言宣稱尚未經過獨立驗證。
非同步工具呼叫讓代理能在對話持續進行的同時,在背景呼叫工具並取得資料。複雜任務,例如查詢庫存或查找帳戶詳細資料,不必中斷對話。
預設與自訂虛擬人像
組織可以從預設虛擬人像庫中挑選。自訂虛擬人像透過允許清單限制給特定企業客戶使用。根據相關條款的報導,自訂虛擬人像需要參考圖像的已驗證同意,並禁止未成年人、名人或冒犯性內容的圖像。企業也必須確保取得其所需權利。該模型的 Extended Thinking 變體仍處於私人預覽階段。
早期客戶
Google 的公告列出數家早期採用者。Cox Automotive,即 Autotrader 背後的公司,正在打造一款 AI 購物助理,會在螢幕上標示車輛搜尋與融資相關項目。Equal AI 營運一款個人助理,每天在九種印度語言中處理超過一百萬通來電。Salesforce 正將該技術與 Agentforce 整合,而 Specs 回報了更好的語音活動偵測與更低的延遲。
定價與實際限制
沒有消費者訂閱方案。定價對企業 API 使用者而言是按權杖計費。根據一份獨立分析,文字輸入每百萬權杖為 0.75 美元,音訊輸入為 3 美元,圖像或影片輸入為 1 美元。文字輸出每百萬權杖為 4.50 美元,音訊輸出為 12 美元,虛擬人像影片輸出為 1 美元。虛擬人像影片以每秒 24 格運行,並轉換為每說話一秒約 6,192 個權杖,該分析估計這相當於每分鐘虛擬人像說話約 0.37 美元,外加每分鐘約 0.018 美元的音訊輸出費用。
同一份分析指出,連續工作階段目前僅持續幾分鐘。這適合有界任務,例如飯店入住或簡短支援對話,但不適合長時間的輔導或諮詢工作階段。工作階段內容會在每一輪重新處理並計費。
安全性與透明度
Google AI 產品生成的所有音訊與影片都帶有無法察覺的 SynthID 浮水印,這有助於辨識 AI 生成的內容。然而,該浮水印是隱形的,因此本身無法保證使用者會被告知他們正在與 AI 對話。部署虛擬人像的企業將需要自行清楚揭露。Engadget 的標題稱這些虛擬人像「令人毛骨悚然」,提醒人們對逼真合成臉孔的反應好壞參半。
為何對學習者重要
臉孔讓語音助理感覺更像對話,這可能有助於語言練習、引導式軟體導覽與互動式訓練。該技術也顯示語音、視覺與影片生成正多麼快速地結合在單一即時模型中。高流量部署可使用佈建輸送量,而 Google Cloud 業務團隊負責處理自訂虛擬人像的允許清單。開發人員可以在 Gemini Enterprise 主控台中試用該功能,並閱讀 Gemini Live API 文件。
來源
報導參考了 Google 的 Cloud 與產品部落格、Unite.AI、Engadget、Fone Arena、Android Headlines、TestingCatalog、TechEBlog 與 Choosely。除非另有註明,所有日期均指太平洋時間的公告,而 Google 的部落格將正式推出日期列為 2026 年 9 月 25 日。