ホーム / ニュース / Google、Geminiに顔を与える:ライブアバターが97言語をリアルタイムで話す
Gemini

Google、Geminiに顔を与える:ライブアバターが97言語をリアルタイムで話す

2026年9月27日4 分で読了
Google、Geminiに顔を与える:ライブアバターが97言語をリアルタイムで話す

ニュース概要

Googleはライブ会話AIに顔を与えた。2026年9月24日、同社はGemini 3.8 Live with Live Avatarを発表した。これはネイティブ対話モデルの音声にほぼリアルタイムで生成される動画を追加する機能で、GoogleのCloudブログは9月25日にGemini Enterpriseで一般提供され、米国と欧州連合にエンドポイントがあると記載している。エージェントは音声だけでなく、応答性の高い画面上のペルソナを通じて聞き、見て、話せるようになった。この話を最初に報じたThe Vergeのページは本記事のために取得できなかったため、以下の詳細はGoogle自身の発表と独立した報道に基づく。

ライブアバターの機能

ライブアバターは、Googleのネイティブ音声対音声対話モデルと低遅延ストリーミング動画を組み合わせる。生成された顔は、合成音声に合わせてリップシンクと表情を行う。システムはターンテイキングも処理するため、ユーザーが割り込んでもエージェントは自然に回復する。

エンジンは音声と視覚入力を同時に取り込む。そのためアバターは話しながらユーザーのカメラ映像や共有画面を見ることができる。Googleはこれにより、企業がカスタマーサービスやインタラクティブなウォークスルーなどの仮想サービスを拡張できると述べている。

言語とツール利用

Googleは、この機能が97言語にわたるネイティブ多言語音声対音声同期を自動言語検出付きでサポートすると述べている。会話がある言語から別の言語に移ると、リップシンクと表情が動的に適応する。あるレビュアーは、多言語の主張は独立に検証されていないと指摘している。

非同期ツール呼び出しにより、エージェントは会話を続けながらバックグラウンドでツールを呼び出し、データを取得できる。在庫検索やアカウント詳細の照会などの複雑なタスクは、対話を中断する必要がない。

プリセットとカスタムアバター

組織はプリセットアバターのライブラリから選べる。カスタムアバターは許可リストを通じて一部の企業顧客に限定される。利用規約の報道によると、カスタムアバターは参照画像に対する検証済みの同意を必要とし、未成年者、有名人、攻撃的なコンテンツの画像を禁止する。企業は必要な権利も確保しなければならない。モデルのExtended Thinking版は非公開プレビューのままである。

初期顧客

Googleの発表では、いくつかの初期導入企業が挙げられている。Autotraderを運営するCox Automotiveは、車両検索とファイナンスのために画面上で項目を強調するAIショッピングアシスタントを構築している。Equal AIは、インドの9言語にわたって1日100万件以上の通話を処理するパーソナルアシスタントを運用している。Salesforceはこの技術をAgentforceと統合しており、Specsは音声活動検出の改善と遅延の低減を報告している。

価格と実用的な制限

消費者向けサブスクリプションはない。価格は企業APIユーザー向けのトークン単位である。独立した分析によると、テキスト入力は100万トークンあたり0.75ドル、音声入力は3ドル、画像または動画入力は1ドルである。テキスト出力は4.50ドル、音声出力は12ドル、アバター動画出力は100万トークンあたり1ドルである。アバター動画は毎秒24フレームで動作し、発話1秒あたり約6,192トークンに変換される。この分析では、アバター発話1分あたり約0.37ドル、さらに音声出力1分あたり約0.018ドルとされている。

同じ分析によると、連続セッションは現在数分しか続かない。これはホテルのチェックインや短いサポート会話のような限られたタスクには適するが、長いチュータリングやコンサルティングのセッションには適さない。セッションコンテキストは各ターンで再処理され、課金される。

安全性と透明性

GoogleのAI製品が生成するすべての音声と動画には、知覚できないSynthIDウォーターマークが付与されており、AI生成コンテンツの識別に役立つ。しかしウォーターマークは目に見えないため、それ自体ではユーザーがAIと話していることを知らされる保証にはならない。アバターを導入する企業は、独自の明確な開示が必要になる。Engadgetの見出しはアバターを「不気味」と呼び、リアルな合成顔への反応が賛否両論であることを思い起こさせる。

学習者にとって重要な理由

顔があると音声アシスタントはより会話のように感じられ、語学練習、ソフトウェアのガイド付きウォークスルー、インタラクティブなトレーニングに役立つ可能性がある。この技術はまた、音声、視覚、動画生成が単一のリアルタイムモデルにどれほど迅速に統合されつつあるかを示している。大量展開向けにプロビジョニング済みスループットが利用可能で、カスタムアバターの許可リストはGoogle Cloudの営業が担当する。開発者はGemini Enterpriseコンソールでこの機能を試し、Gemini Live APIのドキュメントを読むことができる。

出典

報道はGoogleのCloudブログと製品ブログ、Unite.AI、Engadget、Fone Arena、Android Headlines、TestingCatalog、TechEBlog、Chooselyに基づく。特に断りのない限り、すべての日付は太平洋時間の発表を指し、Googleのブログは一般提供を2026年9月25日としている。

GeminiAIアバター