Google, Gemini에 얼굴을 부여하다: 실시간 아바타가 97개 언어를 실시간으로 구사

뉴스 요약
Google이 자사의 실시간 대화형 AI에 얼굴을 부여했다. 2026년 9월 24일, 이 회사는 자사의 네이티브 대화 모델의 음성에 거의 실시간으로 생성되는 영상을 추가하는 기능인 Gemini 3.8 Live with Live Avatar를 발표했으며, Google의 Cloud 블로그는 이를 9월 25일 Gemini Enterprise에서 미국과 유럽연합의 엔드포인트와 함께 일반 제공된다고 기재했다. 이제 에이전트는 음성만이 아니라 반응형 화면 속 페르소나를 통해 듣고, 보고, 말할 수 있다. 이 이야기를 처음 보도한 The Verge 페이지는 이 보고서를 위해 검색할 수 없었기에, 아래 세부 내용은 Google 자체 발표와 독립 보도에서 나온 것이다.
Live Avatar가 하는 일
Live Avatar는 Google의 네이티브 음성 대 음성 대화 모델을 저지연 스트리밍 영상과 결합한다. 생성된 얼굴은 합성 음성을 따라 립싱크와 표정을 수행한다. 이 시스템은 또한 발언 순서를 처리하므로, 사용자가 끼어들어도 에이전트가 자연스럽게 복구한다.
이 엔진은 음성과 시각 입력을 동시에 받는다. 따라서 아바타는 말하는 동안 사용자의 카메라 피드나 공유 화면을 볼 수 있다. Google은 이를 통해 기업이 고객 서비스와 대화형 안내 같은 가상 서비스를 확장할 수 있다고 말한다.
언어와 도구 사용
Google은 이 기능이 자동 언어 감지와 함께 97개 언어에 걸친 네이티브 다국어 음성 대 음성 동기화를 지원한다고 말한다. 대화가 한 언어에서 다른 언어로 넘어가면 립싱크와 표정이 동적으로 적응한다. 한 리뷰어는 다국어 주장이 독립적으로 검증되지 않았다고 지적한다.
비동기 도구 호출을 통해 에이전트는 대화가 계속되는 동안 백그라운드에서 도구를 호출하고 데이터를 가져올 수 있다. 재고 검색이나 계정 세부 정보 조회 같은 복잡한 작업이 대화를 중단시킬 필요가 없다.
사전 설정 및 맞춤 아바타
조직은 사전 설정 아바타 라이브러리에서 고를 수 있다. 맞춤 아바타는 허용 목록을 통해 선별된 엔터프라이즈 고객으로 제한된다. 약관 보도에 따르면, 맞춤 아바타는 참조 이미지에 대한 검증된 동의를 요구하고 미성년자, 유명인 또는 불쾌한 콘텐츠의 이미지를 금지한다. 기업은 또한 필요한 권리를 확보해야 한다. 이 모델의 Extended Thinking 변형은 비공개 미리보기로 남아 있다.
초기 고객
Google의 발표는 여러 초기 도입자를 언급한다. Autotrader를 운영하는 회사인 Cox Automotive는 차량 검색과 금융을 위해 화면에서 항목을 강조하는 AI 쇼핑 어시스턴트를 구축하고 있다. Equal AI는 9개 인도 언어에 걸쳐 하루 100만 건 이상의 통화를 처리하는 개인 어시스턴트를 운영한다. Salesforce는 이 기술을 Agentforce와 통합하고 있으며, Specs는 더 나은 음성 활동 감지와 더 낮은 지연을 보고한다.
가격과 실제 한계
소비자 구독은 없다. 가격은 엔터프라이즈 API 사용자를 위한 토큰당 과금이다. 독립 분석에 따르면, 텍스트 입력은 100만 토큰당 0.75달러, 오디오 입력은 3달러, 이미지 또는 영상 입력은 1달러다. 텍스트 출력은 4.50달러, 오디오 출력은 12달러, 아바타 영상 출력은 100만 토큰당 1달러다. 아바타 영상은 초당 24프레임으로 실행되며 말하는 1초당 약 6,192토큰으로 변환되는데, 이 분석은 이를 아바타 발화 1분당 약 0.37달러에 오디오 출력 1분당 약 0.018달러를 더한 것으로 본다.
같은 분석은 연속 세션이 현재 몇 분만 지속된다고 말한다. 이는 호텔 체크인이나 짧은 지원 대화 같은 제한된 작업에는 적합하지만, 긴 과외나 상담 세션에는 적합하지 않다. 세션 컨텍스트는 매 턴마다 다시 처리되고 청구된다.
안전과 투명성
Google의 AI 제품이 생성하는 모든 오디오와 영상에는 감지하기 어려운 SynthID 워터마크가 들어 있어 AI 생성 콘텐츠를 식별하는 데 도움이 된다. 그러나 워터마크는 보이지 않으므로, 그 자체로 사용자가 AI와 대화하고 있다는 사실을 통보받는다고 보장하지는 않는다. 아바타를 배포하는 기업은 자체적인 명확한 공개가 필요할 것이다. Engadget의 헤드라인은 이 아바타를 "소름 끼친다"고 불렀는데, 이는 사실적인 합성 얼굴에 대한 반응이 엇갈린다는 것을 상기시킨다.
학습자에게 중요한 이유
얼굴은 음성 어시스턴트를 대화처럼 더 느끼게 해주며, 이는 언어 연습, 안내형 소프트웨어 워크스루, 대화형 교육에 도움이 될 수 있다. 이 기술은 또한 음성, 시각, 영상 생성이 하나의 실시간 모델에서 얼마나 빠르게 결합되는지를 보여준다. 대규모 배포를 위한 프로비저닝된 처리량을 사용할 수 있으며, Google Cloud 영업팀이 맞춤 아바타의 허용 목록 등록을 처리한다. 개발자는 Gemini Enterprise 콘솔에서 이 기능을 사용해 보고 Gemini Live API 문서를 읽을 수 있다.
출처
보도는 Google의 Cloud 및 제품 블로그, Unite.AI, Engadget, Fone Arena, Android Headlines, TestingCatalog, TechEBlog, Choosely에 기반한다. 별도 언급이 없는 한 모든 날짜는 태평양 시간 발표를 가리키며, Google의 블로그는 GA를 2026년 9월 25일로 기재한다.