xAI의 Grok Voice Think Fast 2.0, 응답 시간 1초 미만으로 단축

뉴스 요약
xAI가 기존 Think Fast 1.0의 데뷔로부터 3개월도 채 되지 않아 차세대 실시간 음성 AI 모델인 Grok Voice Think Fast 2.0을 출시했다. 2026년 7월 29일(태평양 표준시)에 발표된 이 업그레이드된 모델은 더 빠른 응답 시간, 더욱 정확해진 전사 정확도, 그리고 더 자연스러운 대화 동작을 제공하여 전 세계 개발자들이 음성 기반 애플리케이션을 구축하는 데 사용할 수 있는 최고 수준의 음성 모델 중 하나로 자리매김하고 있다.
Think Fast 2.0의 새로운 기능
업데이트된 모델은 단일 통합 파이프라인에서 듣고, 추론하며, 말할 수 있어 이전 버전보다 눈에 띄게 낮은 레이턴시로 응답할 수 있다. xAI에 따르면, 모델의 평균 첫 오디오 생성 시간은 버전 1.0의 1.25초에서 버전 2.0의 0.70초로 감소하여, 현재까지 공개적으로 벤치마크된 가장 빠른 음성 모델 중 하나가 되었다. 회사는 이러한 개선이 사람이 생각하는 도중에 말을 시작하는 것과 유사하게, 모델이 완전한 응답을 형성하기 전에 음성 생성을 시작할 수 있도록 하는 아키텍처 개선에서 비롯되었다고 밝혔다.
전사 품질 또한 크게 향상되었다. xAI는 Think Fast 2.0이 Think Fast 1.0 대비 전사 정확도에서 1.4배 향상을 보여주며, 20개 이상의 언어에 걸쳐 수천 개의 짧은 구절을 포함하는 평가에서 다른 널리 사용되는 전사 시스템과 비교해 1.5배에서 2.0배의 향상을 달성했다고 보고했다. 북적이는 콜센터나 야외 환경과 같은 시끄러운 환경에서는 모델이 훨씬 더 큰 정확도 향상을 보여주며, 실제 환경에 배포된 음성 비서의 가장 일반적인 실패 지점 중 하나를 해결하고 있다.
독립적인 벤치마크 결과
타사 평가 기관인 Artificial Analysis는 Think Fast 2.0의 'High' 추론 변형이 Speech-to-Speech Index에서 82.9%의 점수를 받아 해당 지수가 추적하는 상위 모델 중 하나에 포함되었다는 결과를 발표했다. 이 수치는 Think Fast 1.0이 기록한 75.7%에서 도약한 것이다. 동일한 평가에서 Think Fast 2.0은 지수 상위 5위권 내에서 평균 첫 오디오 생성 시간을 1초 미만으로 유지한 유일한 모델이었으며, 이는 xAI가 속도와 품질 사이에서 이룬 균형을 강조한다. 이 모델은 또한 별도의 에이전트 음성 성능 벤치마크에서도 높은 순위를 차지하며, 다단계 음성 지시를 안정적으로 따르는 능력을 반영했다.
실제 환경의 음성 에이전트를 위한 설계
xAI는 이 모델이 연구 쇼케이스가 아닌 상용 음성 에이전트를 염두에 두고 구축되었다고 밝혔다. 시끄러운 환경에서도 정확성을 유지하고, 복잡한 다단계 워크플로를 따르며, 방해를 우아하게 처리하는 것을 포함해 주고받는 대화 중에 더 자연스럽게 들리도록 설계되었다. 이러한 특성은 고객 지원 자동화, 예약 스케줄링 및 음성 에이전트가 단순히 대본을 읽어주는 대신 말하면서 작업을 추론해야 하는 기타 시나리오와 같은 사용 사례를 겨냥한다.
이번 출시는 xAI의 Agent Builder 플랫폼의 지속적인 성장과 함께 이루어졌다. 이 플랫폼은 기업이 일상 언어로 원하는 통화 흐름을 설명하고, 지식 베이스와 외부 도구를 연결하며, 수십 개의 사전 설정된 음성 톤에서 선택하여 상용 음성 에이전트를 구성할 수 있게 해주는 노코드 도구다. 이 플랫폼은 이미 25개 이상의 언어와 짧은 오디오 샘플에서의 음성 복제를 지원하고 있으며, xAI는 Agent Builder 배포가 향후 몇 주 내에 새로운 Think Fast 2.0 엔진으로 전환될 것이라고 밝혔다.
가용성 및 출시 일정
개발자들은 xAI의 Voice API를 통해 즉시 Grok Voice Think Fast 2.0에 액세스할 수 있다. 회사는 여러 통합에서 기본적으로 사용되는 "grok-voice-latest" 별칭이 2026년 8월 5일에 Think Fast 1.0에서 Think Fast 2.0으로 공식 전환되어, 개발자에게 새 모델이 기본값이 되기 전에 테스트할 수 있는 짧은 기간을 제공할 것이라고 확인했다. 사용량은 xAI의 기존 음성 가격 구조와 일관되게 처리된 오디오 분당 요금으로 청구되며, 대화 중 수행된 웹 검색과 같은 선택적 도구 호출에 대해서는 추가 요금이 부과된다.
중요한 이유
음성 인터페이스는 소비자 및 기업 AI의 핵심 프론티어로 점점 더 여겨지고 있으며, 여러 주요 AI 연구소들이 음성 상호작용이 사람과 대화하는 것처럼 느껴지도록 레이턴시를 줄이고 자연스러움을 개선하기 위해 경쟁하고 있다. 단일 출시로 속도와 정확도 모두에서 격차를 줄임으로써 xAI는 음성 기반 AI 에이전트가 실험적 데모에서 기업이 고객 서비스 라인부터 교육 튜터링 애플리케이션에 이르기까지 일상적인 작업에 배포할 수 있는 신뢰할 수 있는 도구로 나아가고 있음을 시사하며, AI 시스템과의 빠르고 자연스러운 다국어 음성 상호작용을 점점 더 기대하는 전 세계 사용자에게 혜택을 줄 것이다.