xAI 的 Grok Voice Think Fast 2.0 将响应时间缩短至一秒以内

新闻摘要
在初代 Think Fast 1.0 首发不到三个月后,xAI 发布了其新一代实时语音 AI 模型 Grok Voice Think Fast 2.0。该升级模型于 2026 年 7 月 29 日(太平洋时间)宣布,带来了更快的响应速度、更精准的转录准确度以及更自然的对话表现,使其成为面向全球开发语音驱动应用的开发者的领先语音模型之一。
Think Fast 2.0 的新特性
更新后的模型在单一的统一流水线中完成倾听、推理和说话,使其响应延迟明显低于前代。据 xAI 介绍,该模型的首音频平均生成时间从 1.0 版本的 1.25 秒降至 2.0 版本的仅 0.70 秒,使其成为迄今为止公开测试中最快的语音模型之一。该公司表示,这一提升源于架构上的优化,使模型能够在形成完整回复之前就开始生成语音,类似于人类在思考中途就开始说话的方式。
转录质量也有大幅提升。xAI 报告称,在涵盖 20 多种语言的数千个短语的评估中,Think Fast 2.0 的转录准确度比 Think Fast 1.0 提高了 1.4 倍,与其他广泛使用的转录系统相比提高了 1.5 到 2.0 倍。据报道,在嘈杂环境中(如繁忙的呼叫中心或户外场景),该模型的准确度提升更为显著,解决了在真实场景中部署的语音助手最常见的失败点之一。
独立基准测试结果
第三方评估机构 Artificial Analysis 公布的结果显示,Think Fast 2.0 的“高”推理变体在语音到语音指数上得分为 82.9%,位居该指数追踪的顶级模型之列。这一分数相比 Think Fast 1.0 的 75.7% 有显著提升。同一评估指出,Think Fast 2.0 是该指数前五名中唯一保持首音频平均生成时间在一秒以内的模型,凸显了 xAI 在速度与质量之间取得的平衡。该模型在另一项独立的智能体语音性能基准测试中也名列前茅,反映出其可靠执行多步骤语音指令的能力。
专为真实场景语音智能体设计
xAI 表示,该模型是专为生产级语音智能体而构建的,而非仅仅作为研究展示。它旨在嘈杂环境中保持准确度,遵循复杂的多步骤工作流,并在来回对话中听起来更加自然,包括从容应对打断。这些特性面向客户支持自动化、预约安排以及其他语音智能体必须在说话的同时进行任务推理的场景,而不是简单地照本宣科。
此次发布伴随着 xAI 的 Agent Builder 平台的持续增长,这是一个无代码工具,允许企业通过用自然语言描述所需的呼叫流程、附加知识库和外部工具,并从数十种预设语音音色中进行选择,来配置生产级语音智能体。该平台已支持超过 25 种语言以及基于短音频样本的语音克隆,xAI 表示 Agent Builder 的部署将在未来几周内过渡到较新的 Think Fast 2.0 引擎。
可用性与推出时间表
开发者可通过 xAI 的语音 API 立即使用 Grok Voice Think Fast 2.0。该公司确认,许多集成中默认使用的“grok-voice-latest”别名将于 2026 年 8 月 5 日正式从 Think Fast 1.0 切换至 Think Fast 2.0,为开发者提供了一个在成为默认设置前测试新模型的短暂窗口期。其使用按处理的音频分钟数计费,与 xAI 现有的语音定价结构保持一致,对话期间执行的网络搜索等可选工具调用将收取额外费用。
意义何在
语音界面日益被视为消费级和企业级 AI 的关键前沿领域,多家主要 AI 实验室正竞相降低延迟并提升自然度,使语音交互感觉更接近与真人交谈。通过在单次发布中同时缩小速度和准确度上的差距,xAI 正在释放一个信号:基于语音的 AI 智能体正从实验性演示转向企业可部署用于日常任务的可靠工具,从客户服务热线到教育辅导应用,使全球用户受益,他们越来越期望与 AI 系统进行快速、自然且多语言的语音交互。