首页 / 资讯 / OpenAI GPT-5.6 Sol 推出全新 Ultrafast 模式,运行速度提升14倍
OpenAI

OpenAI GPT-5.6 Sol 推出全新 Ultrafast 模式,运行速度提升14倍

2026年8月14日4 分钟阅读
OpenAI GPT-5.6 Sol 推出全新 Ultrafast 模式,运行速度提升14倍

新闻摘要

太平洋时间2026年8月13日,OpenAI 发布了 Ultrafast 模式的预览版,这是其 GPT-5.6 Sol 模型的全新推理层级,运行速度比该模型的标准处理模式快达14倍,输出速度最高可达每秒750个 token。这一新层级由 Cerebras Systems 的硬件提供支持,目前正通过 OpenAI API 率先向有限数量的客户推出,预计随着算力容量的提升将逐步扩大访问范围。

Ultrafast 模式带来的变革

过去,需要大语言模型提供近乎即时响应的开发者不得不降级使用更小或更专用的模型,以牺牲推理质量为代价换取速度。OpenAI 表示,Ultrafast 模式打破了这种权衡:在 Ultrafast 模式下运行的 GPT-5.6 Sol 保留了与 GPT-5.6 Sol 标准版相同的底层智能,同时生成速度大幅提升。OpenAI 将此定义为向"每秒完成更多有效工作"的转变,而不仅仅是聊天机器人体验的提速。

速度背后的硬件支撑

性能的提升源于 Cerebras 的晶圆级引擎架构。与传统的基于 GPU 的推理不同(后者必须在片上存储和片外存储之间不断搬运模型权重),Cerebras 的晶圆级芯片将完整的权重集保留在芯片上,每片晶圆配备约44 GB SRAM。Cerebras 在当天发布的博文中指出,这种设计消除了内存带宽瓶颈,而该瓶颈通常会限制前沿规模模型在标准 GPU 集群上的文本生成速度。Cerebras 还通过 GlobeNewswire 发布了一份独立的新闻稿确认了此次合作,并称 Ultrafast 模式证明了前沿级智能与实时速度不再互斥。

预览可用性与推广计划

Ultrafast 模式目前仅处于有限预览阶段。OpenAI 尚未披露首批客户群体的具体规模,仅表示随着基础设施容量的增长,访问权限将逐步扩大。此次推广从 OpenAI API 开始,而非面向消费者的 ChatGPT 界面,这表明初期的重点是对延迟敏感的应用开发者,而非日常聊天用户。

定价

截至发稿时,OpenAI 尚未公布 Ultrafast 模式请求的单独定价。通过 API 调用标准版 GPT-5.6 Sol 的价格仍为每百万输入 token 5美元,每百万输出 token 30美元;OpenAI 尚未说明 Ultrafast 模式是否会在这些费率基础上收取溢价。

潜在应用场景

OpenAI 指出了几类亚秒级、高吞吐量生成至关重要的工作负载:需要实时总结信息并采取行动的事件响应系统、处理实时对话的客户服务与支持工具、依赖快速周转的金融市场分析,以及实时产品推荐或结账辅助等电子商务应用。在上述每种场景中,其核心卖点都是更快的生成速度能让更复杂的多步骤 AI 工作流在实时应用所需的延迟预算内运行。

行业背景

此次发布延续了行业内将前沿语言模型与专用推理硬件配对以降低延迟的大趋势,此前 AI 实验室与 Cerebras、Groq 等芯片制造商也有过类似的以速度为核心的合作。包括 TechCrunch 和 9to5Mac 在内的媒体在报道中指出,在模型智能水平相当的情况下实现14倍的速度提升,是2026年以来主要 AI 实验室公布的最显著的吞吐量飞跃之一。

OpenAIGPT-5.6