首页 / 资讯 / Google 推出 Gemini 4 Argon,员工已在测试被称可媲美 Opus 5.5 的 Carbon 检查点
Gemini 4

Google 推出 Gemini 4 Argon,员工已在测试被称可媲美 Opus 5.5 的 Carbon 检查点

2026年10月10日4 分钟阅读
Google 推出 Gemini 4 Argon,员工已在测试被称可媲美 Opus 5.5 的 Carbon 检查点

新闻摘要

Google 正准备向更多用户推出其全新 Gemini 4 模型(内部代号为 Argon),与此同时,员工们已经在试用一个名为 Carbon 的更新内部检查点,部分测试者表示这是一次明显的进步,尤其是在编程方面。这些细节来自 Business Insider 基于内部文件和员工聊天记录的一篇报道,本文结合其他媒体对该报道及相关消息的二次转载进行了交叉核实。由于无法直接打开 Business Insider 的原文,下文中的部分信息来自聚合网站,应视为二手资料。

Google 已公布的内容

Google 于2026年9月30日宣布推出 Gemini 4 Argon。公开报道只给出了日期而未注明具体钟点时间,因此无法提供特定时区的时间戳。访问权限首先通过一项名为 Fairwind 的计划向部分网络安全专家开放。预计接下来将面向付费 API 客户和 Google AI Ultra 订阅用户开放,但 Google 尚未公布更大范围开放使用的日期。

Google 还表示,已有数千名内部员工在使用该模型处理专业的编程、研究和写作任务。

员工正在测试的内容

根据其他媒体转述的 Business Insider 报道,员工们一直在试用一个昵称为 Carbon 的更新版 Gemini 4。该报道梳理了内部命名脉络,其中包含一个名为 Barium-B 的模型,据称它被选中成为对外公开的 Argon 模型。Carbon 似乎是同一 Gemini 4 系列中更晚的一个检查点,而非 Argon 的替代品。

一位测试者表示,Carbon 在编程方面“感觉像 Opus 5.5”,指的是 Anthropic 的 Claude Opus 5.5,但他补充说还需要更多测试。部分报道将 Carbon 描述为通过类似递归自我改进的训练方式逼近 Opus 5.5,不过这种说法来自聚合网站,尚未得到 Google 证实。

Argon 目前的表现如何

早期的独立测试显示,Argon 在 Artificial Analysis Intelligence Index(人工智能分析智能指数)上得分为53分,与 OpenAI 的 GPT-6 Astra 持平。Claude Opus 5.5 仍以58分领跑该榜单。报道还指出,在这些早期测试中,Argon 的幻觉现象明显少于同类模型。

另据二次报道转述的 Bloomberg 消息称,部分 Google 员工对 Argon 的实际表现持怀疑态度。他们表示,该模型在行业标准基准测试中得分很高,但在某些编程任务上的表现较弱。有两人称该模型似乎受到了“刷榜”(benchmaxxing)的影响,即针对测试分数进行优化,而非着眼于日常实用性。Google 向 Bloomberg 表示,称该模型在编程等领域表现不佳是不准确的。

仍有哪些未知信息

Google 尚未确认 Carbon 是否作为一款产品存在、是否会发布,以及将以什么名称发布。目前尚不清楚 Carbon 会作为 Argon 名下的一次更新推出,还是作为 Gemini 4 家族中的一个独立模型面世。Carbon 尚未有任何独立基准测试结果公布,因此内部测试者的评价仍属于个人感受。

为什么这很重要

如今,前沿模型的发布会经历多个阶段性检查点,并伴随内部代号、有限的早期访问和快速迭代。基准测试分数与实际使用价值之间的差距,尤其是在编程领域,正成为开发者评判新模型的关键依据。在 Carbon 的独立评测出现之前,读者应将内部测试者的印象视为早期信号,而非经过验证的性能表现。

本文由 AIBARS 编辑部在 AI 辅助下整理。AI 可能出错,重要信息请以原始来源为准。发现错误?请发邮件至 [email protected]。

Gemini 4Google AI