首页 / 资讯 / Gemini 4 Argon 发布:支持 100 万 token 输出,DeepSWE 得分 77.9%,定价 2 美元
Gemini

Gemini 4 Argon 发布:支持 100 万 token 输出,DeepSWE 得分 77.9%,定价 2 美元

2026年10月1日4 分钟阅读
Gemini 4 Argon 发布:支持 100 万 token 输出,DeepSWE 得分 77.9%,定价 2 美元

新闻摘要

Google 于太平洋时间 2026 年 9 月 30 日下午 1:23(美国东部时间下午 4:23)发布了 Gemini 4 Argon,称其为公司迄今最强大的 AI 模型。Argon 专为长周期任务打造,例如真实世界的软件工程、法律与金融分析以及网络防御,是继 2025 年 11 月 Gemini 3 系列推出以来的首个旗舰版本。初期访问权限仅限于少数受信任的合作伙伴,后续将逐步扩大开放范围。

Google 发布了什么

Google 将 Gemini 4 Argon 描述为其“前沿智能新时代”的开端。该模型面向需要多步骤、长时间推进的任务,例如修复大型代码库、起草详尽的法律文件,或从多个来源研究金融问题。Google 还强调,模型对视觉内容的理解能力有所提升,包括长视频和复杂图表。

最引人注目的工程改进在于输出上限。Argon 单次响应最多可生成 100 万 token,而此前的 Gemini 模型仅为 64,000 token。这意味着它可以一次性生成超长文档、大规模代码变更或长推理过程,而无需中途停止。

基准测试结果

根据公布的数据,在本次发布报道所追踪的 18 项基准测试中,Argon 有 13 项取得最高分或并列第一。相比之下,OpenAI 的 GPT-6 Astra 有 3 项独占榜首,Anthropic 的 Claude Opus 5.5 有 2 项。

部分成绩如下:

  • DeepSWE v1.1(软件工程测试):Argon 得分 77.9%,Claude Opus 5.5 为 74.2%,GPT-6 Astra 为 74.1%。
  • AutomationBench:Argon 得分 51.3%,Claude Opus 5.5 为 42.5%,GPT-6 Astra 为 41.4%。
  • Harvey 法律智能体基准测试:Argon 得分 19.6%,GPT-6 Astra 为 5.4%,Claude Opus 5.5 为 3.8%。
  • LVBench(长视频理解测试):Argon 得分 91.7%,GPT-6 Astra 为 87.5%,Claude Opus 5.5 为 83.7%。

Argon 并非在所有项目上都胜出。GPT-6 Astra 在 FrontierSWE v2(65.5% 对 55.0%)和 Terminal-Bench Science 0.1(68.1% 对 57.6%)上保持领先。与所有厂商自行公布的基准测试一样,这些数字在日常使用中的表现仍有待独立测试验证。

聚焦网络防御

Google 表示,Argon 在训练时充分考虑了防御性安全需求,能够自主发现、验证并修补严重的软件漏洞。因此,首批访问权通过 9 月初推出的 Fairwind 计划提供给一组受信任的网络防御人员。此举旨在让安全团队在该模型面向大众之前先行加固软件。

定价

Google 设定的首发优惠价为每百万输入 token 2 美元、每百万输出 token 10 美元。缓存输入 token 的价格为每百万 0.10 美元,比标准输入价格便宜 95%。作为对比,据报道 GPT-6 Astra 的输入和输出价格分别为每百万 token 10 美元和 50 美元。

首发优惠期结束后,Argon 预计将调整为每百万输入 token 4 美元、每百万输出 token 20 美元,与报道中 Claude Opus 5.5 的基础定价一致。

可用性与后续计划

Argon 目前尚未全面开放。Google 表示,在扩大推广范围之前,正在开展自愿参与的预发布模型访问与测试流程。更大范围的发布预计将首先面向付费 API 客户和 Google AI Ultra 订阅用户。

对于开发者和学生而言,关键亮点在于超大的输出窗口、较低的首发优惠价,以及模型在长周期、多步骤任务上的优势。许多人可能会等待正式全面上线和独立评测结果,再决定是否基于它进行开发。

GeminiGoogle