Gemini 4 Argon 正式登場:支援 100 萬 Token 輸出、DeepSWE 達 77.9%、定價 2 美元

新聞摘要
Google 於太平洋時間 2026 年 9 月 30 日下午 1:23(美國東岸時間下午 4:23)發表 Gemini 4 Argon,稱其為迄今最強大的 AI 模型。Argon 專為長週期任務而設計,例如實際的軟體工程、法律與財務分析以及網路防禦,是該公司自 2025 年 11 月推出 Gemini 3 系列以來的首款旗艦級產品。初期僅開放給少數受信任的合作夥伴使用,後續再規劃更大範圍的推出。
Google 發表了什麼
Google 將 Gemini 4 Argon 描述為其「前沿智慧新時代」的起點。此模型針對需要多個步驟與長時間才能完成的任務,例如修復大型程式碼庫、起草詳細的法律文件,或從眾多來源研究財務問題。Google 也強調其對視覺內容的理解能力提升,包括長影片與複雜圖表。
最受矚目的工程變革在於輸出上限。Argon 單次回應最多可產生 100 萬個 token,較先前 Gemini 模型的 64,000 個大幅提升。這意味著可以產出非常長的文件、大規模的程式碼變更,或進行延伸的推理過程,而不會中途停止。
基準測試結果
根據公布的數據,在本次發表相關報導所追蹤的 18 項基準測試中,Argon 有 13 項取得最高分或並列第一。相較之下,OpenAI 的 GPT-6 Astra 有三項單獨領先,Anthropic 的 Claude Opus 5.5 則有兩項。
部分測試結果如下:
- DeepSWE v1.1(軟體工程測試):Argon 得分 77.9%,Claude Opus 5.5 為 74.2%,GPT-6 Astra 為 74.1%。
- AutomationBench:Argon 得分 51.3%,Claude Opus 5.5 為 42.5%,GPT-6 Astra 為 41.4%。
- Harvey 的法律代理基準測試:Argon 得分 19.6%,GPT-6 Astra 為 5.4%,Claude Opus 5.5 為 3.8%。
- LVBench(長影片理解測試):Argon 得分 91.7%,GPT-6 Astra 為 87.5%,Claude Opus 5.5 為 83.7%。
Argon 並非全面獲勝。GPT-6 Astra 在 FrontierSWE v2(65.5% 對 55.0%)與 Terminal-Bench Science 0.1(68.1% 對 57.6%)上仍保持領先。如同所有廠商自行公布的基準測試,獨立測試才能驗證這些數字在日常使用中的真實表現。
聚焦網路防禦
Google 表示,Argon 在訓練時即以防禦性安全為考量,能夠自主發現、驗證並修補嚴重的軟體漏洞。因此,首批使用權透過 Google 於 9 月初推出的 Fairwind Program,提供給一組受信任的網路防禦人員。其目的是讓安全團隊在此模型廣泛開放前,先強化軟體安全性。
定價
Google 設定的首發優惠價為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元。快取輸入 token 每百萬僅需 0.10 美元,比標準輸入費率便宜 95%。作為比較,據報導 GPT-6 Astra 的每百萬輸入與輸出 token 分別為 10 美元與 50 美元。
首發優惠期結束後,Argon 預計將調整為每百萬輸入 token 4 美元、每百萬輸出 token 20 美元,與報導中 Claude Opus 5.5 的基本定價相同。
可用性與後續計畫
Argon 目前尚未全面開放。Google 表示,在擴大推出之前,正進行自願性的預發布模型存取與測試流程。更廣泛的發布預計將從付費 API 客戶與 Google AI Ultra 訂閱者開始。
對開發者與學生而言,重點在於極大的輸出視窗、低廉的首發優惠價,以及模型在長週期多步驟任務上的優勢。許多人會等待正式發布與獨立評估結果,再決定是否以此模型進行開發。