ホーム / ニュース / GoogleがGemini 4 Argonを公開、社内ではOpus 5.5に匹敵するとされるチェックポイントCarbonのテストも
Gemini 4

GoogleがGemini 4 Argonを公開、社内ではOpus 5.5に匹敵するとされるチェックポイントCarbonのテストも

2026年10月10日4 分で読了
GoogleがGemini 4 Argonを公開、社内ではOpus 5.5に匹敵するとされるチェックポイントCarbonのテストも

ニュース概要

Googleは、社内でArgonというコードネームで呼ばれる新しいGemini 4モデルをより多くのユーザーに提供する準備を進めている。同時に、従業員はすでにCarbonと呼ばれるより新しい内部チェックポイントを試用しており、一部のテスターは特にコーディングにおいて明らかに性能が向上していると述べている。これらの詳細は、内部文書や従業員のチャットに基づいたBusiness Insiderの報道によるものであり、本稿ではその報道および関連報道に対する二次的な検証記事と照合している。Business Insiderの元記事は直接開けなかったため、以下の一部の詳細はアグリゲーター(情報集約サイト)から得たものであり、伝聞として読む必要がある。

Googleが発表した内容

Googleは2026年9月30日にGemini 4 Argonを発表した。公開されている報道では日付のみが示されており時刻は記載されていないため、特定のタイムゾーンに基づく正確な発表時刻は不明である。アクセスはFairwindと呼ばれるプログラムを通じて、選ばれたサイバーセキュリティ専門家から開始された。有料API顧客およびGoogle AI Ultraの加入者が次に利用できるようになると予想されているが、Googleは一般公開の日程を発表していない。

またGoogleは、数千名の自社従業員がすでにこのモデルを社内で使用し、専門的なコーディング、研究、文章作成のタスクに活用していると述べている。

従業員がテストしている内容

他のメディアが伝えたBusiness Insiderの報道によると、従業員はCarbonという愛称で呼ばれるより新しいGemini 4バージョンを試用しているという。同報道は、Barium-Bと呼ばれるモデルを含む社内の命名の流れを紹介しており、Barium-Bが一般にArgonとして知られるモデルに採用されたと伝えられている。CarbonはArgonの代替ではなく、同じGemini 4シリーズにおけるより後発のチェックポイントであるとみられる。

あるテスターは、コーディングにおいてCarbonが「Opus 5.5のように感じる」と述べた。これはAnthropicのClaude Opus 5.5を指しているが、さらなるテストが必要だと付け加えた。一部の報道では、Carbonが再帰的自己改善型のトレーニングを通じてOpus 5.5に迫っていると位置づけているが、こうした見方はアグリゲーター発信のものであり、Googleによって確認されたものではない。

これまでのArgonの性能

初期の独立したテストでは、ArgonはArtificial Analysis Intelligence Indexで53を記録し、OpenAIのGPT-6 Astraと同水準となった。同指数では依然としてClaude Opus 5.5が58で首位を保っている。また、これらの初期テストにおいて、Argonは同等のモデルと比較してハルシネーション(幻覚)が著しく少ないとも報告されている。

二次報道が伝えたBloombergの別の記事によると、一部のGoogle従業員はArgonの実世界での性能に疑問を抱いているという。彼らは、業界標準ベンチマークでは高いスコアを記録する一方で、特定のコーディングタスクでは結果が劣ると説明した。2名は、このモデルが「ベンチマックス(benchmaxxing)」の影響を受けているように見えると述べた。これは、日常的な実用性よりもテストのスコアを最適化することを意味する。GoogleはBloombergに対し、コーディングなどの分野でこのモデルの性能が劣っていると言うのは不正確であると回答した。

まだ分かっていないこと

Googleは、Carbonが製品として存在するのか、出荷されるのか、あるいはどのような名称になるのかを確認していない。CarbonがArgonという名称のアップデートとして登場するのか、それともGemini 4ファミリーの別モデルとして登場するのかも不明である。Carbonに関する独立したベンチマークは公開されておらず、内部テスターのコメントはあくまで個人的な印象にとどまる。

なぜ重要なのか

最先端モデルのリリースは現在、段階的なチェックポイントを経て進められており、社内のコードネーム、限定的な早期アクセス、そして迅速な反復改良が行われている。ベンチマークスコアと実際の使い勝手、特にコーディングにおける差が、開発者が新モデルを評価する際の重要な基準になりつつある。読者は、Carbonの独立した評価が公表されるまでは、内部テスターの感想を検証済みの性能ではなく、初期の兆候として受け止めるべきである。

この記事は AIBARS 編集部が AI の支援を受けてまとめました。AI は誤ることがあるため、重要な内容は元の情報源でご確認ください。誤りを見つけたら [email protected] までご連絡ください。

Gemini 4Google AI