홈 / 뉴스 / 구글, Gemini 4 Argon 출시… 직원들은 Opus 5.5에 필적한다는 Carbon 테스트 중
Gemini 4

구글, Gemini 4 Argon 출시… 직원들은 Opus 5.5에 필적한다는 Carbon 테스트 중

2026년 10월 10일4 분 소요
구글, Gemini 4 Argon 출시… 직원들은 Opus 5.5에 필적한다는 Carbon 테스트 중

뉴스 요약

구글은 내부 코드명 Argon으로 불리는 새로운 Gemini 4 모델을 더 많은 사용자에게 공개할 준비를 하고 있으며, 직원들은 이미 Carbon이라는 더 최신 내부 체크포인트를 시험해 보고 있다. 일부 테스터들은 특히 코딩 분야에서 이 모델이 확실한 진전을 보였다고 평가한다. 이러한 세부 정보는 사내 문서와 직원 대화 내용을 바탕으로 한 Business Insider 보도에서 나온 것으로, 본 기사에서는 해당 보도 및 관련 기사를 다루는 2차 보도 자료와 교차 검증했다. Business Insider 원문 기사는 직접 열람할 수 없어 아래 일부 내용은 애그리게이터에서 발췌한 것이며 간접 정보로 이해해야 한다.

구글이 발표한 내용

구글은 2026년 9월 30일에 Gemini 4 Argon을 발표했다. 공개된 보도에는 날짜만 나와 있고 정확한 시각은 명시되지 않아 특정 시간대 기준의 타임스탬프는 확인할 수 없다. Fairwind라는 프로그램을 통해 선별된 사이버 보안 전문가들에게 먼저 접근 권한이 제공되었다. 유료 API 고객과 Google AI Ultra 구독자가 그 다음 순서가 될 것으로 예상되지만, 구글은 더 넓은 범위의 공개 일정을 발표하지 않았다.

또한 구글은 자사 직원 수천 명이 이미 특수한 코딩, 연구, 작성 작업을 위해 사내에서 이 모델을 사용하고 있다고 밝혔다.

직원들이 테스트 중인 내용

다른 매체들이 전한 Business Insider 보도에 따르면, 직원들은 Carbon이라는 별칭의 더 최신 Gemini 4 버전을 시험해 왔다. 이 보도는 Barium-B라는 모델을 포함하는 내부 명명 체계를 설명했는데, 이 모델이 대외적으로 Argon으로 알려진 모델로 선정된 것으로 전해졌다. Carbon은 Argon을 대체하는 모델이라기보다는 동일한 Gemini 4 시리즈의 후속 체크포인트로 보인다.

한 테스터는 코딩 분야에서 Carbon이 "Opus 5.5 같은 느낌"이라고 말했는데, 이는 Anthropic의 Claude Opus 5.5를 가리키며, 추가 테스트가 필요하다고 덧붙였다. 일부 보도는 Carbon이 재귀적 자기 개선 방식의 훈련을 통해 Opus 5.5 수준에 근접했다고 묘사하지만, 이러한 해석은 애그리게이터에서 나온 것이며 구글이 확인한 바 없다.

지금까지 Argon의 성능

초기 독립 테스트에서 Argon은 Artificial Analysis Intelligence Index 기준 53점을 기록하며 OpenAI의 GPT-6 Astra와 동률을 이루었다. Claude Opus 5.5는 여전히 58점으로 해당 지수에서 선두를 달렸다. 또한 초기 테스트에서 Argon이 유사한 모델들에 비해 환각 현상이 눈에 띄게 적다는 보고도 나왔다.

2차 보도를 통해 전해진 별도의 Bloomberg 보도에 따르면, 일부 구글 직원들은 Argon의 실제 환경 성능에 의문을 품고 있다. 이들은 업계 표준 벤치마크에서는 높은 점수를 받았지만 특정 코딩 작업에서는 결과가 다소 떨어졌다고 설명했다. 두 명의 관계자는 이 모델이 '벤치맥싱(benchmaxxing)', 즉 일상적인 유용성보다 테스트 점수 최적화에 치우친 영향을 받은 것으로 보인다고 말했다. 구글은 Bloomberg 측에 코딩 등의 영역에서 모델 성능이 떨어진다고 말하는 것은 정확하지 않다고 답변했다.

아직 밝혀지지 않은 내용

구글은 Carbon이 제품으로서 존재하는지, 출시될 것인지, 어떤 이름으로 나올 것인지 확인하지 않았다. Carbon이 Argon이라는 이름의 업데이트로 제공될지, 아니면 별개의 Gemini 4 패밀리 모델로 등장할지도 불분명하다. Carbon에 대한 독립적인 벤치마크는 발표되지 않았으므로, 내부 테스터들의 의견은 아직 검증되지 않은 주관적 평가로 남아 있다.

주목해야 할 이유

최첨단 모델 출시는 이제 내부 코드명, 제한적인 조기 액세스, 빠른 반복 주기를 거치는 단계적 체크포인트 방식으로 진행된다. 특히 코딩 분야에서 벤치마크 점수와 실제 체감 유용성 사이의 격차는 개발자들이 새 모델을 평가하는 핵심 기준이 되고 있다. 독자들은 Carbon에 대한 독립적인 평가가 나오기 전까지 내부 테스터들의 인상을 검증된 성능이 아닌 초기 신호로 받아들여야 한다.

이 기사는 AIBARS 편집팀이 AI의 도움을 받아 정리했습니다. AI는 실수할 수 있으니 중요한 내용은 원문 출처를 확인해 주세요. 오류를 발견하셨나요? [email protected]으로 알려 주세요.

Gemini 4구글 AI