/ 뉴스 / OpenAI의 Jalapeño 칩, 첫 벤치마크에서 AI 지연 시간 최대 3.6배 단축
OpenAI

OpenAI의 Jalapeño 칩, 첫 벤치마크에서 AI 지연 시간 최대 3.6배 단축

2026년 8월 26일5 분 소요
OpenAI의 Jalapeño 칩, 첫 벤치마크에서 AI 지연 시간 최대 3.6배 단축

뉴스 요약

OpenAI가 Broadcom과 공동 개발한 맞춤형 AI 추론 칩인 Jalapeño의 첫 독립 벤치마크 결과를 공개했다. 이 칩은 실제 언어 모델 작업을 동급 상용 GPU 구성보다 더 빠르고 적은 전력으로 완료하는 것으로 나타났다. 2026년 8월 25일 오후 3시(미국 동부 시간)에 발표된 이 수치는 OpenAI가 이 칩에 대해 앞서 밝힌 성능 주장을 내부 예상치가 아닌 제3자 테스트 데이터로 뒷받침한 첫 사례다.

벤치마크가 측정한 내용

OpenAI는 Jalapeño를 SemiAnalysis InferenceX 벤치마크 스위트로 테스트했다. 이는 합성 최대 처리량 수치가 아닌 실제 추론 작업 부하에서 AI 가속기를 비교하는 데 널리 쓰이는 독립 테스트 프레임워크다. 테스트는 서로 다른 규모와 사용 사례를 대표하도록 선정된 세 가지 오픈 웨이트 언어 모델(GPT-OSS 120B, DeepSeek R1 670B, Kimi K2.5 1T)을 대상으로 진행됐다.

이 스위트는 단일 지표만 따로 측정하는 대신 모델이 들어오는 프롬프트를 처리하는 사전 채우기 단계와 응답을 생성하는 토큰 생성 단계를 포함한 전체 추론 파이프라인에서 칩의 성능을 측정한다. OpenAI는 이러한 이중 초점이 실제로 칩을 설계한 방식을 반영한다고 밝혔다. 즉 단일 리더보드 지표에서 높은 수치를 기록하는 것이 아니라 실제 배포 환경에서 병목이 되기 쉬운 데이터 이동 및 통신 지연을 줄이는 데 중점을 두고 설계했다는 것이다.

주요 성능 수치

공개된 결과에 따르면 Jalapeño의 엔드투엔드 응답 지연 시간은 동일한 모델을 실행하는 표준 상용 GPU 배포보다 1.7배에서 3.6배 더 빨랐다. 전력 효율 측면에서는 최대 용량에서 전력 1와트당 총 작업량을 1.5배에서 1.9배 더 많이 완료했다. 여러 빠른 단계를 순차적으로 실행해야 하는 AI 에이전트와 같은 상호작용형 저지연 작업 부하에서는 동급 구성 대비 2.1배에서 4.1배의 성능 향상을 기록했다고 OpenAI는 밝혔다.

보다 구체적인 직접 비교에서 OpenAI와 Broadcom은 정격 열 설계 전력 700와트로 작동하는 Jalapeño가 대략 그 두 배의 전력을 소비하도록 설계된 Nvidia의 주력 GPU GB300을 앞질렀다고 밝혔다. 이 비교에서 Jalapeño는 소비 전력 1킬로와트당 최대 1.9배 더 많은 처리량을 제공했고 지연 시간은 최대 3.6배 더 낮았다. 특히 OpenAI는 테스트 중 이 칩의 실제 전력 소비가 정격 상한보다 낮은 550와트 미만으로 유지됐다고 밝혔다.

OpenAI가 자체 칩을 만든 이유

Jalapeño는 OpenAI의 첫 맞춤형 실리콘이며, 처음부터 용도가 변경된 학습용 칩이나 범용 프로세서가 아닌 추론 전용 가속기로 설계됐다. OpenAI와 Broadcom은 2026년 6월 24일(미국 동부 시간)에 이 칩을 처음 공개하면서 초기 설계에서 제조 테이프아웃까지 약 9개월이 걸렸다고 밝혔는데, 이는 이 정도 복잡성을 가진 칩으로서는 가장 빠른 개발 주기 중 하나라고 두 회사는 설명했다. 당시 Broadcom 경영진은 추론에 사용되는 일반적인 범용 GPU와 비교해 운영 비용이 크게 낮다는 점도 강조했다.

이 프로젝트의 배경은 단순하다. AI 기업들이 수백만 사용자에게 실시간으로 응답하는 챗봇 및 에이전트 제품을 확장하면서, 이미 학습된 모델을 실행해 질의에 답변하는 추론 비용과 에너지 소비가 모델을 한 번 학습시키는 비용보다 전체 지출에서 더 큰 비중을 차지하게 됐다. 학습도 처리해야 하는 범용 가속기보다 추론 작업 부하에 특화된 칩이 원리적으로 해당 작업에서 더 효율적일 수 있다.

다음 단계

OpenAI는 Jalapeño가 아직 초기 테스트 단계에 있으며 2027년에는 자사 인프라 전반에 더 광범위하게 배포할 계획이라고 밝혔다. 이 칩에서 가장 먼저 실행될 구체적인 제품이나 서비스는 아직 공개하지 않았고, 제조 물량도 밝히지 않았다. 현재로서는 새로 공개된 벤치마크 데이터는 주로 이 칩의 실제 성능이 OpenAI 자체 마케팅 자료에만 기술된 것이 아니라 독립적으로 테스트된 결과이며, 프로젝트가 처음 발표됐을 때 회사가 설정한 효율성 및 지연 시간 목표와 일치한다는 점을 검증하는 역할을 한다.

AI 업계에 대한 더 넓은 의미는 OpenAI가 Google, Amazon과 같은 주요 AI 개발사들과 함께 상용 칩 제조사의 기성 GPU에만 의존하지 않고 자체 추론 실리콘을 설계하는 소수 그룹에 합류했다는 점이다. 이 분야를 추적하는 분석가들은 Jalapeño의 효율성 향상이 대규모로 유지된다면 수백만 동시 사용자를 위한 대형 언어 모델 실행 비용을 의미 있게 낮출 수 있으며, 이 비용은 AI 비서와 에이전트를 얼마나 광범위하게 배포할 수 있는지를 좌우하는 핵심 제약 중 하나가 되어 왔다고 지적했다.

OpenAIAI 칩