AWS, 텍스트 출력 없이 JevBench 72.3%를 기록한 2B 에이전트 모델 Strands Decider 2B 오픈소스 공개

뉴스 요약
Amazon Web Services(AWS)는 2026년 10월 1일 목요일(미국 동부 시간 기준)에 단 한 글자의 텍스트도 작성할 수 없는 오픈소스 의사결정 모델 Strands Decider 2B를 발표했습니다. Strands Labs 프로그램을 통해 공개된 약 20억 매개변수 규모의 이 모델은 도구 선택, 요청 라우팅, 정책 질문 분류 등 AI 에이전트가 끊임없이 마주하는 작고 일상적인 선택을 처리하도록 설계되었으며, 더 어려운 추론 작업은 대형 언어 모델에 맡깁니다. 가중치, 학습 데이터 출처, 스크립트는 Apache 2.0 라이선스로 공개되어 있습니다.
Strands Decider 2B란 무엇인가
Strands Decider 2B는 챗봇이 아닌 전문화된 "의사결정 모델"입니다. 텍스트를 생성하는 대신 개발자가 제공한 옵션 목록에서 항목을 선택하거나, 점수를 부여하거나, 신뢰도 추정값을 반환합니다. AWS는 이를 에이전틱 AI 분야에서 빠른 실험과 로컬 개발에 최적화된 작고 빠른 모델이라고 설명합니다. 이번 출시는 Strands Agents 생태계의 실험 부문인 strands-labs에 추가되었습니다. 관련 보도에서는 이를 에이전트의 제어 루프 내부에 자리 잡아 빠르고 직관적인 판단을 내리는 "시스템 1" 구성 요소로 묘사합니다.
Strands Agents SDK 자체는 이번 발표로부터 약 16개월 전에 출시되었으며, 이후 2026년 9월에 공개된 하네스를 포함해 에이전트에 필요한 대부분의 기능을 포괄하도록 성장했습니다. Decider 2B는 그 스택에 작고 로컬에서 동작하는 조각을 하나 더합니다.
작동 방식
Tech Times와 The Letter Two의 보도에 따르면, AWS는 Alibaba의 오픈소스 Qwen3.5-2B 기본 모델(약 19억 매개변수)에서 출발했습니다. 팀은 전체 네트워크를 다시 학습시키는 대신 작은 부가 레이어만 훈련하는 경량 기법인 LoRA로 모델을 미세 조정했습니다. 그런 다음 일반적으로 모델이 텍스트를 생성하게 해주는 언어 모델링 헤드를 제거하고, 약 100만 매개변수 규모의 "포인터 헤드"로 교체했습니다.
포인터 헤드는 입력에 대한 모델의 내부 표현을 각 후보 옵션과 내적을 사용해 비교한 뒤, 마스킹된 소프트맥스를 적용해 확률 분포를 생성합니다. 이러한 설계 덕분에 출력은 전적으로 제공된 옵션으로 제한됩니다. 모델은 예/아니오, N개 후보 중 선택, 정렬된 평가 기준표 상의 점수 배치라는 세 가지 질문 유형을 지원합니다. LoRA는 랭크 16으로 적용되었고, 포인터 헤드는 fp32 정밀도로 실행됩니다.
벤치마크 및 지연 시간
공개 JevBench v1 평가에서 Decider 2B는 231개 과제 중 167개를 정확히 답변하여 0.723의 정확도를 기록했습니다. 보고된 보정 수치로는 Brier 점수 0.342와 기대 보정 오차 0.052가 포함됩니다. 성능은 난이도에 따라 달랐는데, 쉬운 과제에서는 거의 완벽했고, 표준 과제에서는 약 87.5%, 어려운 과제에서는 약 50.5%를 기록했습니다.
순위 집계에 대해서는 매체마다 약간 차이가 있습니다. Tech Times는 2B급 33개 모델 중 3위, 더 큰 모델을 제외하면 30개 모델 중 1위를 차지했다고 보도했습니다. The Letter Two는 비슷한 크기의 공개 모델 중 2위이며, 전체 학습 레시피를 공개한 모델 중에서는 1위라고 설명합니다. 독자는 정확한 순위가 리더보드의 필터링 방식에 따라 달라진다는 점을 고려해야 합니다.
속도 측면에서 AWS는 의사결정이 수십 밀리초 안에 이루어지며, 널리 사용되는 하드웨어에서는 100밀리초 미만이라고 밝혔습니다. Tech Times의 독립적인 수치는 더 보수적입니다. Nvidia RTX 3090에서 중앙값 115ms(95백분위수 299ms), Apple M3 Pro에서 300토큰 미만의 입력에 대해 워밍업 후 중앙값 153ms를 기록했습니다. 동일한 입력에 대해 두 개의 질문을 수행하면 약 230ms가 소요됩니다. 이러한 커뮤니티 측정 수치는 AWS가 검증한 것은 아닙니다.
학습 및 재현성
이번 공개의 가장 두드러진 특징은 개방성입니다. AWS는 학습 데이터 출처와 라이선스, 학습 스크립트, 평가 도구를 모두 공개했습니다. Tech Times의 보도에 따르면 학습은 24GB 메모리를 갖춘 단일 RTX 3090에서 약 11시간, 또는 8개의 H100 GPU에서 약 1시간 10분이 소요됩니다. 또한 프로젝트는 각 학습 실행 전에 예측 결과와 실패 조건을 문서화하는데, 이는 모델 공개에서는 흔치 않은 사전 등록 방식의 관행입니다.
사용 가능성 및 활용 사례
모델은 Hugging Face(StrandsAgents/strands-decider-2B-hobson-v19)에서 이용할 수 있으며, 코드는 GitHub의 strands-labs/strands-decider 저장소에 있습니다. pip install strands-decider 명령으로 설치할 수 있고, 명령줄 도구와 로컬 HTTP 서버가 포함되어 있습니다. 서버는 기본적으로 인증 없이 localhost에서 수신 대기하므로, 팀은 외부에 노출하기 전에 자체 접근 제어를 추가해야 합니다. CPU, 소비자용 GPU, Apple 실리콘에서 실행할 수 있으며 API 의존 없이 오프라인에서도 작동합니다.
제안되는 활용 사례로는 모델 라우팅, 도구 선택, 메모리 및 컨텍스트 관리, 정책 분류, 가드레일, 평가, 출력 검증 등이 있습니다. 하이브리드 설계에서는 대형 모델이 복잡한 추론을 담당하고, Decider 2B가 대량의 일상적 의사결정을 저렴하게 로컬에서 처리합니다.
경쟁 환경
이번 출시는 소규모 의사결정 모델 프로젝트 물결 속에서 등장했습니다. TypeSafe AI의 Jev 모델과 LocalJev, OpenJev가 공개 jevbench.dev 리더보드에 올라 있으며, Cloudflare도 같은 주에 Clef 및 Clef-flash 모델을 출시했습니다. 일부 평론가는 AWS의 행보를 상업용 제품을 위협하는 움직임으로 해석했지만, AWS 자체는 이 프로젝트를 전문화된 모델이 에이전트의 일상 작업을 처리할 수 있는지에 대한 실험으로 위치 짓고 있습니다.
학습자에게 중요한 이유
학생과 개발자에게 이 프로젝트는 더 넓은 공학적 개념을 보여주는 명확한 사례입니다. 즉, AI 시스템의 모든 단계에 대형 생성형 모델이 필요한 것은 아니라는 점입니다. 모델의 출력을 고정된 옵션 집합으로 제한하면 속도가 빨라지고 테스트와 추론이 쉬워집니다. 코드, 데이터 출처, 스크립트가 모두 공개되어 있으므로 LoRA 미세 조정과 보정 측정에 관한 실용적이고 재현 가능한 사례 연구이기도 합니다.
주의 사항
어려운 과제에서의 정확도가 약 50%라는 점은 이 모델이 심층적인 추론을 대체할 수 없음을 보여줍니다. 지연 시간 주장은 하드웨어와 출처에 따라 다르며, 일부 벤치마크 수치는 AWS가 아닌 커뮤니티 테스트에서 나온 것입니다. 검토한 출처에는 발표의 정확한 타임스탬프가 명시되지 않았으므로, 위의 날짜는 보도된 미국 동부 시간을 따릅니다.