/ 뉴스 / DeepSeek의 저예산 Flash 모델, 코딩 작업에서 자체 플래그십 모델을 능가하다
DeepSeek

DeepSeek의 저예산 Flash 모델, 코딩 작업에서 자체 플래그십 모델을 능가하다

2026년 8월 1일5 분 소요
DeepSeek의 저예산 Flash 모델, 코딩 작업에서 자체 플래그십 모델을 능가하다

뉴스 요약

DeepSeek는 효율성에 중점을 둔 Mixture-of-Experts 모델을 재학습한 DeepSeek-V4-Flash-0731을 공식 출시했다. 이 모델은 2026년 7월 31일(동부 표준시)에 확인된 바와 같이, 공개된 9개의 에이전트 및 코딩 벤치마크에서 자사의 플래그십 모델인 V4-Pro-Preview를 능가한다. 이번 출시는 기존 V4-Flash Preview와 동일한 기본 아키텍처와 매개변수 수를 유지하며, 보고된 모든 성능 향상은 모델의 재설계가 아닌 업데이트된 사후 학습 과정에서 비롯되었다.

이번 빌드에서 변경된 사항

DeepSeek-V4-Flash-0731은 토큰당 약 130억 개의 매개변수를 활성화하는 2,840억 개 매개변수 규모의 Mixture-of-Experts 모델로, 100만 토큰의 컨텍스트 창과 함께 제공된다. 출시와 함께 공개된 모델 카드에 따르면, 이러한 개선은 전적으로 사후 재학습에서 비롯된 것이다. 즉, 엔지니어들이 모델의 기본 구조나 크기를 변경하지 않고, 다단계 작업에 대한 피드백을 모델이 학습하는 방식을 개선했다는 의미이다. 이러한 접근 방식은 단순히 매개변수 수를 확장하는 대신 더 스마트한 학습 기법을 통해 기존 모델 아키텍처에서 더 많은 기능을 이끌어내려는 업계의 광범위한 트렌드를 반영한다.

벤치마크 하이라이트

가장 주목할 만한 결과는 에이전트 및 소프트웨어 엔지니어링 평가에서 나타났다. 모델이 명령줄 환경을 얼마나 잘 조작할 수 있는지 측정하는 벤치마크인 Terminal-Bench 2.1에서 V4-Flash-0731은 82.7점을 기록했으며, 이는 V4-Pro-Preview의 72.1점을 앞서는 것이며 기존 Flash Preview 빌드의 61.8점에서 상당한 도약이다. DeepSWE 코딩 벤치마크에서 새 빌드는 54.4점에 도달했는데, 이는 이전 버전의 7.3점에서 상승한 것으로, 연구자들은 이를 동일한 모델 크기로 달성한 645% 향상이라고 설명하며, 잘 설계된 학습 파이프라인이 얼마나 많은 여력을 발휘할 수 있는지를 보여준다.

학습 방식

이번 출시를 담당한 엔지니어들은 코딩 및 에이전트 성능 향상이 검증 가능한 보상을 활용한 강화 학습에 기반한다고 밝혔다. 실제로 모델은 샌드박스 환경 내에서 다단계 코딩 작업을 시도하고, 생성된 코드는 테스트 스위트를 통해 실행되며, 그 결과는 통과 또는 실패로 채점된다. 그런 다음 이 이진 진실 신호를 사용하여 성공적인 결과로 이어진 일련의 행동을 강화하여, 점진적으로 모델을 보다 신뢰할 수 있는 다단계 문제 해결 방향으로 유도한다. 이러한 학습 방식은 단일 턴 텍스트 생성이 아닌 자율적이고 다단계적인 소프트웨어 작업을 수행할 수 있는 AI 시스템을 구축하는 데 있어 점점 더 보편화되고 있다.

API 및 개발자 액세스

모델 업데이트와 함께 DeepSeek는 대화형 및 도구 사용 애플리케이션을 구축하는 개발자들 사이에서 인기를 끌고 있는 구조인 Responses API 형식에 대한 네이티브 지원을 출시했으며, Codex 스타일의 코딩 도우미와의 호환성을 확인했다. 인프라 측면에서 회사는 V4-Flash 엔드포인트가 약 2,500개의 동시 요청을 처리할 수 있다고 밝혔는데, 이는 더 높은 용량의 V4-Pro 등급의 약 500개와 비교되는 수치로, 고객 지향 코딩 도우미 및 자동화된 데이터 파이프라인과 같은 고처리량 애플리케이션에 Flash를 더 매력적인 옵션으로 만든다. API 액세스에 대한 가격은 여전히 저예산 등급에 머물러 있으며, 백만 입력 토큰당 약 $0.14, 백만 출력 토큰당 약 $0.28로 공개적으로 책정되어 있다. 분석가들은 이러한 가격 책정이 대규모 또는 지연에 민감한 워크로드를 실행하는 개발자들에게 이 모델을 계속 매력적으로 만든다고 지적한다.

글로벌 AI 커뮤니티에 중요한 이유

이번 출시는 학습 방법론이 우선시될 때 더 작고 효율적인 모델이 실용적이고 작업 지향적인 벤치마크에서 더 큰 플래그십 시스템과 일치하거나 능가할 수 있다는 증거가 늘어나는 추세에 한몫을 한다. 전 세계의 학생, 연구자 및 독립 개발자들에게 이러한 트렌드는 중요하다. 이는 코드를 자율적으로 작성, 테스트 및 반복할 수 있는 에이전트 AI 시스템을 실험하는 데 필요한 컴퓨팅 및 재정적 장벽을 낮추기 때문이다. 교육자 및 기술 평론가들은 검증 가능한 보상을 활용한 강화 학습이 단순히 문장에서 다음 단어를 예측하는 대신 실제 다단계 작업을 위해 대형 언어 모델이 학습되는 방식을 어떻게 재편하고 있는지 보여주는 유용한 사례 연구로 이와 같은 출시를 지적해 왔다.

향후 전망

업계 관찰자들은 DeepSeek가 향후 플래그십 출시에 유사한 기법을 잠재적으로 적용하면서, 자사의 모델 제품군 전반에 걸쳐 이러한 사후 재학습 접근 방식을 계속해서 반복할 것으로 예상한다. 회사는 다음 주요 아키텍처 업데이트에 대한 구체적인 일정을 발표하지 않았지만, V4-Flash-0731 출시는 2026년 남은 기간 동안 점진적인 학습 개선이 여전히 자사 개발 전략의 핵심 부분으로 자리매김할 것임을 시사한다.

DeepSeekAI 모델