/ 뉴스 / Google의 DiffusionGemma, 노이즈에서 텍스트 생성 및 자체 수정 기능 탑재
Google AI

Google의 DiffusionGemma, 노이즈에서 텍스트 생성 및 자체 수정 기능 탑재

Jun 12, 20261 분 소요
Google의 DiffusionGemma, 노이즈에서 텍스트 생성 및 자체 수정 기능 탑재

뉴스 요약

Google은 2026년 6월 10일(태평양 표준시)에 실험적인 오픈 웨이트 언어 모델인 DiffusionGemma를 출시했습니다. 이 모델은 전통적인 단어별 생성 방식을 버리고 이미지 합성에서 차용한 텍스트 확산 기법을 사용하여 최대 4배 빠른 출력 속도를 제공하며, 표준 자동 회귀 모델에서는 사용할 수 없는 내장된 자체 수정 기능을 지원합니다.

텍스트 확산이란 무엇이며 왜 중요한가

전통적인 대규모 언어 모델은 텍스트를 자동 회귀적으로 생성합니다. 즉, 왼쪽에서 오른쪽으로 한 번에 하나의 토큰씩 생성하며, 각 단어는 이전의 모든 단어에 의존합니다. DiffusionGemma는 근본적으로 다른 경로를 택합니다. 이미지 생성의 확산 모델에서 영감을 받아 무작위 노이즈 블록으로 시작하여 여러 노이즈 제거 단계를 거쳐 점진적으로 일관된 텍스트로 개선합니다. 각 토큰을 순차적으로 확정하는 대신, 모델은 전체 블록을 동시에 평가하고 수정하여 정보가 출력 전반에 걸쳐 양방향으로 흐르도록 합니다.

이러한 아키텍처 변경은 속도에 민감한 애플리케이션에 중요한 영향을 미칩니다. DiffusionGemma는 단일 NVIDIA H100에서 초당 1,000개 이상의 토큰을 처리합니다. 소비자 등급의 NVIDIA GeForce RTX 5090에서는 초당 700개 이상의 토큰을 유지합니다. 이는 비슷한 크기의 전통적인 자동 회귀 모델이 따라잡기 어려운 성능 수치입니다.

모델 아키텍처 및 사양

DiffusionGemma는 Gemma 4 백본, 특히 26B-A4B Mixture of Experts(MoE) 아키텍처를 기반으로 구축되었습니다. Google 엔지니어는 이 기반에 확산 헤드를 통합했습니다. 모델은 총 260억 개의 매개변수를 가지고 있지만, 추론 중에 38억 개의 매개변수만 활성화하여 컴퓨팅 요구 사항을 놀랍도록 낮게 유지합니다.

실제 배포를 위해 DiffusionGemma는 양자화 시 18GB VRAM 예산 내에 맞춰 고성능 소비자용 GPU에서 사용할 수 있습니다. 이 모델은 256,000개의 토큰 컨텍스트 창을 지원하며 140개 이상의 언어에 걸쳐 텍스트, 이미지 및 비디오 입력을 처리할 수 있습니다.

모델 가중치는 Apache 2.0 라이선스에 따라 공개되며 Hugging Face에서 사용할 수 있어 연구원과 개발자가 모델을 자유롭게 다운로드, 미세 조정 및 재배포할 수 있습니다.

블록 자동 회귀 노이즈 제거 및 자체 수정

DiffusionGemma의 가장 기술적으로 흥미로운 기능 중 하나는 자체 수정 메커니즘입니다. 모델은 각 노이즈 제거 단계에서 전체 출력 블록을 동시에 평가하기 때문에, 각 토큰이 한 번 확정되면 다시는 수정되지 않는 표준 자동 회귀 생성에서는 아키텍처적으로 불가능한, 저신뢰도 토큰을 재노이즈화하고 교체할 수 있습니다.

더 긴 출력을 위해 DiffusionGemma는 블록 자동 회귀 노이즈 제거를 사용합니다. 256개 토큰 블록의 노이즈를 완전히 제거하고 키-값 캐시에 확정한 후 다음 블록으로 진행합니다. 이 설계는 확산의 병렬 효율성과 긴 출력에 필요한 순차적 일관성을 결합합니다.

Uniform State Diffusion 하에서 모델은 작업 캔버스 전체를 지속적으로 평가합니다. 특정 토큰의 신뢰도가 떨어지면 샘플러는 해당 토큰을 무작위 토큰으로 대체하여 또 다른 개선을 위해 국소적인 노이즈를 다시 도입합니다. 이러한 반복적인 자체 복구는 모델이 왼쪽에서 오른쪽으로 생성될 때 흔히 발생하는 연쇄적인 오류 없이 초기 오류를 복구할 수 있도록 합니다.

구조적 추론을 위한 스도쿠 벤치마크

Google은 또한 JAX의 지도 학습 미세 조정(SFT) 레시피를 사용하여 스도쿠 퍼즐에 대해 학습된 DiffusionGemma의 미세 조정 변형을 출시했습니다. 결과는 확산 모델이 작업별 최적화에 어떻게 반응하는지를 보여줍니다. 기본 DiffusionGemma 모델은 퍼즐별 학습을 받지 않았기 때문에 스도쿠 퍼즐을 약 0%의 성공률로 해결합니다. 선별된 스도쿠 데이터셋으로 미세 조정 후 동일한 모델은 80%의 성공률에 도달합니다.

정확도 외에도 미세 조정된 모델은 훨씬 더 효율적입니다. 기본 모델의 48단계에 비해 약 12단계의 노이즈 제거 단계로 퍼즐을 해결합니다. 미세 조정은 모델이 토큰 표현을 더 일찍 안정화하도록 학습시켜 노이즈 제거 루프의 조기 중단을 가능하게 하고 지연 시간과 컴퓨팅 비용을 모두 줄입니다.

스도쿠 예시는 더 넓은 아키텍처 원칙을 명확하게 보여줍니다. 확산 프레임워크는 모델이 왼쪽에서 오른쪽으로의 확정 순서에 갇히는 대신 전체 출력에 걸쳐 상호 의존적인 제약 조건을 동시에 추론할 수 있는 비선형 추론을 가능하게 합니다. 이러한 속성은 확산 모델을 코드 생성, 구조화된 데이터 출력 및 논리 퍼즐과 같이 강력한 전역 구조를 가진 작업에 특히 적합하게 만듭니다.

대상 사용 사례 및 인정된 한계

Google은 DiffusionGemma를 속도에 민감한 대화형 로컬 워크플로우를 작업하는 연구원 및 개발자를 위해 포지셔닝합니다. 강조된 애플리케이션에는 인라인 코드 편집, 빠른 창의적 반복, 병렬 레이아웃이 순차적 구성보다 이점을 제공하는 비선형 콘텐츠 구조 생성이 포함됩니다.

Google의 개발자 가이드에서는 명확한 품질 절충점을 인정합니다. DiffusionGemma의 전반적인 출력 품질은 현재 자동 회귀 모드로 작동하는 표준 Gemma 4보다 낮습니다. 이 모델은 실험적인 것으로 설명되며, Google은 이 출시를 텍스트 확산을 실행 가능한 생성 패러다임으로 커뮤니티의 이해를 발전시키기 위해 설계된 연구 아티팩트로 프레임합니다. 프로덕션 등급의 지시 따르기 모델을 직접 대체하는 것은 아닙니다.

가용성 및 리소스

DiffusionGemma는 Apache 2.0 라이선스에 따라 Hugging Face에서 사용할 수 있습니다. Google은 Google Developers Blog에 상세한 개발자 가이드를 게시했으며, Google AI 블로그에 소개 게시물을 게시했습니다. 클라우드 종속성 없이 모델을 완전히 오프라인으로 실행하려는 개발자를 위해 커뮤니티에서 유지 관리하는 로컬 러너도 사용할 수 있습니다.

이번 출시는 자동 회귀 디코딩에 대한 대안을 탐색하는 더 넓은 연구 추세를 반영합니다. AR 모델은 본질적으로 순차적으로 디코딩하기 때문에 추론 시 병렬화하기 어렵습니다. 확산 기반 생성은 구조적으로 다른 경로를 제공합니다. 즉, 컴퓨팅이 출력 길이가 아닌 노이즈 제거 단계 수에 따라 확장되고 각 단계 내에서 전역 일관성을 달성할 수 있는 경로입니다.

Google AIGemma