1. 프로젝트 개요
AngelSpec은 Tencent의 PyTorch 네이티브 학습 프레임워크로, 추측 디코딩 초안 모델을 구축하는 데 사용됩니다. 초안 모델은 대규모 언어 모델이 한 번의 순방향 패스당 하나가 아닌 여러 토큰을 생성할 수 있게 해주는 작은 "예측 모델"로, 출력 품질에 영향을 주지 않고 추론 지연 시간을 줄여줍니다.
2. 배경 및 포지셔닝
추측 디코딩은 경량 초안 모델이 미리 몇 개의 토큰을 제안하면, 대상 모델이 이를 한 번의 패스로 검증하여 LLM 추론 속도를 높이는 기술입니다. 이러한 속도 향상은 초안 모델이 대상 모델과 잘 정렬되어 있을 때만 실현되며, 프로덕션 규모에서 이 정렬을 잘 학습시키는 것은 전통적으로 연구용 코드를 조합해야만 가능했습니다. Tencent의 Hunyuan AI Infra 팀은 이 격차를 해소하기 위해 AngelSpec을 개발했습니다. 이 프레임워크는 추측 디코딩을 사후적인 추론 기법이 아닌 최우선 학습 목표로 취급하며, Tencent 자체의 Hy3 및 Qwen3 초안 모델 출시를 뒷받침하는 학습 파이프라인을 제품화했습니다.
다른 추측 디코딩 트레이너와 차별화되는 점은 다음과 같습니다:
- 단일 프레임워크 내의 폭넓은 아키텍처 지원 — 자기회귀 및 블록 병렬 방식을 포함한 6가지 개별 초안 아키텍처를 별도의 코드베이스 없이 설정만으로 선택할 수 있습니다.
- 분리형 학습 설계 — 추론(은닉 상태 생성)과 학습(최적화)이 고처리량 텐서 스토어로 연결된 별도의 GPU 워커 그룹에서 실행되므로, 각각 독립적으로 확장할 수 있습니다.
- 프로덕션 검증됨 — 단순한 연구용 프로토타입이 아니라 Tencent의 자체 Hy3-A21B 및 Qwen3-8B 초안 모델을 학습하고 출시하는 데 사용된 실제 프레임워크입니다.
3. 기능 카테고리
- 🧩 초안 아키텍처 — 6가지 선택 가능한 방식. 대표적인 예: DFly(은닉 교정 자기회귀 헤드를 갖춘 블록 병렬 방식), DFlash(앵커 샘플링 + 병렬 블록 생성), DFlare(레이어별 학습 가능한 대상 융합을 적용한 DFlash), Eagle3(자기회귀 테스트 타임 학습), DSpark(EAGLE 스타일의 자기회귀 헤드를 갖춘 DFlash 백본), MTP(초안 헤드로서의 완전한 MoE 디코더 레이어). 목적: 프레임워크를 전환하지 않고 대상 모델 및 지연 예산에 맞는 초안 방식을 매칭합니다.
- ⚙️ 학습 설정 — 5개 이상의 바로 실행 가능한 YAML 설정. 예:
vllm_qwen3_8b_dfly.yaml,vllm_qwen3_8b_dflare.yaml,sglang_qwen3_8b_dflash.yaml,sglang_qwen3_8b_dspark.yaml,vllm_qwen3_8b_mtp_pack_usp_40k.yaml. 목적: 일반적인 대상 모델 및 백엔드에 대해 검증된 학습 레시피를 재현합니다. - 📦 실행 가능한 예제 — DFly, DSpark, MTP 및 DFly-CPT 변형을 다루는 2가지 대상 모델 예제 모음(Hy3 다중 노드, Qwen3-8B 단일 노드). 목적: 초보자가 시작할 수 있는 작동하는 엔드투엔드 학습 실행 환경을 제공합니다.
- 🤗 출시된 초안 모델 — 표준 및 "think" 모드를 모두 지원하는 Hy3-DFly-Block8 및 Hy3-MTP-TTT3을 포함하여 Hugging Face에 게시된 여러 사전 학습된 체크포인트. 목적: 사용자가 처음부터 학습하지 않고도 추측 디코딩을 즉시 평가하거나 배포할 수 있게 합니다.
4. 주요 특징
- TTT를 활용한 긴 문맥 MTP 학습 — 다중 토큰 예측 학습은 메모리 효율적인 단일 인과 패스를 통해 정책 기반 다중 깊이 롤아웃을 사용하며, Ulysses 시퀀스 병렬 처리를 통해 128k 토큰 문맥으로 확장됩니다.
- 수용도 정렬 손실 함수 — 결합 가능한 손실 함수(교차 엔트로피, top-k KL, LK 손실, D-PACE 가중치)가 추측 디코딩에서 중요한 지표, 즉 대상 모델이 실제로 수용하는 초안 토큰 수를 직접 최적화하도록 조정됩니다.
- 문서 인식 시퀀스 패킹 — Megatron 스타일의 고정 길이 패킹과 문서 간 격리를 사용하여 무관한 문서 간의 어텐션 누수 없이 학습 처리량을 높게 유지합니다.
- 온라인 추측 디코딩 평가 — 학습 실행 중 단순한 대리 손실이 아닌 실제 추측 디코딩 지표(예: 평균 수용 길이)를 보고하여 초안 모델의 품질을 실시간으로 확인할 수 있습니다.
- Mooncake을 통한 분리형 추론/학습 — 은닉 상태 생성과 모델 최적화를 위한 별도의 GPU 워커 그룹이 Mooncake 텐서 스토어를 통해 통신하여 대규모 클러스터에서 각 측이 독립적으로 확장할 수 있습니다.
- 측정된 엔드투엔드 속도 향상 — DFly는 자기회귀 디코딩 대비 최대 2.40배의 평균 엔드투엔드 속도 향상을 제공하며, 실제 트래픽 및 고동시성 환경에서도 유지되는 처리량 향상을 벤치마크를 통해 입증했습니다.
5. 역할별 사용 사례
- 일반 개발자 — 출시된 초안 모델(예: Qwen3-8B 변형)을 vLLM 또는 SGLang과 통합하여 기존 추론 파이프라인을 재학습 없이 속도를 높입니다.
- DevOps / SRE — 분리형 워커 그룹 설계를 사용하여 은닉 상태 생성과 학습을 위한 GPU 클러스터 용량을 별도로 계획하고, 프로덕션 상태 신호로서 온라인 수용 길이 지표를 모니터링합니다.
- 데이터 / 연구 과학자 — 자체 대상 모델에 대한 맞춤형 초안 모델을 학습하고, 지원되는 6가지 아키텍처에서 실험하며, 특정 워크로드에 맞게 수용도 정렬 손실 가중치를 조정합니다.
- 프로젝트 매니저 — 맞춤형 학습에 엔지니어링 시간을 투입하기 전에 AngelSpec의 공개 벤치마크 및 출시된 체크포인트를 평가하여 추론 비용 절감 이니셔티브의 범위를 설정합니다.
6. 시작하기
필요한 항목 찾기 — 리포지토리의 설정 및 예제를 찾아보거나 Hugging Face에서 출시된 체크포인트를 확인하세요:
https://huggingface.co/collections/AngelSlim/angelspec
설치 / 통합:
pip install -e ".[vllm]"
pip install mooncake-transfer-engine
./examples/qwen3-8b-dfly/run.sh
기여하기 — 리포지토리를 포크하고, 변경 사항을 만든 후 풀 리퀘스트를 여세요:
git clone https://github.com/Tencent/AngelSpec
7. 프로젝트 구조
AngelSpec/
├── angelspec/ # 핵심 프레임워크 코드(아키텍처, 손실, 학습 루프)
├── configs/ # 학습 설정 YAML 파일
├── examples/ # 실행 가능한 엔드투엔드 예제(Hy3, Qwen3-8B 대상)
├── tests/ # 테스트 모음
├── docs/ # 문서 소스
└── tools/ # 빌드 및 유틸리티 스크립트(예: build_conda.sh)
8. 관련 생태계
- TorchSpec — AngelSpec이 추측 디코딩 학습 프리미티브를 위해 구축된 기반이 되는 PyTorch 네이티브 기반입니다.
- Mooncake — AngelSpec의 분리형 추론 및 학습 GPU 워커 그룹을 연결하는 텐서 스토어 전송 엔진을 제공합니다.
- vLLM / SGLang — 학습 타임 롤아웃과 결과 초안 모델 배포를 모두 지원하는 추론 백엔드입니다.
- AngelSlim — AngelSpec이 일부인 Tencent의 폭넓은 대규모 모델 압축 툴킷입니다.
9. 라이선스
- ✅ 상업적 목적을 포함하여 Apache-2.0 라이선스 하에 AngelSpec의 자체 코드를 사용, 수정 및 배포할 수 있습니다.
- ✅ 이 프레임워크를 기반으로 자체 초안 모델을 구축하고 학습할 수 있습니다.
- ❌ 재배포 시 기존의 저작권 또는 라이선스 고지를 제거하지 마세요.
- ℹ️ 번들된 서드파티 구성 요소는 원래 라이선스를 따릅니다(Eagle 및 Transformers는 Apache-2.0, SpecForge, DeepSpec 및 TorchSpec은 MIT). 해당 부분을 별도로 재배포하기 전에 관련 하위 디렉터리를 확인하세요.
10. FAQ
Q: 어떤 초안 아키텍처로 시작해야 하나요?
A: 대부분의 대상 모델에서 DFly가 합리적인 기본값입니다. 가장 큰 공개 속도 향상(최대 2.40배)을 제공하며 vllm_qwen3_8b_dfly.yaml과 같은 기성 설정을 갖추고 있습니다.
Q: AngelSpec을 사용하려면 자체 초안 모델을 학습해야 하나요?
A: 아니요. 사전 학습된 체크포인트(예: Hy3-DFly-Block8, Hy3-MTP-TTT3)가 Hugging Face 컬렉션에 게시되어 있어 바로 배포할 수 있습니다.
Q: AngelSpec은 어떤 추론 백엔드를 지원하나요?
A: vLLM과 SGLang 모두를 지원하며, 설정별로 선택할 수 있습니다(예: vllm_qwen3_8b_dfly.yaml vs. sglang_qwen3_8b_dflash.yaml).
Q: AngelSpec은 매우 긴 학습 문맥을 어떻게 처리하나요?
A: TTT를 활용한 MTP 학습은 Ulysses 시퀀스 병렬 처리와 메모리 효율적인 단일 인과 패스를 결합하여 128k 토큰 문맥으로 확장됩니다.
Q: 설계에 대한 기술적 세부 정보는 어디서 읽을 수 있나요?
A: "AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding"이라는 동반 논문은 arXiv:2607.25852에서 확인할 수 있습니다.
11. 빠른 링크
- 리포지토리: https://github.com/Tencent/AngelSpec
- 문서: https://angelspec.readthedocs.io
- 기술 보고서: https://arxiv.org/abs/2607.25852
- 사전 학습된 모델: https://huggingface.co/collections/AngelSlim/angelspec
- 이슈: https://github.com/Tencent/AngelSpec/issues
- 풀 리퀘스트: https://github.com/Tencent/AngelSpec/pulls
12. 요약
AngelSpec은 Tencent의 프로덕션 추측 디코딩 학습 파이프라인을 6가지 초안 아키텍처와 vLLM 및 SGLang 백엔드를 모두 아우르는 개방형, 설정 기반 프레임워크로 패키징합니다. 추측 디코딩 학습 스택을 처음부터 구축할 필요 없이, 이미 출시된 초안 모델을 배포하거나 맞춤형 모델을 학습하여 대규모로 LLM 추론 지연 시간을 줄여야 하는 팀에 가장 유용합니다.