1. Projektübersicht
AngelSpec ist Tencents PyTorch-natives Trainings-Framework zum Erstellen von Speculative-Decoding-Draft-Modellen – den kleinen „Prädiktor"-Modellen, die es großen Sprachmodellen ermöglichen, mehrere Token pro Forward-Pass zu generieren statt nur einem, wodurch die Inferenzlatenz gesenkt wird, ohne die Ausgabequalität zu beeinträchtigen.
2. Hintergrund & Positionierung
Speculative Decoding beschleunigt die LLM-Inferenz, indem ein leichtgewichtiges Draft-Modell mehrere Token im Voraus vorschlägt, die das vollständige Zielmodell dann in einem einzigen Durchgang verifiziert. Die Beschleunigung tritt nur ein, wenn das Draft-Modell gut auf sein Zielmodell abgestimmt ist – und diese Abstimmung im Produktionsmaßstab zu trainieren, erforderte bisher historisch die Zusammenführung von Forschungscode. AngelSpec wurde vom Hunyuan AI Infra-Team von Tencent entwickelt, um diese Lücke zu schließen: es behandelt Speculative Decoding als erstklassiges Trainingsziel und nicht als nachträglichen Inferenz-Trick und produktionalisiert die Trainings-Pipeline hinter Tencents eigenen Hy3- und Qwen3-Draft-Modell-Veröffentlichungen.
Was es von anderen Speculative-Decoding-Trainern abhebt:
- Architekturvielfalt in einem Framework – sechs verschiedene Draft-Architekturen (autoregressiv und blockparallel) sind über die Konfiguration auswählbar, anstatt separate Codebasen zu erfordern.
- Disaggregiertes Trainingsdesign – Inferenz (Generierung von Hidden States) und Training (Optimierung) laufen auf separaten GPU-Worker-Gruppen, die über einen High-Throughput-Tensor-Store verbunden sind, sodass jede Seite unabhängig skalieren kann.
- Produktionserprobung – es ist das Framework, das zum Trainieren und Veröffentlichen von Tencents eigenen Hy3-A21B- und Qwen3-8B-Draft-Modellen verwendet wurde, kein Forschungsprototyp.
3. Funktionskategorien
- 🧩 Draft-Architekturen – 6 auswählbare Methoden. Repräsentative Beispiele: DFly (blockparallel mit AR-Kopf zur Hidden-State-Korrektur), DFlash (Anchor-Sampling + parallele Blockgenerierung), DFlare (DFlash mit lernbarer fusion pro Schicht), Eagle3 (autoregressives Training zur Testzeit), DSpark (DFlash-Backbone mit einem AR-Kopf im EAGLE-Stil), MTP (vollständige MoE-Decoder-Schicht als Draft-Kopf). Zweck: die Draft-Methode an das Zielmodell und das Latenzbudget anpassen, ohne das Framework zu wechseln.
- ⚙️ Trainingskonfigurationen – 5+ sofort einsatzbereite YAML-Konfigurationen. Beispiele:
vllm_qwen3_8b_dfly.yaml,vllm_qwen3_8b_dflare.yaml,sglang_qwen3_8b_dflash.yaml,sglang_qwen3_8b_dspark.yaml,vllm_qwen3_8b_mtp_pack_usp_40k.yaml. Zweck: bewährte Trainingsrezepte für gängige Zielmodelle und Backends reproduzieren. - 📦 Ausführbare Beispiele – 2 Beispiel-Suiten für Zielmodelle (Hy3 Multi-Node, Qwen3-8B Single-Node), die DFly, DSpark, MTP und DFly-CPT-Varianten abdecken. Zweck: Neulingen einen funktionierenden End-to-End-Trainingslauf als Startpunkt geben.
- 🤗 Veröffentlichte Draft-Modelle – mehrere vortrainierte Checkpoints auf Hugging Face, darunter Hy3-DFly-Block8 und Hy3-MTP-TTT3, sowohl im Standard- als auch im „Think"-Modus. Zweck: Nutzern ermöglichen, Speculative Decoding sofort zu evaluieren oder einzusetzen, ohne von Grund auf neu zu trainieren.
4. Wichtige Highlights
- MTP-Training für lange Kontexte mit TTT – Multi-Token-Prediction-Training verwendet On-Policy-, Multi-Depth-Rollouts mit einem speichereffizienten einzelnen Causal-Pass und skaliert über Ulysses Sequence Parallelism auf 128k-Token-Kontexte.
- Akzeptanzorientierte Verlustfunktionen – zusammensetzbare Verlustfunktionen (Cross-Entropy, Top-k-KL, LK-Verluste, D-PACE-Gewichtung) sind darauf abgestimmt, direkt die Metrik zu optimieren, die für Speculative Decoding entscheidend ist: wie viele Draft-Token das Zielmodell tatsächlich akzeptiert.
- Dokumentenbewusstes Sequence Packing – Megatron-artiges Packing mit fester Länge und dokumentübergreifender Isolation hält den Trainings-Throughput hoch, ohne Attention über unabhängige Dokumente hinweg lecken zu lassen.
- Online-Evaluierung von Speculative Decoding – Trainingsläufe berichten echte Speculative-Decoding-Metriken (z. B. mittlere akzeptierte Länge) während des Trainings, nicht nur Proxy-Verluste, sodass die Qualität des Draft-Modells in Echtzeit sichtbar ist.
- Disaggregierte Inferenz/Training über Mooncake – separate GPU-Worker-Gruppen für die Generierung von Hidden States und die Modelloptimierung kommunizieren über einen Mooncake-Tensor-Store, wodurch jede Seite auf großen Clustern unabhängig skalieren kann.
- Gemessene End-to-End-Beschleunigungen – DFly liefert eine durchschnittliche End-to-End-Beschleunigung von bis zu 2,40× gegenüber der autoregressiven Decodierung, mit gemessenen Throughput-Steigerungen, die unter echtem Traffic und bei hoher Nebenläufigkeit standhalten.
5. Anwendungsfälle nach Rolle
- Allgemeine Entwickler – ein veröffentlichtes Draft-Modell (z. B. eine Qwen3-8B-Variante) mit vLLM oder SGLang integrieren, um bestehende Inferenz-Pipelines zu beschleunigen, ohne etwas neu zu trainieren.
- DevOps / SRE – das disaggregierte Worker-Gruppen-Design nutzen, um die GPU-Clusterkapazität separat für die Generierung von Hidden States und das Training zu planen und Online-Metriken zur Akzeptanzlänge als Signal für die Produktionsgesundheit zu überwachen.
- Daten- / Forschungswissenschaftler – benutzerdefinierte Draft-Modelle gegen proprietäre Zielmodelle trainieren, über die sechs unterstützten Architekturen hinweg experimentieren und die akzeptanzorientierte Verlustgewichtung für eine bestimmte Arbeitslast anpassen.
- Projektmanager – die veröffentlichten Benchmarks und Checkpoints von AngelSpec evaluieren, um Initiativen zur Reduzierung von Inferenzkosten zu dimensionieren, bevor Entwicklungszeit für benutzerdefiniertes Training zugesichert wird.
6. Erste Schritte
Finden Sie, was Sie benötigen – durchstöbern Sie die Konfigurationen und Beispiele des Repositorys oder prüfen Sie die veröffentlichten Checkpoints auf Hugging Face:
https://huggingface.co/collections/AngelSlim/angelspec
Installieren / Integrieren:
pip install -e ".[vllm]"
pip install mooncake-transfer-engine
./examples/qwen3-8b-dfly/run.sh
Beitragen – forken Sie das Repository, nehmen Sie Änderungen vor und öffnen Sie einen Pull Request:
git clone https://github.com/Tencent/AngelSpec
7. Projektstruktur
AngelSpec/
├── angelspec/ # Kern-Framework-Code (Architekturen, Verlustfunktionen, Trainings-Schleife)
├── configs/ # YAML-Dateien für die Trainingskonfiguration
├── examples/ # Ausführbare End-to-End-Beispiele (Hy3, Qwen3-8B-Ziele)
├── tests/ # Test-Suite
├── docs/ # Dokumentations-Quellen
└── tools/ # Build- und Hilfsskripte (z. B. build_conda.sh)
8. Verwandtes Ökosystem
- TorchSpec – die PyTorch-native Grundlage, auf der AngelSpec für Speculative-Decoding-Trainingsprimitive aufbaut.
- Mooncake – stellt die Tensor-Store-Transfer-Engine bereit, die die disaggregierten Inferenz- und Trainings-GPU-Worker-Gruppen von AngelSpec verbindet.
- vLLM / SGLang – unterstützte Inferenz-Backends sowohl für Rollouts während des Trainings als auch für die Bereitstellung der resultierenden Draft-Modelle.
- AngelSlim – Tencents umfassenderes Toolkit zur Komprimierung großer Modelle, von dem AngelSpec ein Teil ist.
9. Lizenz
- ✅ Verwenden, ändern und verteilen Sie den eigenen Code von AngelSpec, auch für kommerzielle Zwecke, unter der Apache-2.0-Lizenz.
- ✅ Erstellen und trainieren Sie Ihre eigenen Draft-Modelle auf Basis des Frameworks.
- ❌ Entfernen Sie beim erneuten Verteilen keine bestehenden Copyright- oder Lizenzhinweise.
- ℹ️ Mitgelieferte Drittanbieter-Komponenten unterliegen ihren ursprünglichen Lizenzen (Apache-2.0 für Eagle und Transformers; MIT für SpecForge, DeepSpec und TorchSpec) – prüfen Sie das entsprechende Unterverzeichnis, bevor Sie diese Teile separat weiterverbreiten.
10. FAQ
F: Mit welcher Draft-Architektur sollte ich beginnen?
A: Für die meisten Zielmodelle ist DFly ein sinnvoller Standard – es liefert die größte veröffentlichte Beschleunigung (bis zu 2,40×) und verfügt über vorgefertigte Konfigurationen wie vllm_qwen3_8b_dfly.yaml.
F: Muss ich mein eigenes Draft-Modell trainieren, um AngelSpec zu verwenden?
A: Nein. Vortrainierte Checkpoints (z. B. Hy3-DFly-Block8, Hy3-MTP-TTT3) sind in der Hugging Face-Sammlung veröffentlicht und können direkt eingesetzt werden.
F: Welche Inferenz-Backends unterstützt AngelSpec?
A: Sowohl vLLM als auch SGLang, die über die Konfiguration auswählbar sind (z. B. vllm_qwen3_8b_dfly.yaml vs. sglang_qwen3_8b_dflash.yaml).
F: Wie geht AngelSpec mit sehr langen Trainingskontexten um?
A: MTP-Training mit TTT skaliert über Ulysses Sequence Parallelism in Kombination mit einem speichereffizienten einzelnen Causal-Pass auf 128k-Token-Kontexte.
F: Wo kann ich die technischen Details des Designs nachlesen?
A: Das begleitende Paper „AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding“ ist unter arXiv:2607.25852 verfügbar.
11. Schnelllinks
- Repository: https://github.com/Tencent/AngelSpec
- Dokumentation: https://angelspec.readthedocs.io
- Technischer Bericht: https://arxiv.org/abs/2607.25852
- Vortrainierte Modelle: https://huggingface.co/collections/AngelSlim/angelspec
- Issues: https://github.com/Tencent/AngelSpec/issues
- Pull Requests: https://github.com/Tencent/AngelSpec/pulls
12. Zusammenfassung
AngelSpec verpackt Tencents Produktions-Trainings-Pipeline für Speculative Decoding in ein offenes, konfigurationsgetriebenes Framework, das sechs Draft-Architekturen sowie vLLM- und SGLang-Backends umfasst. Es ist am wertvollsten für Teams, die die LLM-Inferenzlatenz im großen Maßstab senken müssen – entweder durch den Einsatz bereits veröffentlichter Draft-Modelle oder durch das Training benutzerdefinierter Modelle – ohne einen Trainings-Stack für Speculative Decoding von Grund auf neu zu erstellen.