Start / News / AWS veröffentlicht Strands Decider 2B als Open Source: Ein 2B-Agentenmodell mit 72,3 % auf JevBench ohne Textausgabe
AWS

AWS veröffentlicht Strands Decider 2B als Open Source: Ein 2B-Agentenmodell mit 72,3 % auf JevBench ohne Textausgabe

5. Okt. 20265 Min. Lesezeit
AWS veröffentlicht Strands Decider 2B als Open Source: Ein 2B-Agentenmodell mit 72,3 % auf JevBench ohne Textausgabe

Zusammenfassung der Neuigkeiten

Amazon Web Services kündigte am Donnerstag, dem 1. Oktober 2026 (US-Ostküstenzeit), Strands Decider 2B an – ein Open-Source-Entscheidungsmodell, das kein einziges Wort Text schreiben kann. Das Modell mit rund zwei Milliarden Parametern wurde über das Programm Strands Labs veröffentlicht und ist dafür ausgelegt, die kleinen, alltäglichen Entscheidungen zu treffen, mit denen KI-Agenten ständig konfrontiert sind, etwa die Auswahl eines Werkzeugs, die Weiterleitung einer Anfrage oder die Klassifizierung einer Richtlinienfrage. Größere Sprachmodelle bleiben so für anspruchsvollere Schlussfolgerungen reserviert. Die Gewichte, Quellen der Trainingsdaten und Skripte sind unter der Apache-2.0-Lizenz öffentlich zugänglich.

Was Strands Decider 2B ist

Strands Decider 2B ist ein spezialisiertes „Entscheidungsmodell“ und kein Chatbot. Anstatt Text zu erzeugen, wählt es aus einer vom Entwickler bereitgestellten Liste von Optionen, vergibt eine Punktzahl oder gibt eine Konfidenzschätzung zurück. AWS beschreibt es als kleines, schnelles Modell, das für rasche Experimente und lokale Entwicklung im Bereich agentic AI optimiert ist. Die Veröffentlichung wurde strands-labs hinzugefügt, dem experimentellen Zweig des Strands-Agents-Ökosystems. In Berichten wird es als „System-1“-Komponente beschrieben: schnelle, intuitive Urteilsbildung innerhalb der Kontrollschleife eines Agenten.

Das Strands Agents SDK selbst wurde etwa 16 Monate vor dieser Ankündigung veröffentlicht, und das Projekt deckt seitdem einen Großteil dessen ab, was ein Agent benötigt – einschließlich eines im September 2026 freigegebenen Harness. Decider 2B ergänzt diesen Stack um ein kleines, lokales Bauteil.

Wie es funktioniert

Laut Berichten von Tech Times und The Letter Two ging AWS vom offenen Basismodell Qwen3.5-2B von Alibaba aus (etwa 1,9 Milliarden Parameter). Das Team feintunte es mit LoRA, einer ressourcenschonenden Methode, bei der nur eine kleine Zusatzschicht trainiert wird, anstatt das gesamte Netzwerk neu zu berechnen. Anschließend entfernten sie den Language-Modeling-Head, der normalerweise für die Texterzeugung zuständig ist, und ersetzten ihn durch einen „Pointer Head“ mit etwa einer Million Parametern.

Der Pointer Head vergleicht die interne Repräsentation der Eingabe mittels eines Skalarprodukts mit jeder Kandidatenoption und wendet dann ein maskiertes Softmax an, um eine Wahrscheinlichkeitsverteilung zu erzeugen. Aufgrund dieses Designs beschränkt sich die Ausgabe vollständig auf die vorgegebenen Optionen. Das Modell unterstützt drei Fragetypen: Ja/Nein, Auswahl aus N Kandidaten und Punktevergabe auf einer geordneten Bewertungsskala. LoRA wurde mit Rang 16 angewendet, und der Pointer Head arbeitet mit fp32-Präzision.

Benchmarks und Latenz

Bei der öffentlichen Auswertung JevBench v1 beantwortete Decider 2B 167 von 231 Aufgaben korrekt, was einer Genauigkeit von 0,723 entspricht. Zu den berichteten Kalibrierungswerten gehören ein Brier-Score von 0,342 und ein erwarteter Kalibrierungsfehler von 0,052. Die Leistung variierte je nach Schwierigkeitsgrad: nahezu perfekt bei leichten Aufgaben, etwa 87,5 % bei Standardaufgaben und rund 50,5 % bei schweren Aufgaben.

Die Platzierungen unterscheiden sich je nach Quelle leicht. Tech Times berichtet von einem dritten Platz unter 33 Modellen in der 2B-Klasse und vom ersten Platz unter 30 Modellen, wenn größere ausgeschlossen werden. The Letter Two beschreibt es als zweitbestes unter öffentlichen Modellen ähnlicher Größe und als bestes unter jenen, die ein vollständiges Trainingsrezept veröffentlichen. Leser sollten die genaue Platzierung als abhängig davon betrachten, wie die Bestenliste gefiltert wird.

Zur Geschwindigkeit gibt AWS an, dass Entscheidungen in wenigen zehn Millisekunden fallen, auf weit verbreiteter Hardware in unter 100 Millisekunden. Unabhängige Zahlen von Tech Times sind konservativer: ein Median von 115 ms (95. Perzentil 299 ms) auf einer Nvidia RTX 3090 sowie ein aufgewärmter Median von 153 ms auf einem Apple M3 Pro bei Eingaben unter 300 Tokens. Zwei Fragen zur selben Eingabe dauern etwa 230 ms. Diese Community-Zahlen wurden von AWS nicht überprüft.

Training und Reproduzierbarkeit

Ein besonderes Merkmal dieser Veröffentlichung ist ihre Offenheit. AWS hat die Quellen und Lizenzen der Trainingsdaten, die Trainingsskripte und die Evaluierungswerkzeuge veröffentlicht. Tech Times berichtet, dass das Training auf einer einzelnen RTX 3090 mit 24 GB Speicher etwa 11 Stunden dauert, auf acht H100 GPUs hingegen rund 1 Stunde und 10 Minuten. Das Projekt dokumentiert zudem Vorhersagen und Fehlerbedingungen vor jedem Trainingslauf – eine Praxis im Stil einer Präregistrierung, die bei Modellveröffentlichungen unüblich ist.

Verfügbarkeit und Anwendungsfälle

Das Modell ist auf Hugging Face verfügbar (StrandsAgents/strands-decider-2B-hobson-v19), der Code liegt auf GitHub unter strands-labs/strands-decider. Die Installation erfolgt über pip install strands-decider; enthalten sind ein Kommandozeilenwerkzeug und ein lokaler HTTP-Server. Der Server lauscht standardmäßig auf localhost ohne Authentifizierung, daher sollten Teams eigene Zugriffskontrollen hinzufügen, bevor sie ihn freigeben. Er läuft auf einer CPU, einer Consumer-GPU oder Apple Silicon und funktioniert offline ohne API-Abhängigkeit.

Zu den vorgeschlagenen Anwendungen gehören Modell-Routing, Werkzeugauswahl, Speicher- und Kontextverwaltung, Richtlinienklassifizierung, Schutzmaßnahmen, Evaluierungen und Ausgabevalidierung. In einem hybriden Design übernimmt ein großes Modell komplexe Schlussfolgerungen, während Decider 2B die vielen Routineentscheidungen kostengünstig und lokal erledigt.

Wettbewerbsumfeld

Die Veröffentlichung erfolgt inmitten einer kleinen Welle von Entscheidungsmodell-Projekten. Das Jev-Modell von TypeSafe AI sowie LocalJev und OpenJev erscheinen auf der öffentlichen Bestenliste jevbench.dev, und Cloudflare brachte in derselben Woche seine Modelle Clef und Clef-flash heraus. Einige Kommentatoren werteten den Schritt von AWS als Unterbietung kommerzieller Angebote, während AWS selbst das Projekt als Experiment betrachtet, ob spezialisierte Modelle Routinearbeiten von Agenten übernehmen können.

Warum es für Lernende wichtig ist

Für Studierende und Entwickler ist das Projekt ein klares Beispiel für einen umfassenderen technischen Gedanken: Nicht jeder Schritt in einem KI-System erfordert ein großes generatives Modell. Wenn man die Ausgabe eines Modells auf feste Optionen beschränkt, wird es schneller, leichter testbar und einfacher nachvollziehbar. Da Code, Datenquellen und Skripte offen sind, eignet es sich zudem als praktische, reproduzierbare Fallstudie für LoRA-Feintuning und Kalibrierungsmessungen.

Einschränkungen

Eine Genauigkeit von etwa 50 % bei schweren Aufgaben zeigt, dass das Modell kein Ersatz für tiefere Schlussfolgerungen ist. Die Angaben zur Latenz variieren je nach Hardware und Quelle, und einige Benchmark-Werte stammen aus Community-Tests statt von AWS. Genaue Zeitstempel der Ankündigung wurden in den ausgewerteten Quellen nicht genannt; die obigen Datumsangaben folgen der gemeldeten US-Ostküstenzeit.

AWSKI-Agenten