Mistrals „Le Chonk“ bringt 1 Billion Parameter mit – offene Gewichte ab dem 27. Oktober

Zusammenfassung der Neuigkeiten
Mistral AI, das in Paris ansässige KI-Labor, hat am 6. Oktober 2026 (mitteleuropäische Zeit, wie von Medien berichtet wurde, die über den Start berichteten) eine öffentliche Vorschau auf Mistral Large 4 (ML4) mit dem Spitznamen „Le Chonk“ freigeschaltet. Das Unternehmen beschreibt das Modell mit rund einer Billion Parametern als das stärkste System mit offenen Gewichten, das außerhalb Chinas entwickelt wurde, und kündigt an, dass die vollständigen Gewichte nach einer etwa dreiwöchigen Testphase am 27. Oktober 2026 veröffentlicht werden. Der ursprüngliche Bericht von Wired konnte für diesen Artikel nicht abgerufen werden, daher wurden die folgenden Details mit VentureBeat, Euronews, Tech Insider und weiteren Berichten abgeglichen. Die meisten Leistungsangaben stammen von Mistral selbst und wurden nicht unabhängig reproduziert.
Was Mistral angekündigt hat
Le Chonk ist das neueste Flaggschiff des Unternehmens. Mistral gibt an, dass es in aggregierten Benchmarks zu den besten Modellen mit offenen Gewichten weltweit gehört und alle außerhalb Chinas trainierten Modelle mit offenen Gewichten mit deutlichem Abstand anführt. Mitgründer und Chef-Wissenschaftler Guillaume Lample sagte, ML4 „befindet sich an der Spitze der Modelle mit offenen Gewichten“.
Die Vorschau ist über die API und das Entwicklerstudio von Mistral verfügbar. Der frühe Zugang richtet sich an Entwickler, Cybersicherheitsexperten und Nutzer aus dem öffentlichen Sektor. Die Veröffentlichung der Gewichte ist für den 27. Oktober 2026 geplant, wobei einige Medien den Zeitraum etwas weiter als Ende Oktober (27. bis 31. Oktober) fassen. Laut Mistral ermöglicht die Verzögerung Red-Teaming mit Sicherheitsexperten und Behörden. Berichten zufolge lief das Training mittels Reinforcement Learning während der Vorschau noch.
Architektur und Spezifikationen
ML4 nutzt ein spärliches Mixture-of-Experts-Design, einen Ansatz, den Geschäftsführer Arthur Mensch zuvor als „dick, aber spärlich“ zusammenfasste. Anstatt für jedes Token jeden Parameter zu berechnen, leitet das Modell jedes Token an eine kleine Teilmenge spezialisierter Expertennetzwerke weiter. Dadurch bleiben die Inferenzkosten näher an denen eines deutlich kleineren Modells.
Gemeldete Spezifikationen, die je nach Medium leicht variieren:
- Gesamtzahl der Parameter: etwa 1 Billion (ein Medium berichtet von 1,05 Billionen).
- Aktive Parameter pro Token: etwa 49 Milliarden.
- Eingaben und Ausgaben: multimodale Eingabe (Text und Bilder) mit rein textbasierter Ausgabe; ein Medium nennt einen Vision-Encoder mit 1,6 Milliarden Parametern.
- Kontextfenster: 1 Million Tokens laut Tech Insider; nicht in jedem Bericht bestätigt.
- Sprachen: mehr als 160, darunter alle offiziellen EU-Sprachen sowie nicht-lateinische Schriftsysteme.
- Lizenz: eine eigene Mistral-Lizenz laut VentureBeat; die vollständigen Bedingungen wurden in anderen Berichten nicht im Detail genannt.
Trainingsumgebung
Mistral gibt an, das Modell in etwa zwei Monaten von Grund auf neu mit rund 4.000 NVIDIA Grace Blackwell GPUs in eigenen europäischen Rechenzentren trainiert zu haben. Berichte beziffern die Anzahl auf 3.800 bis 4.000 GPUs. Das Unternehmen betont, dass die gesamte Pipeline in Europa lief, was es als zentralen Bestandteil seines Souveränitätsarguments gegenüber Regierungen und regulierten Branchen darstellt.
Benchmark-Angaben
Mistral hob Ergebnisse in den Bereichen Softwareentwicklung, Cybersicherheit, Finanzen, Fertigung und visuelle Verortung hervor. Von den Medien gemeldete Zahlen:
- DeepSWE v1.1 (Programmierung): 62 %.
- FinWorkBench (Finanzen): 67 %.
- Harvey Legal Agent: 15 % Erfolgsquote bei Aufgaben.
- Dense200 (visuelle Verortung): 42 %; DIOR-RSVG (Satelliten- und Luftbildverortung): 73 %.
- Cybench: 93 %; CyberGym-E2E: 82 %.
Mistral erklärte zudem, dass mehrere geschlossene Frontier-Modelle bei diesen Cybersicherheitsaufgaben aufgrund von Sicherheitsfiltern und nicht wegen mangelnder Fähigkeiten nahe null Punkte erzielen. Dabei handelt es sich um eine Aussage zum Ablehnungsverhalten und nicht zur zugrunde liegenden Leistungsfähigkeit; Leser sollten dies als Herstellerangabe betrachten, bis Dritte es testen. Mistral meldet außerdem Spitzenwerte bei Benchmarks für Halbleiterdesign und erklärt, den Abstand zu führenden geschlossenen Modellen bei der Programmierung zu verringern.
Preise und Zugang
Tech Insider berichtet von Vorschau-API-Preisen in Höhe von 1,36 US-Dollar pro Million Eingabe-Tokens und 4,18 US-Dollar pro Million Ausgabe-Tokens. Andere Medien nannten keine Preise, daher sollte dies auf der offiziellen Seite von Mistral überprüft werden. Sobald die Gewichte öffentlich sind, können Organisationen das Modell auf ihrer eigenen Infrastruktur betreiben – wichtig für Teams, deren Daten intern bleiben müssen.
Hintergrund zum Unternehmen
Der Start folgt auf eine Serie-D-Finanzierungsrunde über 3 Milliarden Euro im September 2026 bei einer Bewertung von über 21 Milliarden Euro, die als größte Eigenkapitalrunde in der europäischen Technologiebranche gilt. Mistral gibt an, mehr als 125 Unternehmenskunden zu betreuen, darunter Airbus, ASML und HSBC, und dass sein Wissenschaftsteam von etwa drei Personen auf rund 300 angewachsen ist. Anfang 2026 wurde der jährliche wiederkehrende Umsatz mit über 400 Millionen US-Dollar angegeben.
Warum das für Lernende und Entwickler wichtig ist
Für Studierende und Ingenieure ist ML4 ein nützliches Fallbeispiel für drei Konzepte: spärliche Mixture-of-Experts-Modelle, die die Gesamtgröße vom Rechenaufwand pro Token entkoppeln; Veröffentlichungen mit offenen Gewichten, bei denen die trainierten Parameter heruntergeladen und untersucht werden können, auch wenn Trainingsdaten und Code nicht vollständig offen sind; sowie gestaffelte Veröffentlichungspraktiken, bei denen einer Freigabe eine Vorschau und Sicherheitstests vorausgehen. Offene Gewichte ermöglichen es Forschern zudem, das Modell unabhängig zu feintunen, zu evaluieren und zu prüfen.
Was als Nächstes zu beobachten ist
Der entscheidende Meilenstein ist die Veröffentlichung der Gewichte am 27. Oktober. Unabhängige Evaluierungen werden zeigen, ob die Benchmark-Angaben standhalten, wie die eigene Lizenz kommerzielle Nutzung behandelt und welche Hardware nötig ist, um ein Modell mit einer Billion Parametern lokal zu betreiben. Auch die endgültigen Preise und Details zum Kontextfenster sollten bestätigt werden, sobald Mistral die vollständige Dokumentation veröffentlicht.