Kolibri von Aleph Alpha: KI made in Germany
Kolibri von Aleph Alpha im Check: Technik, Stärken, Schwächen, Hardware und die Cohere-Fusion. Für wen sich die KI made in Germany wirklich lohnt.
Am 3. Oktober, dem Tag der Deutschen Einheit, hat Aleph Alpha ein neues Sprachmodell veröffentlicht. Es heißt Kolibri, die Gewichte stehen frei zum Download bereit, und der Anspruch ist hoch: Es soll zeigen, dass sich in Deutschland ein wettbewerbsfähiges Modell bauen lässt, das Behörden und Unternehmen selbst kontrollieren können.
Ob das stimmt, hängt davon ab, was man von einem Sprachmodell verlangt. Grundlage dieses Beitrags sind die Seiten von Aleph Alpha, die Modellkarte auf Hugging Face und die ersten unabhängigen Einordnungen. Eigene Tests sind nicht dabei, und fast alle Leistungszahlen stammen vom Hersteller. Bei einem Modell, das erst vier Tage alt ist, lässt sich das kaum anders haben, man sollte es beim Lesen aber im Kopf behalten.
Was ist Kolibri von Aleph Alpha?
Kolibri-1 ist ein Sprachmodell für Deutsch und Englisch, entwickelt von Aleph Alpha in Heidelberg. Es ist weder ein Chatdienst noch eine App, sondern ein Modell zum Herunterladen und Selbstbetreiben. Die trainierten Gewichte liegen auf Hugging Face unter der Apache-2.0-Lizenz, die auch die kommerzielle Nutzung erlaubt. Dazu gibt es eine offizielle Produktseite und einen technischen Bericht.
Aleph Alpha selbst spricht von einem "Sovereign Open-Weight Model", und der zweite Teil ist genau gewählt. Open-Weight heißt: Die Gewichte sind offen, der Rest nicht. Trainingscode und Entwicklungsprozess bleiben im Haus, darauf weist auch ki-erz.de hin. Ein Open-Source-Modell im strengen Sinn ist Kolibri damit nicht.
Das Unternehmen gibt es seit 2019. Jonas Andrulis und Samuel Weinbach haben es in Heidelberg gegründet, bekannt wurde es mit den Luminous-Modellen, und inzwischen liegt der Schwerpunkt auf KI für Firmenkunden und Behörden.
Die wichtigsten Daten im Überblick
Zuerst die Eckdaten aus Modellkarte und Launch-Beitrag, damit klar ist, worüber wir sprechen:
- Größe: 78,1 Milliarden Parameter insgesamt, davon etwa 3,46 Milliarden pro Token aktiv
- Aufbau: Mixture-of-Experts mit 384 Experten je Schicht, sechs davon pro Token ausgewählt
- Sprachen: Deutsch und Englisch, dazu Programmcode
- Kontext: nativ bis 262.144 Token, per Extrapolation bis 1.048.576 Token
- Training: rund 20 Billionen Token auf 768 Nvidia-B200-Grafikprozessoren, 21 Tage Vortraining
- Wissensstand: 18. Juni 2026
- Einsatzfelder laut Modellkarte: Assistenten, agentische Abläufe, Dokumentenverarbeitung
- Speicherbedarf: etwa 78 Gigabyte in der FP8-Fassung
Mixture-of-Experts bedeutet: Das Modell besteht aus vielen kleinen Fachbereichen, den Experten, und für jedes einzelne Wort arbeitet nur ein Bruchteil davon. Gespeichert werden müssen trotzdem alle 78 Milliarden Parameter, gerechnet wird aber nur mit rund 3,5 Milliarden. Daraus folgen zwei Eigenschaften, die man im Kopf behalten sollte. Kolibri antwortet schnell und ist im Betrieb vergleichsweise günstig. Und es braucht trotzdem eine Grafikkarte mit sehr viel Speicher.
KI made in Germany: was steckt dahinter?
Der Slogan klingt nach Marketing, lässt sich aber zum Teil überprüfen. Entwickelt und trainiert hat Kolibri das Team von Aleph Alpha selbst, auf Rechenzentren in Deutschland und Finnland. Das schreibt das Unternehmen im Launch-Beitrag, dazu gibt es eine Pressemitteilung.
Deutsch ist dabei kein Nachgedanke. Rund ein Fünftel bis knapp ein Viertel der Trainingsdaten ist deutschsprachig, je nachdem, ob man Launch-Beitrag oder Modellkarte zugrunde legt. Aleph Alpha hat dafür rund 1,3 Billionen Token aus Common Crawl selbst aufbereitet, übersetzte Texte machen nur etwa sechs Prozent aus.
Dazu kommt ein eigener Tokenizer, der Wörter in sinnvollere Bausteine zerlegt. Als Beispiel nennt Aleph Alpha das Wort Bundessozialgerichtes. Gerade bei den langen Zusammensetzungen, von denen das Deutsche reichlich hat, soll das Texte für das Modell kürzer und handlicher machen.
Jetzt der Teil, der in Werbetexten selten steht. Die Grafikprozessoren kommen von Nvidia aus den USA. Für die Aufbereitung synthetischer Trainingsdaten hat Aleph Alpha laut Modellkarte offene Modelle anderer Hersteller genutzt: Gemma von Google für englische Umformulierungen, Mistral-NeMo für deutsche und Qwen3 von Alibaba als Qualitätsprüfer. Dieselbe Karte räumt ein, dass die Trainingsdaten auch Material enthalten, das mit chinesischen Sprachmodellen erzeugt wurde und politische Verzerrungen tragen kann. Dagegen habe man mit Filtern und gezieltem Nachtraining gearbeitet.
Ich halte diese Offenheit für ein gutes Zeichen. Wer Souveränität verspricht und trotzdem offenlegt, welche Fremdbausteine drinstecken, macht sich angreifbar, aber eben auch überprüfbar.
Was "souverän" dann heißt, fasst ki-erz.de nüchtern zusammen: beherrschbare Infrastruktur, deutschsprachige KI, selbst betreibbar, datenschutzfreundlich. Nationale Unabhängigkeit im strengen Sinn ist das nicht, und es beansprucht auch niemand. Dazu passt der regulatorische Teil. Aleph Alpha hat den europäischen Verhaltenskodex für KI-Modelle mit allgemeinem Verwendungszweck unterzeichnet und eine Zusammenfassung der Trainingsdaten nach EU-Vorlage veröffentlicht. Die Zusammenfassung schreibt die KI-Verordnung den Anbietern solcher Modelle ohnehin vor, mehr dazu im Beitrag KI-Regeln 2026.
Wo Kolibri stark ist und wo nicht
Am stärksten ist Kolibri beim Rechnen und Schlussfolgern. Im Mathematiktest AIME 2025 erreicht es laut Aleph Alpha 96,9 Punkte auf Englisch und 87,5 auf Deutsch. Für Nvidia Nemotron 3 Super nennt das Unternehmen im Vergleich 91,7 und 85,6, für Mistral Small 4 79,8 und 72,3, beide mit deutlich mehr aktiven Parametern. Auch bei GPQA Diamond, einem Test mit schwierigen Wissenschaftsfragen, liegt Kolibri mit 84,3 Punkten vor beiden (78,0 und 74,7). Bemerkenswert ist, dass der Abstand zwischen Englisch und Deutsch klein bleibt.
Dazu kommt ein Verhalten, das im Alltag mehr wert sein kann als ein paar Benchmarkpunkte. Kolibri ist darauf trainiert, nicht zu antworten, wenn der Kontext keine Antwort hergibt. In einem Test mit Faktenfragen enthält es sich laut Aleph Alpha in 44 Prozent der Fälle, statt etwas zu erfinden, beim internen Vorgängermodell waren es 15 Prozent. Die Methode heißt Merlin-Arthur-Protokoll und ist in einem wissenschaftlichen Aufsatz beschrieben.
Schwächer sieht es im Gesamtbild aus. Im Durchschnitt der Tests aus der Modellkarte liegt Kolibri bei rund 75 Punkten auf Englisch und rund 71 auf Deutsch. Das beste verglichene dichte Modell, ein Modell der Qwen-Familie mit 27 Milliarden Parametern, kommt auf rund 80 und rund 80. Beim Test TerminalBench schafft Kolibri 27,7 Punkte, Nemotron 3 Super 39,7.
Die Analyse von DataCamp nennt drei weitere Schwachstellen. Beim reinen Faktenwissen ohne angebundene Dokumente landet Kolibri im Index AA-Omniscience bei minus 32,8, die Trefferquote liegt bei 14,8 Prozent. Bei langen Dialogen mit wiederholten Tool-Aufrufen liegt es ebenfalls hinten. Und die Million Token ist Extrapolation, kein Training: Trainiert wurde mit 262.144 Token, Aleph Alpha empfiehlt selbst, darunter zu bleiben. Für die volle Länge nennt die Modellkarte 63,2 Punkte im Test RULER, DataCamp sieht dort ein Qwen-Modell klar vorn.
Härter urteilt Trending Topics. Der Vergleichssatz von Aleph Alpha sei veraltet, neuere Modelle wie Qwen3.8 stünden in der Rangliste vermutlich besser da, und die Marktposition sei schwach. Das ist eine Einschätzung, keine Messung. Unabhängige Tests lagen in den gesichteten Quellen bis zum 6. Oktober nicht vor.
Beides lässt sich vereinbaren. Kolibri ist kein Frontier-Modell, und Aleph Alpha behauptet das auch nirgends. Es zielt auf einen engen Einsatzbereich: regulierte Branchen, deutschsprachige Dokumente, Betrieb auf eigener Hardware.
Für wen ist Kolibri geeignet?
Aleph Alpha zielt auf öffentliche Verwaltung, Banken, Industrie und Luftfahrt. In der Modellkarte stehen als empfohlene Einsätze Assistenten, agentische Abläufe, Dokumentenverarbeitung und Fragen an eigene Unterlagen. Die Branchenwerte, die das Unternehmen dazu nennt (etwa 0,54 auf 0,75 in der öffentlichen Verwaltung), stammen aus selbst entwickelten Tests und sind nicht unabhängig geprüft.
Gut geeignet ist das Modell für:
- Behörden, Kommunen und Verwaltungen, die deutschsprachige Vorgänge bearbeiten und Daten nicht in eine fremde Cloud geben dürfen
- Industrieunternehmen und Mittelständler mit eigener GPU-Infrastruktur oder einem Rechenzentrumspartner, etwa für Fragen an technische Dokumentationen und Verträge
- IT-Teams, die ein offenes, gut dokumentiertes Basismodell unter Apache 2.0 anpassen oder weitertrainieren wollen
- Projekte, in denen Nachvollziehbarkeit zählt, weil das Modell bei dünner Datenlage lieber schweigt, als zu raten
Eher nicht geeignet ist es für:
- Soloselbstständige, Agenturen und kleine Betriebe ohne eigene Server, denn es gibt weder einen Chatzugang noch, Stand 5. Oktober, eine gehostete Schnittstelle mit Preisliste
- Aufgaben, die viel Faktenwissen aus dem Gedächtnis verlangen, ohne dass Dokumente angebunden sind
- lange automatische Abläufe mit vielen aufeinanderfolgenden Tool-Aufrufen
- alle, die über sämtliche Disziplinen hinweg die bestmögliche Leistung brauchen
Eine Faustregel: Wenn die Frage lautet, ob dieser Text das Haus verlassen darf, und die Antwort Nein ist, ist Kolibri eine Prüfung wert. Wenn die Frage lautet, welches Modell insgesamt das beste ist, nicht. Die Auswahl bei sensiblen Daten ist ohnehin klein, das habe ich im Beitrag Welches KI-Tool wofür? beschrieben. Kolibri ist ein Kandidat für genau diesen Fall.
Kolibri ausprobieren: Hardware, Lizenz und Verfügbarkeit
Die Gewichte kosten nichts. Das Geld geht in die Hardware. Mindestens nötig sind laut Modellkarte zwei A100 mit je 80 Gigabyte, zwei H100 oder eine H200, B200 oder B300. Die FP8-Fassung braucht etwa 78 Gigabyte Speicher, die unkomprimierte Fassung ungefähr das Doppelte. Das ist Serverhardware und kein Schreibtisch-PC. Eine nüchterne Einordnung zum Modell liefert auch Hardwareluxx.
Die Anleitung zum Betrieb steht auf der Modellkarte. Für Heimrechner gibt es inzwischen Umwandlungen aus der Community, eine 4-Bit-Fassung braucht rund 48 Gigabyte. Sie stammen nicht von Aleph Alpha und sind ungeprüft, und laut ModelFit konnten Ollama und andere gängige Programme Kolibri am 4. Oktober noch nicht ohne Zusatzpatches laden.
Eine gehostete Variante bei einem Cloud-Anbieter ist in den gesichteten Quellen nicht angekündigt, bei OpenRouter war das Modell am 5. Oktober nicht gelistet. Preise für Unternehmenslösungen habe ich nirgends gefunden. Wer nur einmal hineinschnuppern will, ohne Server zu mieten, muss vorerst warten.
Aleph Alpha und Cohere: was die Fusion bedeutet
Parallel zum Modell läuft ein Firmenumbau. Aleph Alpha und das kanadische Unternehmen Cohere haben am 16. September einen verbindlichen Zusammenschluss vereinbart, nachdem sie ihn im April angekündigt hatten. Das gemeinsame Unternehmen soll Cohere heißen, mit zwei Hauptsitzen in Berlin und Toronto. Heidelberg bleibt als Forschungszentrum erhalten. Berichten zufolge liegt die Bewertung bei etwa 20 Milliarden Dollar, SiliconANGLE nennt die Zahl.
Die Schwarz Gruppe, Eigentümerin von Lidl und Kaufland und schon bisher Investorin bei Aleph Alpha, will laut The Next Web die Zusammenarbeit ausweiten, um souveräne KI über ihre Cloud STACKIT anzubieten. Der Abschluss wird für Ende 2026 erwartet und braucht noch die Zustimmung der Behörden. Bis dahin arbeitet Aleph Alpha nach eigener Aussage unabhängig weiter. Nach dem Abschluss soll Ilhan Scheer Cohere als Chief Operating Officer mitleiten, Samuel Weinbach als CRO.
Für Kolibri heißt das: Die Gewichte sind veröffentlicht und bleiben unter Apache 2.0 nutzbar, was auch immer passiert. Offen ist, wie es mit Support, Weiterentwicklung und dem Namen Aleph Alpha weitergeht. Das ist meine Einschätzung, keine Ankündigung. Die Souveränitätsgeschichte bekommt dadurch eine Fußnote, denn wer langfristig plant, sollte wissen, dass der Anbieter bald einen anderen Namen und einen zweiten Hauptsitz in Kanada haben wird.
KI-Verordnung und Datenschutz mit Kolibri
Ein offenes Modell auf eigener Hardware löst eine Frage zuverlässig, nämlich wohin die Daten fließen: nirgendwohin. Die übrigen Fragen löst es nicht. Wer Kolibri in einer Anwendung einsetzt, trägt die Pflichten des Betreibers selbst, von der KI-Kompetenz der Mitarbeitenden bis zur Rechtsgrundlage für personenbezogene Daten. Welche Fristen und Pflichten gerade gelten, steht im Beitrag KI-Regeln 2026, und wie sich so etwas im Betrieb einführen lässt, im Beitrag KI im Unternehmen einführen.
Die Modellkarte rät außerdem selbst davon ab, Kolibri ohne menschliche Prüfung als alleinigen Entscheider in Umgebungen mit hohem Risiko einzusetzen. Das ist keine Rechtsberatung, sondern ein Hinweis, die Anwendung auf Papier durchzugehen, bevor man das Modell installiert.
Häufige Fragen zu Kolibri
Was kostet Kolibri?
Die Gewichte sind kostenlos, die Lizenz ist Apache 2.0. Kosten entstehen für Hardware und Betrieb. Preise für Unternehmenslösungen veröffentlicht Aleph Alpha nicht, und eine gehostete Schnittstelle mit Preisliste gab es nach den gesichteten Quellen am 5. Oktober noch nicht.
Kann ich Kolibri wie ChatGPT im Browser nutzen?
In keiner der gesichteten Quellen ist ein öffentlicher Chatzugang genannt. Kolibri ist ein Modell zum Selbstbetreiben, kein fertiger Dienst.
Ist Kolibri Open Source?
Genauer: Open-Weight. Die Gewichte sind offen und unter Apache 2.0 nutzbar, Trainingscode und Entwicklungsprozess sind es nicht.
Ist Kolibri besser als ChatGPT, Qwen oder Mistral?
Gegen ChatGPT lässt es sich nicht sinnvoll messen, denn das ist ein Dienst auf Basis großer Cloud-Modelle, mehr dazu im Beitrag ChatGPT-Modelle erklärt. Aleph Alpha vergleicht Kolibri mit offenen Modellen wie Nemotron, Mistral Small und Qwen. In Mathematik und beim Schlussfolgern liegt es dort vorn, bei Faktenwissen, Gesamtdurchschnitt und langen Agentenabläufen eher hinten.
Welche Sprachen kann Kolibri?
Deutsch und Englisch, dazu Programmcode. Weitere Sprachen sind nicht das Ziel des Trainings.
Wo ich unsicher bin
Drei Dinge sind offen. Erstens fehlen unabhängige Tests, vorliegen bisher nur Herstellerzahlen und erste Einordnungen. Zweitens ist unklar, wie sich die Fusion mit Cohere auf Angebot und Support auswirkt. Drittens bewegt sich der Markt so schnell, dass ein Modell, das heute in einer Nische gut dasteht, in drei Monaten überholt sein kann. Stand dieser Recherche ist der 7. Oktober 2026.
Mein Eindruck: Kolibri ist kein Modell für alle, aber ein belastbares Argument dafür, dass es die deutsche Option überhaupt gibt. Für Behörden und Industrie, die ihre Daten nicht aus der Hand geben dürfen, ist das viel. Für alle anderen bleibt es erst einmal etwas zum Beobachten.
Quellen und weiterführende Links
- Aleph Alpha: Produktseite Kolibri
- Aleph Alpha: Launch-Beitrag Kolibri Has Landed
- Aleph Alpha: Pressemitteilung vom 5. Oktober
- Aleph Alpha: Technischer Bericht als PDF
- Hugging Face: Modellkarte Kolibri-1
- DataCamp: Unabhängige Analyse von Kolibri 1
- ki-erz.de: Einordnung zu Kolibri
- Trending Topics: Kritik an Kolibri
- Hardwareluxx: Bericht zur Veröffentlichung
- The Next Web: Cohere und Aleph Alpha unterzeichnen
- arXiv: Merlin-Arthur-Protokoll gegen Halluzinationen

