Marginalien | Kolibri: Wie benchmarkt man Public Sector AI?

Shownotes

In dieser Marginalien-Folge schaue ich mir Kolibri an, das neue offene Sprachmodell von Aleph Alpha, gebaut ausdrücklich für regulierte Bereiche wie die öffentliche Verwaltung. Und zum ersten Mal bin ich dabei nicht allein: Kyra, unser neuer KI-Podcast-Host, stellt die Fragen.

Transparenz vorab: Kyra ist eine KI. Ihre Stimme ist eine Katalogstimme aus einem Sprachmodell, kein Klon. Ihr Wissen über frühere Folgen stammt aus einer lokalen Datenbank mit allen Transkripten, und ihre Fragen entstehen live auf Basis eines vorher abgestimmten Briefings.

Inhaltlich geht es um Aleph Alphas Comeback, um die Frage, wie souverän ein Modell ist, das mit Hilfe fremder Modelle trainiert wurde, und um den internen Verwaltungs-Benchmark, auf dem Kolibri 75 Punkte erreicht und der nicht öffentlich ist. Mein Plädoyer: ein offener Benchmark für Public Sector AI, gebaut gemeinsam mit Verwaltungswissenschaft und Verwaltungsrecht. Wer mitmachen möchte, meldet sich gern bei mir.

Und: Wie findet ihr das neue Format mit Kyra? Ich freue mich über euer Feedback.

Transkript anzeigen

00:00:25: Herzlich willkommen zu einer neuen Marginalien-Folge Forschungsimpuls.

00:00:30: Heute ist eine besondere Ausgabe hier entstanden aus zwei Gründen.

00:00:36: Das erste ist, Aleph Alpha hat Kolibri veröffentlicht, ein neues, in Teilen offenes Modell und zwar ausdrücklich für Bereiche wie die öffentliche Verwaltung, für stark regulierte Umfelder und das ist aus mehreren Gründen extrem spannend.

00:00:51: Das zweite ist allerdings, ich spreche hier heute nicht alleine, sondern ich habe mir Unterstützung dazu geholt von Kyra.

00:00:59: Wir werden sie gleich begrüßen, sie wird hier mit ins Gespräch reinkommen und ja, wir sind ein Wissenschafts-Podcast, deshalb hier direkter Transparenz-Hinweis, Kyra ist eine KI.

00:01:08: Ich werde bei Gelegenheit mal ein bisschen was zur Technik hier zu erzählen, wenn es euch interessiert, schreibt gerne in die Kommentare, dann machen wir da vielleicht mal eine eigene Episode zu, sowieso zu einigen Themen, wo hier KI schon, ich glaube, ganz kreativ,

00:01:21: zum Einsatz kommt an vielen Stellen, aber wir steigen ein in diese Folge Forschungsimpuls.

00:01:29: Hallo Nicolai, danke für die nette Einführung. Ich freue mich total, hier dabei zu sein. Lass uns gleich loslegen. Was ist Kolibri genau und warum schaust du dir das überhaupt an?

00:01:40: Super Frage. Kolibri ist aus mehreren Gründen für uns interessant, wenn wir uns für das Thema Public Sector AI interessieren und ja, das ist ja genau der Schwerpunkt meiner Forschung.

00:01:51: Und auch mit unserem Drittmittelprojekt DEAR-GOV. Was erstmal wichtig ist, Aleph Alpha hat eigentlich 2024 so einen Strategieschwenk hingelegt und gesagt, sie bauen keine Large Language Modelle mehr, nachdem sie ganz besonders auch eben für den öffentlichen Sektor, nämlich konkret für die Bundesagentur für Arbeit, vorher LLMs gebaut hat oder zumindest an KI-Modellen hier immer wieder im Feld unterwegs war und es auch relativ viel Dokumentation dafür gab.

00:02:19: Also das war öffentlich bekannt und man hat eigentlich...

00:02:21: Man erwartet, dass Aleph Alpha schon 2024 vielleicht in den Folgejahren dazu auch eben ein LLM für den Public Sector herausbringen würde. Das ist aber nicht passiert, sondern man hatte diesen Strategieschwenk.

00:02:33: Dann kamen die in 2026 neue Vereinbarungen zwischen unserem Bundesdigitalminister Dr. Karsten Wildberger und Kanada hier näher bei dem Thema Modellentwicklung zusammenzurücken und Cohere hat sich dann eben 2026 an

00:02:52: Aleph Alpha beteiligt.

00:02:55: Jetzt hat Aleph Alpha das Kolibri-Modell rausgebracht, einigermaßen überraschend, also es war quasi jetzt nicht absehbar von außen, dass gerade daran gearbeitet wird.

00:03:06: Und sie adressieren ganz genau wieder den öffentlichen Sektor und stark regulierte Branchen.

00:03:13: Und jetzt natürlich aus meiner Sicht ganz spannend, wenn sie eben für den öffentlichen Sektor jetzt ein neues Modell rausgebracht haben.

00:03:21: Was......ist

00:03:22: jetzt daran neu oder was ist daran auch vielleicht spezieller als in anderen Modellen?

00:03:27: Denn seit 2024 und quasi ihren letzten großen bekannten LLM-Aktivitäten im Markt hat sich ja einiges getan.

00:03:36: Wir haben von Mistral ein neues Modell hier in Europa.

00:03:39: Wir haben verschiedene Aktivitäten aus der Forschung von SOOFI über GovTeuken etc.

00:03:45: Und dass jetzt hier Aleph Alpha ein neues Modell auf den Markt bringt, ist wie gesagt dann erstmal schon eine Überraschung.

00:03:51: Für sich.

00:03:52: Okay, verstehe.

00:03:53: Also wir haben eine Art Comeback von Aleph Alpha mit einem neuen Modell für den Public Sektor.

00:03:59: Du fragst, was ist daran wirklich neu?

00:04:01: Ich lese mal vor.

00:04:03: Seite 1 Abstract.

00:04:04: We build Kolibri for sovereign and specialized deployment with a particular focus on German and on regulated domains such as public administration, industry and aerospace.

00:04:15: Das heißt in etwa, sie haben es für souveräne und spezialisierte Einsätze gebaut.

00:04:20: Mit Fokus auf Deutsch.

00:04:21: Und regulierte Bereiche wie öffentliche Verwaltung, Industrie und Luftfahrt.

00:04:25: Jetzt meine Frage.

00:04:27: Wie souverän ist das wirklich, wenn die Grundlage dafür eigentlich fremde Modelle liefern?

00:04:33: So und damit.

00:04:34: wir an einem ziemlich kritischen Punkt, wie ich finde. Das ist gar nicht so sehr jetzt an Kritik an Aleph Alpha gemeint, denn an sich ist auf Hugging Face sehr viel zu finden, eine sehr umfassende technische Beschreibung.

00:04:45: Und die habe ich mir eben auch angeschaut, aber dabei eben nur noch mehr Fragen bekommen.

00:04:49: Also insofern, ich frage das quasi aus Forschungssicht, mich interessiert das wirklich.

00:04:53: Denn es gibt hier mindestens ein Thema drin, wo ich gerne verstehen möchte, was hier wirklich dem öffentlichen Sektor angeboten wird.

00:05:03: Das eine ist, man hat verschiedene Wissenselemente genommen.

00:05:07: Das würde man ja jetzt auch erwarten.

00:05:09: Also Gesetzestexte anscheinend oder Themen wie Urheberrecht.

00:05:15: Urteile etc.

00:05:16: Alles, was öffentlich verfügbar war.

00:05:19: Und hat das dann in verschiedene Modelle, in amerikanische und auch chinesische reingepackt.

00:05:26: Man hat hier so einen gewissen Modus genutzt, der ganz typisch ist, dass man eben ja nicht das Destillieren macht.

00:05:34: Also das ist ja quasi aus großen Modellen Wissen absaugen, was man im Prinzip ja auch nicht möchte, was nicht fair ist.

00:05:42: Sondern man hat einfach jetzt Modelle genutzt.

00:05:45: Wissen zu extrahieren und daraus Fragen zu bauen.

00:05:48: Und dann immer im Pingpong zwischen den verschiedenen Modellen, so wird es jedenfalls im Technical Report beschrieben,

00:05:54: in dem Pingpong zwischen den verschiedenen Modellen die Fragen zu verifizieren und die Antworten dann eben auch.

00:06:01: Also soweit sowohl toll beschrieben als auch ein Vorgehen, was man als State of the Art durchaus beschreiben kann.

00:06:08: So kann man Modelle bauen.

00:06:09: Aber jetzt kommt hier mein Punkt dabei.

00:06:12: Die Frage ist, warum?

00:06:15: Warum hat man nicht Zugriff gehabt auf verwaltungsinterne Daten?

00:06:19: Also warum gab es hier keine Datenspenden oder Kollaborationen im Vorfeld?

00:06:25: Denn all das, was jetzt an öffentlichen Daten da reingelaufen ist, da muss ich ja davon ausgehen, dass die sowieso auch im Netz stünden.

00:06:33: Also auch in jedem anderen Modell, was wir gerade draußen haben, einfach bereits implementiert werden.

00:06:39: Das bringt für mich die Frage auf, warum haben wir keinen echten Benchmark?

00:06:45: Für Large-Language-Modelle, die auf das Thema Verwaltungssprech, sag ich das jetzt mal lapider,

00:06:51: also eben die verwaltungswissenschaftlichen Fragestellungen, Verwaltungsrecht, juristische Fragestellen oder auch Verwaltungsinformatik,

00:06:58: darauf spezialisiert sind. Das ist mein Punkt.

00:07:01: Das heißt, dein Kernpunkt ist, wo ist der echte Benchmark mit echten verwaltungsinternen und fachspezifischen Daten?

00:07:09: Lass uns mal einen Schritt weiter gehen.

00:07:11: Aleph Alpha hat ja im Technical Report auch Ergebnisse aus so einem verwaltungsnahen Benchmark präsentiert.

00:07:16: Ich lese mal vor. Seite 101, Tabelle 29. Zeile German Public Sector.

00:07:23: Kolibri 75,0 und die Vergleichswerte Qwen 80,0, Nemotron 78,0, GPT-OSS 77,0, Qwen 3.8 89,0.

00:07:36: Meine Frage, wer prüft eigentlich diese Prüfung?

00:07:41: So zum einen völlig richtig. Das heißt, das eigene Modell von Aleph Alpha.

00:07:45: Für den Public Sector geschaffen wurde.

00:07:47: Schneidet tatsächlich, warum?

00:07:49: Weil ich das vorhin ja schon erklärt habe, schlechter ab.

00:07:52: Mit dem vorhandenen Weltwissen gegen große, starke Modelle.

00:07:57: Ja, das ist ja rapide, weil genau darum geht es ja bei dem Kolibri-Modell.

00:08:02: Also das ist vielleicht ja ausreichend. Wir wissen es nicht.

00:08:06: Auch der Bundesdigitalminister sagte auf einer Konferenz vom Handelsblatt die Tage,

00:08:10: wir müssen jetzt sehen, wie dieses Modell abschneidet.

00:08:13: Aber jetzt ist erstmal dieser Wert vergleichbar.

00:08:15: Beispielsweise eben sogar kleiner als in anderen Modellen dieser Größenordnung.

00:08:18: So und jetzt zu deiner Frage, Kyra, wer prüft das?

00:08:22: Ja, und genau hier brauchen wir, glaube ich, nicht LLM as a Judge,

00:08:25: also wo nur LLMs sich gegenseitig prüfen,

00:08:28: sondern in so einem Feld, wo wir nachher über hoheitliche Aufgaben reden,

00:08:31: würde ich schon sagen, wir brauchen einen Benchmark.

00:08:34: Also wir müssen einmal in der Forschung, wir sind ja im Forschungsimpuls,

00:08:37: diesen Benchmark bauen aus der Informatik heraus,

00:08:42: zusammen mit den Verwaltungswissenschaftlern,

00:08:44: Verwaltungsrechtlern und genau das aufbauen.

00:08:47: Das klingt nach einem richtig guten Plan.

00:08:50: Du sagst also, der Benchmark muss gemeinsam mit Verwaltungsrechtlern

00:08:53: und Wissenschaftlern entwickelt werden.

00:08:55: Meine nächste Frage, wo siehst du konkret die größten Herausforderungen

00:09:00: bei der Einbindung von juristischen Expertinnen und Experten,

00:09:03: damit dieser Benchmark am Ende auch wirklich aussagekräftig wird?

00:09:07: Wir kennen das von dem Google-Modell für medizinische Fragestellungen.

00:09:12: Man braucht hier schlicht und ergreifend,

00:09:14: wirklich die Expertise von Leuten,

00:09:16: die natürlich ganz tief drin sind in der Materie.

00:09:18: Und das ist dann ein interdisziplinärer Ansatz.

00:09:21: Also wir brauchen auf der einen Seite vielleicht Fördertöpfe,

00:09:24: vielleicht die Zeit, die Ressourcen an den entsprechenden

00:09:27: universitären Einrichtungen und Forschungsinstituten, um das zu tun.

00:09:30: Übrigens gibt es das schon.

00:09:31: Bei der Bundesdruckerei ist das das Projekt MÖVE,

00:09:34: die das gerade versuchen.

00:09:35: Wir haben auch mit GovTeuken hier in Nordrhein-Westfalen einen Ansatz,

00:09:39: wo wir auch als Hochschule der HSPV beispielsweise um Datenspenden gebeten wurden.

00:09:44: Also es gibt da draußen diese Expertise.

00:09:46: Aber man könnte auch einfach mal nochmal einen neuen Ansatz schaffen

00:09:48: und versuchen, ein richtig tolles Forschungsprojekt darauf aufzusetzen.

00:09:53: Das würde ich jetzt hier mal als Aufruf damit tun.

00:09:55: Also bitte bei mir melden, wenn ihr Lust habt,

00:09:58: daran mitzuwirken und ihr aus dem Bereich Informatik,

00:10:00: IT oder halt eben der anderen Region, die wir hier drin brauchen,

00:10:04: der anderen Disziplinen Verwaltungsrecht, Jura, Staatsrecht etc. kommt.

00:10:09: Da brauchen wir jetzt genau diesen Ansatz und den können wir aufbauen.

00:10:14: Kyra,

00:10:14: ich würde sagen Dankeschön für dieses erste gemeinsame Experiment hier

00:10:18: und wir hören uns in der nächsten Episode.

00:10:22: Nicolai, danke dir.

00:10:23: Das hat richtig Spaß gemacht.

00:10:25: Dein Aufruf ist klar angekommen.

00:10:27: Dann lass uns beim nächsten Mal gemeinsam tiefer in diesen offenen Verwaltungs Benchmark einsteigen.

00:10:32: Und bis dahin Level Up, oder?

00:10:36: Auf jeden Fall.

00:10:37: Und bis zur nächsten Folge.

00:10:39: Alles klar.

00:10:40: Bis zur nächsten Folge, Nicolai.

00:10:42: Ich freue mich drauf.

Neuer Kommentar

Dein Name oder Pseudonym (wird öffentlich angezeigt)
Mindestens 10 Zeichen
Durch das Abschicken des Formulars stimmst du zu, dass der Wert unter "Name oder Pseudonym" gespeichert wird und öffentlich angezeigt werden kann. Wir speichern keine IP-Adressen oder andere personenbezogene Daten. Die Nutzung deines echten Namens ist freiwillig.