Frage von Sonja Lemke (DIE LINKE) mit Antwort – Schriftliche Antworten auf Fragen der Fragestunde (Drucksache 21/6835)
Teil von Protokoll der 88. Sitzung des 21. Deutschen Bundestages. Zu Protokoll gegeben (Anlage), nicht im Plenum gesprochen.
Text
Frage von Sonja Lemke (DIE LINKE) mit Antwort – Schriftliche Antworten auf Fragen der Fragestunde (Drucksache 21/6835)
Ist die Antwort der Bundesregierung auf meine schriftliche Frage 175, in der ich nach Maßnahmen der Qualitätsprüfung für KI-Agenten im Rahmen des Projekts SPARK gefragt hatte, Bundestagsdrucksache 21/5249, in der die Bundesregierung lediglich beschrieben hat, welche Aufgaben die KI-Agenten in dem Projekt übernehmen sollen, jedoch nach meinem Verständnis keinerlei Qualitätssicherungsmaßnahmen aufgeführt hat, so zu verstehen, dass eine strukturierte Qualitätsüberprüfung der Ergebnisse, die die KI-Agenten liefern, nicht vorgesehen ist, oder, falls dies nicht zutreffend ist, wie soll eine solche Qualitätsüberprüfung konkret gewährleistet werden?
Antwort des Parl. Staatssekretärs Thomas Jarzombek:
Die KI-Lösung erstellt nicht vollautomatisch einen fertigen Beschluss. Ihr Ziel ist, die Sachbearbeitenden durch den schnellen und nachvollziehbaren Zugang zu allen relevanten Rechtsnormen und Sachverhaltsinformationen bei allen Verfahrensschritten zu unterstützen. „Human-in-the-loop“ ist grundlegendes Design-Prinzip und auf einer für den Sachbearbeitenden zu jeder Zeit nachvollziehbaren Ebene umgesetzt.
Die grundsätzliche Qualitätssicherung durch SPARK erfolgt entlang folgender Guidelines:
Erstens: Technisch/inhaltliche Methoden zur Qualitätssicherung im Anwendungsdesign.
Zweitens: Bei der Implementierung in einen spezifischen Anwendungsfall.
Drittens: Kontinuierliche Evaluation in der Praxis.
Zu Erstens. Für die Konzeption und Entwicklung von SPARK wurden vorsorglich die Maßgaben der KI-Verordnung für Hochrisikosysteme analog angewendet. Dadurch ist gewährleistet, dass die Lösung auch in derartigen Anwendungsfällen ohne grundlegende Anpassungen nutzbar sein kann.
Innerhalb von SPARK sind qualitätssichernde Methoden funktionsübergreifend integriert. Die Qualitätssicherung in den Einzelschritten – dem Prinzip „divide and conquer“ folgend – stellt sicher, dass nicht aus kleinen Fehlern kulminierende größere Fehler entstehen, und gleichzeitig Zwischenergebnisse nachvollziehbar prüfbar sind. Beispielhaft wird bei dem Kernstück der Rechtsnormendekonstruktion die Rechtsnorm zunächst kategorisiert. Als materiell-rechtlich erkannte Normen werden daraufhin nach Sinn und Zweck analysiert, um initial Tatbestandsmerkmale und Rechtsfolgen zu erkennen. Anschließend findet eine strukturelle Analyse mit einer Mischung aus probalistischen KI-Funktionen und deterministischen Methoden statt, beispielsweise durch die Suche nach bestimmten Schlagwörtern im Normentext, die Rückschlüsse auf die Logik der Rechtsnorm geben (wie beispielsweise „Soll“, „Muss“ „Verbot“, „Wenn-dann“-Beziehungen etc.). In einem weiteren Zwischenschritt werden bestimmte Rechtsbegriffe aus der Rechtsnorm gesucht, für die im Gesetzestext an anderer Stelle entsprechende Begriffsdefinitionen vorliegen. Diese Suche erfolgt ebenfalls mit einem qualitätssichernden Methodenmix aus KI-Funktionen und deterministischen Methoden.
Alle beispielhaft beschriebenen Schritte werden systematisch protokolliert. Die Protokollierung umfasst sowohl die Interaktionen der Nutzenden mit den KI-Vorschlägen als auch das gesamte systeminterne Reasoning der KI-Modelle.
Die KI-Vorschläge werden dem Nutzenden transparent und besonders gekennzeichnet in der Benutzeroberfläche dargestellt, um eine Qualitätsprüfung im Sinne des „Human-in-the-loop“ zu ermöglichen. Das Ergebnis der vom Nutzenden validierten zerlegten Norm wird in einer Datenbank abgelegt und für dieselbe Norm so lange herangezogen, bis die Norm sich durch den Gesetzgeber ändert oder eine Sachbearbeitung manuell anders dekonstruiert. Hierdurch wird ausgeschlossen, dass die KI bei der Normendekonstruktion zu unterschiedlichen Ergebnissen kommt.
Analog zu diesem Vorgehen der Normenkonstruktion „clustert“ SPARK alle weiteren Teilprozessschritte (formale Vollständigkeitsprüfung, materielle Vollständigkeitsprüfung, Beteiligung der Träger öffentlicher Belange und der Öffentlichkeit, rechtliche Prüfung und Beschlusserstellung). Dahinter liegt ein versionierbares Datenmodell, in dem die Beziehung von rechtlichen Anforderungen zu den Sachverhaltsinformationen hergestellt wird. Das Datenmodell ist jederzeit einsehbar.
Zusätzlich wird der Beschlussentwurf über einen KI-gestützten Risikohinweisgeber („LLM-as-a-Judge“) erneut gesamthaft überprüft werden. Dieser Risikohinweisgeber weist den Sachbearbeitenden auf mögliche Fehler hin, beispielsweise mit Blick auf die Bestimmtheit, Argumentationssystematik oder Abwägungssorgfalt des Beschlussentwurfs. Alle Hinweise verweisen auf eine konkrete Textstelle, wobei die mögliche Anpassung durch den Sachbearbeitenden erfolgt.
Die fachliche Entwicklung der KI-Lösung wurde unter anderem durch die Expertise einer planfeststellenden Bundesbehörde begleitet. Zudem fand eine unabhängige technisch-fachliche Beratung durch das BSI und weitere spezialisierte Dienstleister statt. Ziel der Tests war, gezielt Fehlverhalten – beispielsweise durch Prompt-Injection – zu provozieren und bei Eintreten entsprechende Gegenmaßnahmen umzusetzen („Red-Teaming“).
Zu Zweitens. SPARK ist verfahrensagnostisch konzipiert und wird gerade in mehreren konkreten Anwendungsfällen pilotiert. Als Teil der Pilotierung und Implementierung wurden die relevanten Rechtsnormen für den Anwendungsfall konfiguriert und fachlich qualitätsgesichert. Weiterhin wurden beispielsweise durch die Pilotbehörden Listen mit typischen Verfahrensfehlern erstellt, die anschließend in der KI-Lösung getestet wurden. Sowohl in der Entwicklung (siehe 1) als auch in der Pilotierung und Implementierung wurden Goldstandard-Datensätze, das heißt, echte Verfahrensunterlagen, herangezogen, um die Ergebnisse fachlich zu evaluieren. Hierbei wurde sowohl auf behördeninterne Expertise als auch auf externe fachliche Einschätzungen zurückgegriffen. Der gesamte Entwicklungsprozess wurde zusätzlich fachjuristisch unabhängig begleitet.
Zu Drittens. Zentrales Prinzip der Implementierung von SPARK ist ein stufenweises Vorgehen, beginnend mit einzelnen Teilschritten und enger fachlicher Begleitung durch juristisch geschulte Mitarbeitende.
Über die Benutzeroberfläche können Nutzende zu jedem Zeitpunkt Feedback zu einzelnen KI-Vorschlägen geben; dieses führt nicht zu automatischem „Lernen“ der KI, sondern dient der fachlichen Evaluation und kontinuierlichen Verbesserung. Die ersten Pilotierungs- und Implementierungsprojekte laufen derzeit. Die Rückmeldungen aus diesen Projekten fließen laufend über strukturierte Monitoring-Prozesse in die Weiterentwicklung von SPARK ein und geben wichtige Impulse für die weitere Ausrichtung des Projektes.
Es werden aktuell ausschließen Open-Weight-Sprachmodelle eingesetzt. Entsprechend des hohen Innovationstempos in diesem Bereich evaluiert das Bundesministerium für Digitales und Staatsmodernisierung kontinuierlich die Leistungsfähigkeit der auf dem Markt vorhandenen Modelle. SPARK ist grundsätzlich verfahrensagnostisch konzipiert, alle Sprachmodelle sind flexibel austauschbar.
Relationen
- asked ← Sonja Lemke (Frage)
- part_of → Protokoll der 88. Sitzung des 21. Deutschen Bundestages