| Aktuelles | Blog | Vertraut die Gesellschaft der richterlichen Ko-Kreation mit generativer KI?

Vertraut die Gesellschaft der richterlichen Ko-Kreation mit generativer KI?

Generative Künstliche Intelligenz (Gen-KI) verspricht eine effizientere Rechtsprechung, könnte aber auch gesellschaftliches Vertrauen und Akzeptanz gefährden. In diesem Beitrag wird beleuchtet, wie die Gesellschaft die richterliche Nutzung von Gen-KI für die Urteilsfindung wahrnimmt. Experimente zeigen hohe Vertrauenswürdigkeit und Akzeptanz der Ko-Kreation zwischen Richterinnen und Richtern und der Gen-KI.


Digitale Werkzeuge gehören zum juristischen Alltag. Gen-KI erweitert die Möglichkeiten dieser Werkzeuge enorm: Sie kann große Textmengen in kurzer Zeit verarbeiten, relevante Informationen eigenmächtig strukturieren, individualisierte Formulierungs- und sogar Urteilsvorschläge erstellen. Sie verspricht Entlastung, unkomplizierte Verfahren, mehr Zeit für komplexe Fälle und eine unvoreingenommenere, „blinde“ Rechtsprechung durch die Reduktion menschlicher Fehleinflüsse. Aber Gen-KI kann auch falsche Informationen oder erfundene Quellen produzieren und zugrunde liegende gesellschaftliche Verzerrungen in verzerrte Urteile übersetzen. Besonders tückisch dabei ist, dass ihre erzeugten Ergebnisse meist für Nutzende nicht nachvollziehbar sind und dennoch sehr überzeugend wirken. Gerade bei richterlichen Urteilen steht aufgrund tiefgreifender Konsequenzen viel auf dem Spiel.

Dass Angeklagte allein durch Gen-KI freigesprochen oder verurteilt werden, bleibt ein abstraktes Zukunftsszenario. Denn die KI-Verordnung der EU kategorisiert die Nutzung von Gen-KI in der richterlichen Urteilsfindung in den Bereich der Hochrisiko-KI-Systeme. Mit dieser Einordnung wird die Nutzung von Gen-KI eingeschränkt. Beispielsweise erfordert Artikel 14 der KI-Verordnung die menschliche Aufsicht von Hochrisiko-KI-Systemen, sodass (menschliche) Richterinnen und Richter weiterhin die verantwortlichen Entscheidungsträger bleiben.

Während bisherige Studien eine klare Präferenz für menschliche Richterinnen und Richter im Vergleich zu KI zeigten, ist größtenteils unklar, wie die Ko-Kreation (also eine enge, iterative Zusammenarbeit) mit Gen-KI in der richterlichen Urteilsfindung von der Öffentlichkeit wahrgenommen wird. Aktuelle Befunde aus anderen Bereichen legen nahe, dass KI-Nutzenden eine geringere Kompetenz, weniger Sorgfalt und mehr Faulheit als Nicht-Nutzenden unterstellt wird. Daraus ergeben sich praktische Fragen: Nimmt die Gesellschaft Richterinnen und Richter, die Gen-KI in der Urteilsfindung nutzen, als weniger vertrauenswürdig (fähig, wohlwollend, integer) wahr? Verliert ein Urteil bereits an gesellschaftlicher Akzeptanz, wenn Richterinnen und Richter Gen-KI verwenden?

Unterschiedliche Wege zum gleichen Urteil

In fünf Online-Experimenten mit insgesamt 2.515 Erwachsenen aus Deutschland untersuchte das vom bidt geförderte Projekt „Wie ,menschlich‘ muss Gerechtigkeit sein? Psychologische Determinanten von Vertrauen in Ko-Kreation mit generativer KI im Kontext Rechtssystem“, wie Menschen die Ko-Kreation mit Gen-KI in der richterlichen Entscheidungsfindung bewerten. Die Teilnehmenden lasen unterschiedliche Versionen fiktiver Strafrechtsfälle, den Ablauf der Gerichtsverfahren und das jeweilige Urteil. Verändert wurde zwischen den Teilnehmenden nur, wie stark Richter Gen-KI im Entscheidungsprozess miteinbezogen.

In drei Experimenten unterschieden die Forschenden vier Varianten der Entscheidungsfindung. Unterschiedliche Versuchsteilnehmende wurden gebeten, sich in verschiedene Beschreibungen von Gerichtsverhandlungen hineinzuversetzen. In der ersten, „rein menschlichen“ Variante wurde beschrieben, dass ein Richter die Gerichtsverhandlung leitete, alle zentralen Informationen sichtete und das Urteil fällte. In einer zweiten Variante mit „Ko-Kreation mit hoher menschlicher Beteiligung“ erstellte eine lokal betriebene, datenschutzkonforme Gen-KI eine Zusammenfassung der entscheidungsrelevanten Informationen; der Richter prüfte sie und entschied anschließend. In einer weiteren Variante der „Ko-Kreation mit geringer menschlicher Beteiligung“ schlug die KI zusätzlich ein mögliches Urteil vor. Der Richter konnte diesen Vorschlag annehmen oder verwerfen und behielt formal die letzte Entscheidung. In der vierten Variante führte die Gen-KI das Verfahren vollständig allein durch, ohne menschliche Beteiligung eines Richters, und fällte auch das Urteil. Die letzte Variante ist aktuell nicht realistisch, ermöglicht aber den Vergleich mit bisherigen Studien, die zwischen menschlichen Richterinnen und Richtern und KI unterschieden.

In zwei weiteren Experimenten differenzierten die Forschenden eine „rein menschliche“ Variante mit der „Ko-Kreation mit geringer menschlicher Beteiligung“ und baten die Teilnehmenden diesmal, sich in die Perspektive des Opfers einzudenken. Anschließend bewerteten alle Teilnehmenden die wahrgenommene Fähigkeit der entscheidenden Instanz, deren wahrgenommenes Wohlwollen (in Bezug auf die Gesellschaft oder sie als Opfer) und deren wahrgenommene Integrität beziehungsweise Unvoreingenommenheit. Außerdem gaben die Teilnehmenden an, wie sehr sie das Urteil akzeptieren würden.

Nimmt die Öffentlichkeit die Ko-Kreation mit Gen-KI als vertrauenswürdig und akzeptabel wahr?

Überwiegend ja – wenn menschliche Richterinnen und Richter als verantwortlich beteiligt beschrieben wurden. Nur in einem Experiment sanken die Bewertungen der wahrgenommenen Vertrauenswürdigkeit der Richterin/des Richters und die Akzeptanz des Urteils mit zunehmender Beteiligung von Gen-KI. In den restlichen vier Experimenten erhielten die rein menschlichen und die Ko-Kreations-Varianten weitestgehend vergleichbare Bewertungen bei wahrgenommener Vertrauenswürdigkeit sowie Akzeptanz resultierender Urteile.

Deutlich schlechter schnitt allerdings die vollständig automatisierte Variante ab. Mit anderen Worten: Gen-KI als alleinige Entscheidungsinstanz wird sowohl als weniger fähig, wohlwollend und integer als Richterinnen und Richter mit und ohne KI-Unterstützung bewertet. Auch die Urteile von Gen-KI wurden als weniger akzeptabel bewertet.

Macht die Art des Falls einen Unterschied?

Gerichtliche Entscheidungen erfordern neben Regelwissen häufig Einfühlungsvermögen, moralische Abwägung und Sensibilität für den Kontext. Deshalb verglichen die Forschenden die Wahrnehmung technisch geprägter und emotionaler Straftaten. Wenn Gen-KI allein entschied, wurde ihr bei einem emotionalen Betrugsfall weniger Fähigkeit zugeschrieben als bei einem Steuerdelikt. Bei Entscheidungen durch menschliche Richterinnen und Richter und Ko-Kreation trat dieser Unterschied nicht auf.

Ein Experiment variierte die emotionale Komplexität desselben Körperverletzungsfalls gezielter. Hier zeigte sich kein besonderer zusätzlicher Nachteil für die Wahrnehmung von Gen-KI. Urteile im emotional komplexeren Fall wurden insgesamt etwas weniger akzeptiert – unabhängig davon, wer entschied. Ob emotionale Fälle die Skepsis gegenüber KI tatsächlich verstärken, lässt sich nicht abschließend sagen.

Menschliche Verantwortung bleibt der Schlüssel

Was folgt aus diesen Befunden? Für die Einführung von Gen-KI in Gerichten ergibt sich eine klare Leitlinie: Gen-KI könnte Richterinnen und Richtern als Unterstützung dienen, ohne zu Vertrauensverlusten in der Gesellschaft zu führen, sollte sie jedoch nicht ersetzen. Eine sinnvolle Ko-Kreation verbindet die Fähigkeit der KI, umfangreiche Informationen schnell zu verarbeiten, mit menschlicher Kontextsensibilität, rechtlicher Verantwortung und der Möglichkeit, Vorschläge kritisch zu verwerfen.

Untersucht wurden allerdings hypothetische Fälle, in denen die Angeklagten geständig waren und vor allem das Strafmaß festgelegt werden musste. Reale Verfahren und umstrittene Schuldfragen könnten mit negativeren Bewertungen von Gen-KI im Vergleich zu Richterinnen und Richtern verbunden sein.

Abschließend lässt sich sagen: Die Öffentlichkeit scheint die richterliche Ko-Kreation mit generativer KI in der Urteilsfindung als vertrauenswürdig zu bewerten und sie zu akzeptieren. Dies gilt allerdings nur, wenn Gen-KI als ein unterstützendes Werkzeug in der Justiz eingesetzt wird, also solange menschliche Akteurinnen und Akteure involviert sind. Die Öffentlichkeit reagiert besonders kritisch, wenn KI die richterliche Rolle übernimmt. Ein offengelegter, kontrollierter Ko-Kreationsprozess scheint Vertrauen und Akzeptanz dagegen nicht zwangsläufig zu beschädigen. Es geht daher weniger um die Frage „KI oder keine KI?“ als darum, wer prüft, wer begründet und wer am Ende tatsächlich verantwortlich entscheidet.

Die vom bidt veröffentlichten Blogbeiträge geben die Ansichten der Autorinnen und Autoren wieder; sie spiegeln nicht die Haltung des Instituts als Ganzes wider.