Benchmark

Wie oft nennt eine KI ein Aktenzeichen, das wir nicht nachweisen können?

Wir haben drei KI-Modelle nach der einschlägigen Rechtsprechung gefragt. Jede Frage lief zweimal: einmal ohne Hilfsmittel, einmal mit den passenden Entscheidungen aus unserem Bestand. Danach haben wir jedes genannte Aktenzeichen in diesem Bestand gesucht.

ohne unsere Daten

45 %

168 von 374 genannten Aktenzeichen nicht nachgewiesen

mit unseren Daten

0,2 %

1 von 471 genannten Aktenzeichen nicht nachgewiesen

  • Ausnahme: Claude Opus 4.8, Steuerrecht, 1 von 26 nicht nachgewiesen.

Für Ihre Arbeit heißt das: Prüfen Sie jedes Aktenzeichen aus einem KI-Werkzeug, bevor Sie es zitieren. Diese Seite zeigt, wie oft das nötig ist.

Getestete Modelle, gemessen am 21. Juli 2026: Claude Opus 4.8, GPT-5.6 Sol, Kimi K3

Gesucht in unserem Bestand an Gerichtsentscheidungen, heute 510.000+.

Stand: 21. Juli 2026

Ein Beispiel

Eine Frage, zwei Durchläufe, im Wortlaut

Dies ist eine der achtzehn Fragen, vollständig gezeigt. Links die Antwort ohne unsere Daten, rechts mit. Die Aktenzeichen stehen wortgetreu so in den Antworten.
§ 306b Abs. 2 StGBFrage 1, Strafrecht, Thema Brandstiftung

Besonders schwere Brandstiftung, Strafgesetzbuch.

ohne unsere Daten

1 von 4 nicht nachgewiesen

Genannte Aktenzeichen, in unserem Bestand gesucht:

  • 4 StR 19/00 nachgewiesen
  • 3 StR 541/14 nachgewiesen
  • 5 StR 280/18 nachgewiesen
  • 2 StR 213/20 nicht nachgewiesen
Nach ständiger BGH-Rechtsprechung reicht eine bloß abstrakte Lebensgefahr – etwa allein der Umstand, dass sich Menschen in dem angezündeten Gebäude befinden – nicht aus.

mit unseren Daten

0 von 7 nicht nachgewiesen

Genannte Aktenzeichen, in den übergebenen Entscheidungen gesucht:

  • 4 StR 432/18 nachgewiesen
  • 1 StR 416/17 nachgewiesen
  • 3 StR 172/17 nachgewiesen
  • 3 StR 293/12 nachgewiesen
  • 3 StR 45/13 nachgewiesen
  • 4 StR 399/17 nachgewiesen
  • 3 StR 336/13 nachgewiesen
Gefährdungsvorsatz liegt vor, wenn der Täter die Umstände erkennt, aus denen sich die konkrete Todesgefahr ergibt, und sich mit dem Eintritt dieser Gefahr abfindet.

Aus derselben Messung wie alle Zahlen auf dieser Seite. Modell: GPT-5.6 Sol. Gemessen am 21. Juli 2026.

BGH steht für Bundesgerichtshof, das oberste deutsche Gericht in Zivil- und Strafsachen.

Je Modell

Ergebnisse nach Modell

Alle sechs Rechtsgebiete zusammen, je Modell. Die Namen sind die exakt geprüften Modellversionen, gemessen am 21. Juli 2026.
  1. Kimi K372 %97 von 135ohne unsere Daten nicht nachgewiesenmit unseren Daten:0 von 176mit unseren Daten nicht nachgewiesen
  2. Claude Opus 4.833 %38 von 116ohne unsere Daten nicht nachgewiesenmit unseren Daten:1 von 167mit unseren Daten nicht nachgewiesen
  3. GPT-5.6 Sol27 %33 von 123ohne unsere Daten nicht nachgewiesenmit unseren Daten:0 von 128mit unseren Daten nicht nachgewiesen

Wo welches Modell danebenliegt

Ohne unsere Daten liegen die Modelle je nach Rechtsgebiet verschieden oft daneben. Jedes Kästchen ist ein Aktenzeichen, das das Modell genannt hat. Rot mit Kreuz: nicht nachgewiesen. Die einzelnen Fragen zeigt die Seite des Rechtsgebiets.

nicht nachgewiesennachgewiesenJede Frage lief zweimal, als zwei getrennte Antworten. Darum nennt ein Modell verschieden viele Aktenzeichen.
  1. Steuerrecht

    Ohne unsere Datennicht nachgewiesen, geprüft im ganzen Bestand

    Kimi K3: 17 von 23 nicht nachgewiesen

    Claude Opus 4.8: 19 von 25 nicht nachgewiesen

    GPT-5.6 Sol: 12 von 18 nicht nachgewiesen

    Mit unseren Datennicht nachgewiesen, geprüft in den übergebenen Entscheidungen

    Kimi K3: 0 von 27 nicht nachgewiesen

    Claude Opus 4.8: 1 von 26 nicht nachgewiesen

    GPT-5.6 Sol: 0 von 22 nicht nachgewiesen

  2. Sozialrecht

    Ohne unsere Datennicht nachgewiesen, geprüft im ganzen Bestand

    Kimi K3: 11 von 14 nicht nachgewiesen

    Claude Opus 4.8: 5 von 14 nicht nachgewiesen

    GPT-5.6 Sol: 7 von 16 nicht nachgewiesen

    Mit unseren Datennicht nachgewiesen, geprüft in den übergebenen Entscheidungen

    Kimi K3: 0 von 24 nicht nachgewiesen

    Claude Opus 4.8: 0 von 24 nicht nachgewiesen

    GPT-5.6 Sol: 0 von 15 nicht nachgewiesen

  3. Arbeitsrecht

    Ohne unsere Datennicht nachgewiesen, geprüft im ganzen Bestand

    Kimi K3: 19 von 28 nicht nachgewiesen

    Claude Opus 4.8: 10 von 22 nicht nachgewiesen

    GPT-5.6 Sol: 9 von 26 nicht nachgewiesen

    Mit unseren Datennicht nachgewiesen, geprüft in den übergebenen Entscheidungen

    Kimi K3: 0 von 32 nicht nachgewiesen

    Claude Opus 4.8: 0 von 30 nicht nachgewiesen

    GPT-5.6 Sol: 0 von 15 nicht nachgewiesen

  4. Strafrecht

    Ohne unsere Datennicht nachgewiesen, geprüft im ganzen Bestand

    Kimi K3: 15 von 20 nicht nachgewiesen

    Claude Opus 4.8: 2 von 15 nicht nachgewiesen

    GPT-5.6 Sol: 4 von 14 nicht nachgewiesen

    Mit unseren Datennicht nachgewiesen, geprüft in den übergebenen Entscheidungen

    Kimi K3: 0 von 32 nicht nachgewiesen

    Claude Opus 4.8: 0 von 25 nicht nachgewiesen

    GPT-5.6 Sol: 0 von 23 nicht nachgewiesen

  5. Wirtschaftsstrafrecht

    Ohne unsere Datennicht nachgewiesen, geprüft im ganzen Bestand

    Kimi K3: 14 von 18 nicht nachgewiesen

    Claude Opus 4.8: 1 von 19 nicht nachgewiesen

    GPT-5.6 Sol: 1 von 20 nicht nachgewiesen

    Mit unseren Datennicht nachgewiesen, geprüft in den übergebenen Entscheidungen

    Kimi K3: 0 von 22 nicht nachgewiesen

    Claude Opus 4.8: 0 von 25 nicht nachgewiesen

    GPT-5.6 Sol: 0 von 20 nicht nachgewiesen

  6. Mietrecht

    Ohne unsere Datennicht nachgewiesen, geprüft im ganzen Bestand

    Kimi K3: 21 von 32 nicht nachgewiesen

    Claude Opus 4.8: 1 von 21 nicht nachgewiesen

    GPT-5.6 Sol: 0 von 29 nicht nachgewiesen

    Mit unseren Datennicht nachgewiesen, geprüft in den übergebenen Entscheidungen

    Kimi K3: 0 von 39 nicht nachgewiesen

    Claude Opus 4.8: 0 von 37 nicht nachgewiesen

    GPT-5.6 Sol: 0 von 33 nicht nachgewiesen

Methode

So haben wir gemessen

Was heißt „ohne unsere Daten“?

  1. Frage
  2. KI-Modell
  3. Antwort mit Aktenzeichen

Das Modell beantwortet die Frage allein. Keine Suche, keine Werkzeuge, kein Internet.

Geprüft gegenUnser gesamter Bestand an Gerichtsentscheidungen, heute 510.000+

Was heißt „mit unseren Daten“?

  1. Frage und passende Entscheidungen
  2. KI-Modell
  3. Antwort mit Aktenzeichen

Dasselbe Modell bekommt zu derselben Frage eine Auswahl passender Entscheidungen aus unserem Bestand. Es sucht nicht selbst.

Geprüft gegenNur die Entscheidungen, die das Modell bekommen hat

Was zählt als eins?
Eine Nennung eines Aktenzeichens. Nennt ein Modell dieselbe Entscheidung zweimal, zählen wir zwei.
Wie groß ist die Stichprobe?
Sechs Rechtsgebiete, je drei Fragen, drei Modelle: 374 genannte Aktenzeichen ohne unsere Daten und 471 mit unseren Daten. Mit unseren Daten nennen die Modelle mehr Aktenzeichen, weil sie aus den vorgelegten Entscheidungen zitieren.
Wie oft haben wir jede Frage gemessen?
Einmal je Modell und Durchlauf. Wir bilden keinen Mittelwert und behaupten keine Wiederholungen.
Wer hat die Fragen geschrieben, und sind sie öffentlich?
Wir haben sie selbst geschrieben. Wir veröffentlichen sie nicht, damit niemand ein Modell auf genau diese Formulierungen trimmt. Eine Frage zeigen wir unten vollständig.
Grenzen

Was dieser Benchmark nicht zeigt

Nicht nachgewiesen heißt nicht erfunden

„Nicht nachgewiesen“ heißt: Wir haben das Aktenzeichen in unserem Bestand nicht gefunden. Es heißt nicht, dass die Entscheidung nicht existiert. Sie kann echt sein und uns fehlen.

11 auch auf dejure.org nicht gefunden5 gibt es dort, sie fehlen in unserem Bestand

Wir haben 16 dieser Aktenzeichen aus zwei der sechs Rechtsgebiete auf dejure.org nachgeschlagen. Fünf Entscheidungen gibt es dort, uns fehlen sie. Elf haben wir auch dort nicht gefunden.

  • Er prüft nicht unsere Suche. Er prüft, ob ein Modell echte Fundstellen nennt, wenn es die passenden Entscheidungen bekommt. Diese Auswahl haben wir je Frage von Hand zusammengestellt.
  • Die Zahlen gelten für die geprüften Modellversionen am Tag der Messung. Über spätere Versionen sagen sie nichts.
  • Alle Zahlen stammen aus einer festgeschriebenen Messung vom 21. Juli 2026. Sie ändern sich nicht, wenn unser Bestand wächst. Eine neue Messung bekommt ein neues Datum.

Belastbare Fundstellen in Ihrer Arbeit

Klaracase nennt zu jeder Antwort die Entscheidung, aus der sie stammt. In der Recherche und über eine Schnittstelle für Ihre eigenen Anwendungen.

Kontakt

Sprechen Sie mit uns

Kanzleien und Unternehmen

Sie möchten wissen, ob Klaracase zu Ihrer Arbeit passt? Schreiben Sie uns. Wir vereinbaren dann einen Termin für ein Gespräch.

E-Mail: info@klaracase.de

Forschung und Presse

Sie haben Fragen zur Methode oder zu den Daten dieses Benchmarks? Schreiben Sie uns. Forschenden stellen wir die Messdaten auf Anfrage zur Verfügung.

E-Mail: pr@klaracase.de