← Alle Beiträge
KI & Modelle

Legora prüft 41 Dokumente mit GPT‑6 Astra – und findet alle vier Fehler

In einem Finanzprüfungsszenario fand Legora alle vier absichtlich eingebauten Fehler innerhalb weniger Minuten. Die gemessene Leistung stieg dabei um knapp 40 Prozent.

7 Minuten Lesezeit
Im Beitrag OpenAI

Legora hat GPT‑6 Astra auf eine klar umrissene Aufgabe angesetzt: 41 Dokumente eines Finanzprüfungsszenarios mussten auf gezielt platzierte Unstimmigkeiten untersucht werden. Das System erledigte die Prüfung innerhalb weniger Minuten, identifizierte alle vier eingebauten Fehler und verbesserte die gemessene Leistung gegenüber dem vorherigen Stand um knapp 40 Prozent.

Das ist vor allem deshalb relevant, weil die Modellleistung hier nicht an einer isolierten Wissensfrage demonstriert wurde. Die Aufgabe verlangte, zahlreiche Dokumente nach einheitlichen Kriterien zu lesen, Informationen über den Bestand hinweg zu ordnen und konkrete Abweichungen zuverlässig sichtbar zu machen. Genau für solche dokumentintensiven Aufgaben bietet Legora eine spezialisierte Arbeitsumgebung.

41 DokumenteBelegte Fundstellen

Was an dem Versuch neu ist

Die wichtigste Neuerung liegt in der Kombination aus GPT‑6 Astra und einer Oberfläche, die auf umfangreiche Dokumentarbeit ausgerichtet ist. Ein starkes Modell allein löst noch nicht das Problem, 41 Dateien vergleichbar auszuwerten. Dafür müssen dieselben Fragen über den gesamten Bestand gestellt, Antworten geordnet und Fundstellen auffindbar gehalten werden.

Legoras Produktbeschreibung nennt juristische Recherche, Dokumentprüfung und Textentwürfe als zentrale Einsatzbereiche. Die Plattform ist außerdem auf Zusammenarbeit und die Einbindung von KI in bestehende fachliche Tätigkeiten ausgerichtet. Im gezeigten Finanzprüfungsszenario wird daraus eine konkrete Fähigkeit: Ein größerer Dokumentensatz lässt sich nach vorher definierten Auffälligkeiten durchsuchen, ohne jede Datei nacheinander manuell zu öffnen.

Das Ergebnis lässt sich in drei Zahlen zusammenfassen: 41 geprüfte Dokumente, vier von vier gefundenen Fehlern und eine Leistungssteigerung von knapp 40 Prozent. Diese Werte beschreiben genau diesen Versuch. Sie sind kein pauschaler Qualitätswert für jede Vertrags-, Finanz- oder Rechtsprüfung, zeigen aber, wie groß der Gewinn bei einer klar abgegrenzten Aufgabe ausfallen kann.

Aus 41 Dateien wird eine vergleichbare Auswertung

Für die praktische Nutzung ist Legoras Tabular Review der entscheidende Baustein. Die Funktion wertet viele Dokumente anhand selbst festgelegter Fragen oder Kriterien aus. Ergebnisse werden nicht als lose Folge einzelner Chatantworten präsentiert, sondern tabellarisch zusammengeführt und mit Verweisen auf die zugrunde liegenden Dokumentstellen verbunden.

Das verändert die Art der Prüfung. Statt nacheinander zu fragen, ob in Datei A, B oder C eine bestimmte Abweichung vorkommt, wird das Kriterium einmal formuliert und auf den gesamten Bestand angewandt. Jede Zeile kann ein Dokument repräsentieren; getrennte Spalten können beispielsweise den gefundenen Wert, die erwartete Angabe, eine erkannte Differenz und die zugehörige Fundstelle aufnehmen.

Bei Finanzunterlagen eignet sich dieses Muster etwa für widersprüchliche Beträge, voneinander abweichende Stichtage, fehlende Freigaben oder Angaben, die nicht mit einem vorgegebenen Kriterium übereinstimmen. Entscheidend ist, dass die gesuchte Abweichung präzise beschrieben wird. Eine allgemeine Aufforderung wie „Finde Fehler“ lässt mehr Interpretationsraum als vier getrennte Fragen, die jeweils eine konkrete Fehlerklasse definieren.

Die Fundstelle ist genauso wichtig wie der Treffer

Ein gefundener Fehler ist nur dann unmittelbar brauchbar, wenn sich nachvollziehen lässt, woher die Aussage stammt. Tabular Review verbindet die strukturierten Ergebnisse deshalb mit Referenzen auf die jeweiligen Dokumentstellen. Fachkräfte können von einer Auffälligkeit zum Originaltext wechseln und dort Wortlaut, Zahlen und Kontext kontrollieren.

Diese Verbindung aus Ergebnis und Beleg ist bei Finanz- und Rechtsdokumenten besonders nützlich. Ein Modell kann eine Abweichung markieren; die fachliche Entscheidung entsteht jedoch am Original. Die Referenz verhindert, dass eine zusammengefasste Antwort vom zugrunde liegenden Dokument getrennt weitergereicht wird.

Für die Ausgabe bietet sich eine knappe Struktur an: Dokumentname, Prüfkriterium, festgestellte Angabe, erwarteter Wert, Abweichung und Belegstelle. Eine zusätzliche Priorisierung kann anzeigen, welche Treffer zuerst gelesen werden sollten. Die Priorität ersetzt dabei nicht den Beleg, sondern hilft lediglich beim Sortieren einer größeren Treffermenge.

So formuliert man die Prüfung für GPT‑6 Astra

Die übertragbare Anwendungstechnik beginnt mit kleinen, eindeutig beantwortbaren Prüffragen. Jede Frage sollte beschreiben, wonach gesucht wird, welches Antwortformat erwartet wird und welcher Textausschnitt die Antwort stützen muss.

Für einen Dokumentensatz mit Finanzangaben kann eine Anweisung sinngemäß verlangen: Ermittle pro Dokument den ausgewiesenen Betrag und den zugehörigen Stichtag. Markiere nur Fälle, in denen die Werte einem festgelegten Sollwert widersprechen. Gib für jeden Treffer den Dokumentnamen, die abweichende Angabe und die genaue Fundstelle aus. Wenn eine benötigte Angabe fehlt, kennzeichne sie getrennt von einem Widerspruch.

Diese Trennung ist wichtig. „Nicht vorhanden“ und „vorhanden, aber abweichend“ sind fachlich unterschiedliche Befunde. Werden beide Fälle in einer einzigen Fehlerkategorie vermischt, wird die Tabelle zwar kürzer, aber weniger aussagekräftig. Gleiches gilt für Unsicherheit: Ein schwer lesbarer oder mehrdeutiger Abschnitt sollte nicht automatisch als bestätigter Fehler erscheinen.

Auch zusammengesetzte Fragen lassen sich besser aufteilen. Statt Beträge, Daten, Freigaben und Querverweise in einem langen Prompt gleichzeitig prüfen zu lassen, erhält jede Kategorie eine eigene Spalte. So wird erkennbar, welche Regel zu einem Treffer geführt hat, und dieselbe Regel lässt sich konsistent auf alle 41 Dokumente anwenden.

Vom Tabellenfund zurück ins Dokument

Legora beschränkt sich nicht auf die tabellarische Übersicht. Das Word-Add-in bringt Funktionen der Plattform direkt in Microsoft Word. Juristische Fachkräfte können Texte dort prüfen, überarbeiten und entwerfen, ohne das Dokument zunächst in eine getrennte Anwendung übertragen zu müssen.

Für das gezeigte Szenario ergibt sich daraus eine sinnvolle Verbindung: Tabular Review dient dazu, Auffälligkeiten über den gesamten Dokumentensatz hinweg zu finden und vergleichbar darzustellen. Anschließend lässt sich das betroffene Dokument in seiner vertrauten Textumgebung lesen oder bearbeiten. Die Übersicht beantwortet also, wo eine Abweichung liegt; das Dokument zeigt, wie sie im vollständigen Zusammenhang formuliert ist.

Das ist besonders hilfreich, wenn ein Treffer nicht nur bestätigt, sondern sprachlich eingeordnet werden muss. Ein widersprüchlicher Betrag kann beispielsweise in einer Tabelle eindeutig erscheinen, während eine Fußnote im Dokument erklärt, warum er abweicht. Der Wechsel zur Fundstelle bewahrt diesen Kontext und verhindert, dass die tabellarische Verdichtung mit dem vollständigen Sachverhalt verwechselt wird.

Was die knapp 40 Prozent tatsächlich aussagen

Die Leistungssteigerung um knapp 40 Prozent ist die auffälligste Vergleichszahl des Versuchs. Sie beschreibt die Verbesserung innerhalb dieses Finanzprüfungsszenarios und gehört deshalb unmittelbar zu den 41 Dokumenten und den vier platzierten Fehlern. Ohne identische Aufgabenstellung wäre ein Vergleich mit anderen Dokumentbeständen nicht gleichwertig.

Aussagekräftig ist die Zahl trotzdem: Der Test war nicht nur eine Geschwindigkeitsdemonstration. Alle vier absichtlich eingebauten Fehler wurden gefunden. Damit verbindet das Ergebnis eine höhere gemessene Leistung mit vollständiger Trefferquote für die bekannten Fehler des Tests.

Für die Einordnung zählt außerdem die Form der Aufgabe. Bei einer Prüfung mit platzierten Fehlern steht vorher fest, welche Abweichungen vorhanden sind. Dadurch lässt sich das Ergebnis klarer beurteilen als bei einer offenen Suche nach möglicherweise problematischen Formulierungen. In echten Beständen können dagegen unerwartete Fehlerarten, uneinheitliche Dokumentstrukturen und fachliche Ausnahmen hinzukommen.

Die passende Schlussfolgerung lautet daher nicht, dass jede Prüfung nun automatisch vollständig ist. Der Versuch zeigt vielmehr, dass GPT‑6 Astra in Verbindung mit Legoras strukturierter Dokumentauswertung einen größeren Bestand sehr schnell nach festgelegten Kriterien untersuchen und die bekannten Abweichungen vollständig auffinden konnte.

Vertrauliche Unterlagen bleiben ein eigener Prüfpunkt

Finanz- und Rechtsdokumente enthalten häufig vertrauliche Mandanten- oder Unternehmensdaten. Legoras Sicherheitsbeschreibung behandelt dafür organisatorische und technische Maßnahmen, darunter Zugriffskontrollen, Verschlüsselung und den Umgang mit Kundendaten.

Für die konkrete Nutzung sind diese Eigenschaften nicht bloß ergänzende Produktmerkmale. Sie bestimmen, welche Personen auf Dokumente zugreifen können, wie Daten bei Übertragung und Speicherung geschützt werden und welche internen Vorgaben sich mit der Plattform abbilden lassen. Vor dem Einsatz mit vertraulichen Unterlagen müssen die angebotenen Einstellungen deshalb zu den Regeln der jeweiligen Organisation passen.

Auch die Zusammenarbeit im Team, die Legora in seiner Produktübersicht beschreibt, sollte an klar vergebene Rechte gebunden sein. Wer Prüfergebnisse lesen, Originaldokumente öffnen oder Texte verändern darf, sind unterschiedliche Berechtigungen. Gerade eine zentrale Tabelle mit Treffern kann Informationen aus vielen Dateien an einem Ort bündeln und benötigt entsprechend sorgfältig gesetzte Zugriffe.

Wo der größte praktische Gewinn liegt

Der stärkste Nutzen entsteht bei wiederkehrenden Fragen über viele Dokumente hinweg. Wer 41 Dateien jeweils nach denselben vier Fehlerklassen durchsucht, profitiert stärker von einer tabellarischen Prüfung als jemand, der nur einen einzelnen kurzen Text liest. Je konsistenter die Kriterien, desto leichter lassen sich Ergebnisse vergleichen, sortieren und an der Originalstelle nachvollziehen.

Damit eignet sich die Kombination besonders für Aufgaben, bei denen Vollständigkeit über einen abgegrenzten Bestand zählt: Angaben abgleichen, fehlende Bestandteile markieren, definierte Klauseln auffinden oder widersprüchliche Werte gegenüberstellen. Die Technik bleibt dieselbe: Kriterien einzeln formulieren, Antwortfelder festlegen, Belegstellen verlangen und bestätigte Treffer im Dokument lesen.

Der Legora-Versuch macht damit sichtbar, was GPT‑6 Astra in einer spezialisierten Produktoberfläche leisten kann. Der Fortschritt besteht nicht allein darin, 41 Dokumente schneller zu lesen. Er liegt darin, einen umfangreichen Bestand nach denselben Regeln auszuwerten, alle vier bekannten Fehler zu erfassen und jedes Ergebnis wieder mit seinem Ursprung im Dokument zu verbinden.

Verwandt
Zur Bibliothek