Technologie · OCR
Jedes Dokument, automatisch lesbar.
Viele vermeintliche KI-Fehler sind in Wahrheit OCR-Fehler. DEPLAW verarbeitet jedes eingehende Dokument automatisch mit einem eigenen, für den Rechtsbereich optimierten OCR-Modul – als Fundament, nicht als nachgelagerte Funktion.
01 · Warum Standard-OCR nicht reicht
Rechtsdokumente sind kein Standardtext.
Die meisten Kanzleien nutzen die mitgelieferte Standard-OCR ihrer Software – entwickelt für allgemeine Bürotexte, nicht für Paragrafenstrukturen, Fußnoten und Sonderzeichen. Eine auf 95 % Erkennungsrate optimierte Standard-OCR erzeugt bei einem 100-seitigen Vertrag bereits rund 500 falsch erkannte Zeichen – genug, um jede nachfolgende KI-Analyse zu verzerren.
Gerichtsdokumente
Kopf- und Fußzeilen, Stempel, handschriftliche Vermerke, wechselnde Schriftarten.
Verträge
Tabellen, Anlagen, verschachtelte Nummerierungen, Paragrafenstrukturen.
Faxe & Fotos
Schlechte Auflösung, schiefe Ausrichtung, ungleichmäßige Belichtung.
Ein typischer Fehler
Ein Dezimalkomma, das als Punkt erkannt wird, verschiebt einen Betrag unbemerkt: Aus12.500,00 € wird12.500.00 – je nach Weiterverarbeitung als 12.500 oder als 1.250.000 interpretiert. Ebenso kritisch: eine falsch erkannte Ziffer macht aus einer Frist am 03.10.2026 eine am 03.10.2028. Beide Fehler wirken strukturell unauffällig – ein menschliches Flagging findet hier nicht statt.
Insight: OCR für KI – die vergessene Technologie für Legal Tech? →
02 · Die Pipeline
Fünf Stufen bis zum verlässlichen Text.
Jedes Dokument durchläuft dieselbe strukturierte Pipeline, bevor der erkannte Text weiter in Klassifikation, Datenextraktion oder RAG-Indexierung einfließt:
Pre-Processing
Bildoptimierung, Rauschfilterung und Schiefe-Korrektur für optimale Erkennungsqualität.
Layout-Detection
Automatische Erkennung von Überschriften, Tabellen und Formatierungen.
Text-Recognition
KI-basierte Zeichenerkennung mit juristischen Wörterbüchern und Kontextanalyse.
Post-Processing
Formatvalidierung und strukturierte Ausgabe in Markdown.
Quality-Assurance
Automatische Plausibilitätsprüfung und Confidence-Scoring für kritische Elemente.
03 · Genauigkeit
80 statt 500 Fehler.
Der Unterschied zwischen 95 % und 99,2 % Erkennungsrate wirkt klein, ist es aber nicht: Bei 10.000 Zeichen bedeutet das 500 statt nur noch rund 80 fehlerhafte Zeichen. Ein Abgleich mit Legal Dictionaries – Wörterbüchern juristischer Fachbegriffe, Abkürzungen und typischer Formulierungen – hält diese Fehlerquote niedrig, gerade bei Paragrafen, Aktenzeichen und Fristen.
| Element | Risiko bei Fehler | Lösungsansatz |
|---|---|---|
| Paragrafenzeichen (§) | Falsche Rechtsgrundlagen | Juristische Zeichenerkennung |
| Datum & Fristen | Terminverwaltung fehlerhaft | Kontext-basierte Validierung |
| Geldbeträge | Falsche Bewertungen | Numerische Plausibilitätsprüfung |
Confidence Scoring
Jeder Textbereich erhält einen eigenen Sicherheitswert. Kritische Elemente wie Fristen oder Geldbeträge mit niedriger Konfidenz werden automatisch für die manuelle Prüfung markiert – effizienter als eine vollständige manuelle Nachbearbeitung, aber ebenso zuverlässig.
04 · Vollautomatisch
Kein Dokument bleibt unverarbeitet.
Ob Scan, Fax, Foto oder E-Mail-Anhang: Jedes eingehende Dokument durchläuft automatisch die OCR-Pipeline und wird als durchsuchbares PDF in der Akte abgelegt – auch bei Akten mit tausenden Seiten, bei denen eine Volltextsuche sonst unmöglich wäre. Statt eines zugekauften Drittanbieter-Tools betreibt DEPLAW dafür ein eigenes OCR-Modul, direkt an Klassifikation, Datenextraktion und RAG-Indexierung angebunden.
Häufige Fragen
OCR, kurz erklärt.
Oft nicht. Eine interne Prüfung zeigt: Ein erheblicher Teil vermeintlicher KI-Halluzinationen entsteht durch fehlerhafte Texterkennung, nicht durch die Grenzen des Sprachmodells. Falsch erkannte Beträge oder verrutschte Formatierungen führen zu Interpretationsfehlern, die mit dem Modell selbst nichts zu tun haben.
Eine Standard-OCR mit 95 % Erkennungsrate erzeugt bei einem 100-seitigen Vertrag rund 500 falsch erkannte Zeichen. Bei 99,2 % sind es bei 10.000 Zeichen nur noch rund 80 – ein Unterschied, der darüber entscheidet, ob eine nachgelagerte KI-Analyse brauchbar bleibt.
Ein Wörterbuch juristischer Fachbegriffe, Abkürzungen und typischer Formulierungen, gegen das die OCR erkannten Text abgleicht – so bleibt z. B. „§ 123 Abs. 2 BGB" korrekt erhalten, statt zu „S 123 Abs 2 BGB" zu werden.
Confidence Scoring bewertet die Erkennungssicherheit jedes Textbereichs einzeln. Kritische Elemente wie Fristen oder Geldbeträge mit niedriger Konfidenz werden automatisch für die manuelle Prüfung markiert, statt unbemerkt falsch übernommen zu werden.
Sehen Sie die OCR an echten Dokumenten.
Wir zeigen anhand Ihrer eigenen Dokumenttypen, wie zuverlässig die Texterkennung tatsächlich arbeitet.
Demo vereinbaren