OCR-Texterkennung & Transkriptionsannotation

Wie Shaip Wort- und Zeichen-basierte Transkriptionsannotationen für unterschiedlichste Textquellen – gedruckte Dokumente, Handschrift, Schilder, Nummernschilder, Quittungen – lieferte und dabei einen OCR- und Dokumentenanalyse-Datensatz in Produktionsqualität mit einer Genauigkeit von 99 % erstellte.

OCR-Texterkennung und Transkriptionsannotation

Projektübersicht

Da sich die OCR-Technologie über saubere gedruckte Dokumente hinaus in Richtung realer Szenentexte und Dokumentenintelligenz entwickelt, benötigte der Kunde eine Annotationspipeline, die in der Lage ist, verschiedene Texttypen, Schriftarten, Ausrichtungen, Sprachen und Oberflächenbeschaffenheiten mit räumlicher und zeichenbezogener Präzision zu verarbeiten.

Shaip entwickelte die durchgängige Annotationspipeline, die die Platzierung von Begrenzungsrahmen auf Wortebene, die exakte Zeichentranskription, die Kennzeichnung mit mehreren Attributen und die duale räumliche + transkriptionelle Qualitätssicherung umfasst – und erzeugt so modellfertige OCR-Datensätze für mehr als 10 Textquellentypen.

Schlüsselstats

Anmerkungen pro Bild

Hunderte von Wörtern

Genauigkeitsschwelle

99%

Textquellen

10+

Attributebenen

5

Challenges

  • Kommentieren jede sichtbare Textinstanz auf Wortebene – Hunderte pro dichtem Bild
  • Kombination räumliche Begrenzungsbox-Genauigkeit und exakte Transkription auf Zeichenebene Parallel
  • Handhabung gekrümmter, perspektivisch verzerrter und gedrehter Text auf Schildern und Produktetiketten
  • Transkribieren verblasst, kontrastarm und teilweise verdeckt Wörter, ohne unleserliche Zeichen zu erraten
  • Management Texte in verschiedenen Sprachen und Schriftsystemen innerhalb desselben Bildes

Lösung

Räumliche Annotation auf Wortebene

Jedes sichtbare Textelement in jedem Bild wurde einzeln mit einem passgenauen Rahmen auf Wortebene markiert – so wurde die exakte räumliche Position jedes Textelements erfasst. Bei Bildern mit hoher Textdichte wie Quittungen oder Formularen bedeutete dies Hunderte von Einzelmarkierungen pro Bild, wobei die präzise Ausrichtung stets beibehalten wurde.

Transkription auf Zeichenebene

Neben dem Begrenzungsrahmen transkribierten die Annotatoren den exakten Textinhalt jedes Wortes, einschließlich Zahlen, Sonderzeichen, Satzzeichen und alphanumerischer Kombinationen. Dieser zweistufige Arbeitsablauf – räumliche Erfassung + Transkription – wurde parallel unter Einhaltung von Konsistenzregeln auf beiden Ebenen durchgeführt.

Abdeckung aus mehreren Quellen

Die Datenerfassung umfasste ein breites Spektrum an Quellen: gedruckte Dokumente, handschriftliche Notizen, Straßenschilder, Produktetiketten, Nummernschilder, Schaufenster, Werbetafeln, Quittungen, Rechnungen, Speisekarten und Formularfelder. Für jeden Quellentyp gab es eigene, auf seine visuellen Merkmale abgestimmte Annotationsrichtlinien.

5-stufige Attributkennzeichnung

Jeder annotierte Textbereich wurde mit Attributen angereichert, die Textausrichtung (horizontal, vertikal, diagonal), Sprache und Schrifttyp, Textverständlichkeit (gut lesbar, teilweise lesbar, unleserlich), Schriftart (gedruckt vs. handschriftlich) und Texthintergrund (einfarbig, gemustert, komplex) umfassen. Diese umfassende Attributebene ermöglicht es dem trainierten Modell, weit über die Möglichkeiten der Standard-Dokumentenerkennung hinausgehende, vielfältige Textbedingungen aus der Praxis zu verarbeiten.

Sichtbarkeitsschwelle & Duale Qualitätssicherung

Strenge Richtlinien legten die Mindestsichtbarkeitsschwellen fest – unleserlicher Text wurde markiert statt erraten, um die Integrität des Datensatzes zu gewährleisten. Jedes annotierte Bild durchlief einen zweistufigen Qualitätssicherungsprozess, der die Überprüfung der Genauigkeit der Begrenzungsrahmen und die Validierung der Transkriptionsgenauigkeit kombinierte, mit einer Genauigkeitsschwelle von 99 % über beide Ebenen hinweg.

Projektumfang

Datensatztyp Annotationsebene Quellen Attribute QA Genauigkeit
OCR-Texterkennung + Transkription Wortkästchen + Zeichentranskription Mehr als 10 Quelltypen 5 Attributebenen Duale räumliche + transkriptionelle QC 99%

Ergebnisse:

  • Gegründet a Duale Transkriptionspipeline auf Wortebene (räumlich) + Zeichenebene für OCR-KI
  • Standardisiert Abdeckung von mehr als 10 Textquellen die Dokumente, Szenentexte und Handschriften umfassen
  • Erfolgreicher Abschluss von 5 Attributebenen hinsichtlich Orientierung, Sprache, Klarheit, Schriftart und Hintergrund
  • Leicht 99% Genauigkeitstor sowohl auf räumlicher als auch auf transkriptioneller Ebene der Qualitätssicherung.
  • Die Client-Einstellungen wurden aktiviert. Dokumentendigitalisierung, OCR im Einzelhandel, Navigation, Bankwesen und Recht KI-Anwendungen

Insgesamt trug Shaip dazu bei, eine Anforderung an die Textannotation aus verschiedenen Quellen in eine strukturierte, produktionsreife OCR-Pipeline umzuwandeln – eine Pipeline, die in der Lage ist, die Digitalisierung von Dokumenten, die Erkennung von Szenentexten, die Analyse von Einzelhandelsdaten, die Automatisierung des Bankwesens und die KI zur Einhaltung gesetzlicher Bestimmungen mit doppelter räumlicher und transkriptioneller Präzision zu unterstützen.

Zitatsymbol

Shaip bewältigte die OCR-Sonderfälle, an denen die meisten Anbieter scheitern – gebogener Text auf Schildern, gemischte Schriften, verblasste Belege, handschriftliche Notizen. Ihre doppelte Qualitätssicherung sowohl der Begrenzungsrahmen als auch der Transkriptionen lieferte uns Trainingsdaten, die wir einsetzen konnten.

— Direktor, Dokumenten-KI

★ ★ ★ ★ ★
Zitatsymbol