Open-Source-OCR

22 der besten Open-Source-OCR-Datensätze zum Trainieren Ihrer ML-Modelle im Jahr 2026

Optische Zeichenerkennung (OCR) ist heute die Basis für das Scannen von Belegen, die Ausweisprüfung, die Automatisierung von Rechnungen, die Digitalisierung historischer Archive und Stift-basierte Notiz-Apps. Der OCR-Markt soll bis 2030 ein Volumen von 32.90 Milliarden US-Dollar erreichen, was einer jährlichen Wachstumsrate von 14.8 % entspricht (Grand View Research, 2024). Die intelligente Zeichenerkennung – der Bereich der Handschrifterkennung innerhalb der OCR – verzeichnet dabei das schnellste Wachstum. Ob Sie Dokumentenanalyse, Szenentexterkennung oder Handschrifterkennung entwickeln: Die Genauigkeit hängt maßgeblich von den verwendeten OCR-Trainingsdaten ab. Dieser Leitfaden stellt 22 kostenlose Open-Source-OCR-Datensätze vor – darunter die besten Handschriftdatensätze –, geordnet nach Anwendungsfall und aktualisiert mit den neuesten Versionen bis 2024.

Wichtige Erkenntnisse

  • OCR (Optische Zeichenerkennung): Technologie, die Bilder von gedrucktem, Szenen- oder handgeschriebenem Text in maschinenlesbare Daten umwandelt.
  • OCR-Datensätze werden in fünf Gruppen unterteilt: Dokument/Formular, Szenentext, Ziffer/Zeichen, Handschrift und mehrsprachig.
  • Dokumenten-OCR-Datensätze strukturierte Seiten wie Formulare und Belege erfassen; Szenentext-Datensätze Texte „in freier Wildbahn“ erfassen.
  • IAM, MNIST, ICDAR und SROIE sind nach wie vor die am häufigsten zitierten OCR-Benchmarks in der Forschung.
  • Die Lizenzbedingungen variieren stark – prüfen Sie jeden OCR-Datensatz vor dem kommerziellen Training.

Was ist OCR (Optische Zeichenerkennung)?

OCR ist eine Technologie, die verschiedene Dokumenttypen, wie gescannte Papierdokumente, PDFs oder Textbilder, in bearbeitbare und durchsuchbare Daten umwandelt. Sie funktioniert folgendermaßen:

  • Analysieren der Textstruktur in einem Bild
  • Aufteilung des Textes in Zeilen und Zeichen
  • Umwandlung dieser visuellen Zeichen in maschinenlesbaren Text

Zu den häufigen Anwendungen gehören:

  • Konvertieren gescannter Dokumente in editierbare Textdateien
  • Digitalisierung gedruckter Bücher
  • Text aus Fotos extrahieren
  • Umwandlung handschriftlicher Rezepte in digitalen Text
  • Kennzeichenerkennung

Wie wählt man den richtigen OCR-Datensatz aus?

Die Auswahl eines OCR-Datensatzes hängt von vier Faktoren ab: Texttyp, Erfassungsumgebung, Annotationsgranularität und Lizenz. Die OCR gedruckter Dokumente benötigt andere Trainingsdaten als handgeschriebene Texte in Schreibschrift oder geschwungenen Formen. Dokumentendatensätze eignen sich für Rechnungen, Formulare und Quittungen; Datensätze mit Szenentexten für Beschilderungen und Produktinformationen; Handschriftdatensätze für Notizen, Manuskripte und Stifteingaben. Annotationen auf Wort- und Zeilenebene unterstützen vollständige OCR-Pipelines, während Datensätze auf Zeichenebene für Klassifizierungs-Baselines geeignet sind. Prüfen Sie stets die Lizenzbedingungen, da einige OCR-Datensätze nur für Forschungszwecke bestimmt sind oder eine Registrierung erfordern.

Was sind die besten Datensätze für die Dokumenten- und Formular-OCR?

Dokumenten-OCR-Datensätze trainieren Modelle zum Parsen strukturierter Seiten wie Rechnungen, Formulare, Quittungen und Ausweise. Diese ermöglichen die Automatisierung von Geschäftsdokumenten und die Extraktion von Schlüssel-Wert-Paaren.

  1. FUNSD — 199 annotierte, gescannte Formulare mit verrauschtem, realitätsnahem Erscheinungsbild. Der Standard-Benchmark für Formularverständnis und Schlüssel-Wert-Extraktion.
  2. SROIE — ICDAR 2019 gescannter Belegdatensatz mit rund 1,000 Belegen, der Texterkennung, -klassifizierung und Informationsextraktion in einem einzigen Datensatz unterstützt.
  3. KABEL — Ein konsolidierter Belegdatensatz, der für die Nachbearbeitung per OCR erstellt wurde und über umfangreiche Feldbezeichnungen für die Rechnungs- und Belegautomatisierung verfügt.
  4. XFUND — Mehrsprachige Erweiterung von FUNSD, die sieben Sprachen (Deutsch, Spanisch, Französisch, Italienisch, Japanisch, Portugiesisch, Chinesisch) mit jeweils 199 Seiten umfasst. Ideal für mehrsprachige Dokumenten-KI.
  5. DDI-100 — Rund 100,000 verzerrte Dokumentenbilder zur Erkennung und Identifizierung unter realen Beeinträchtigungen wie Verzerrung, Unschärfe und Rauschen.

Was sind die besten OCR-Datensätze für Szenentexte?

Szenentext-OCR-Datensätze trainieren Modelle zum Lesen von Text in natürlichen Bildern wie Schildern, Produkten und Straßenszenen. Diese sind unerlässlich für die OCR in realen Umgebungen mit unübersichtlichem Hintergrund.

  1. ICDAR Robustes Lesen — Die Benchmark-Familie, die den meisten Szenentextforschungen zugrunde liegt, einschließlich der Herausforderungen „Focused Scene Text“ und „Incidental Scene Text“ mit Begrenzungsrahmen auf Wortebene und Transkriptionen.
  2. COCO-Text — Umfangreiche Szenen-Text-Annotationen, die auf MS-COCO-Bildern überlagert sind. Hervorragend geeignet für die Texterkennung in großem Umfang in natürlichen Szenen.
  3. Gesamttext — Spezialisiert auf gekrümmten und beliebig ausgerichteten Text, eine bekannte Schwachstelle älterer OCR-Modelle.
  4. SVT (Street View Text) — Wortbilder aus Google Street View, oft niedrig aufgelöst und mit hoher Variabilität. Verfügbar über Papers with Code-Mirror.
  5. HierText — Hierarchische Annotation von Absätzen über Zeilen bis hin zu Wörtern, sowohl für handschriftliche als auch für gedruckte Texte. Nützlich für layoutbasierte OCR.

Was sind die besten OCR-Datensätze für Ziffern und Zeichen?

Datensätze für die OCR von Ziffern und Zeichen trainieren Modelle zur Erkennung einzelner Symbole in kontrollierten Umgebungen. Diese stellen die Standard-Ausgangspunkte für Klassifizierungsbaselines dar.

  1. MNIST — 70,000 Graustufenbilder handgeschriebener Ziffern. Die schnellste Grundlage für die Validierung eines Ziffernklassifikators.
  2. EMNIST — Erweitert MNIST um 814,255 handgeschriebene Buchstaben und Ziffern aus der NIST Special Database 19.
  3. SVHN (Street View Hausnummern) — Über 600,000 reale Ziffernbilder von Hausnummern. Eine praktische Verbesserung gegenüber MNIST bei unruhigen Bilddaten.
  4. Chars74K — 74,107 Bilder, die englische und Kannada-Zeichen aus natürlichen Bildern und Computer-Schriftarten darstellen.
  5. NIST-Spezialdatenbank 19 — Über 810,000 handgeschriebene Zeichenbilder von 3,600 Autoren. Die Quelle vieler englischer OCR-Benchmarks.

Welche Handschriftdatensätze eignen sich am besten für die OCR?

Handschriftdatensätze dienen dem Training von OCR-Modellen zum Lesen von Schreibschrift, Druckschrift und historischen Handschriften. Die leistungsstärksten frei zugänglichen Handschriftdatensätze gelten weiterhin als die meistzitierten Benchmarks für die Handschrifterkennung (HTR).

  1. IAM Handschriftdatenbank — Der Goldstandard für englische Handschriften, mit 13,353 Textzeilen von 657 Schreibern. Immer noch der meistzitierte Handschriftendatensatz in der OCR-Forschung 2024–2025.
  2. IAM-OnDB — Die Online-Version von IAM zur Stiftstricherkennung, die Trajektoriendaten erfasst. Der kanonische Handschriftdatensatz für die Stift- und Tablet-Erkennung.
  3. Bentham-Papiere — Transkribierte historische englische Manuskripte des Philosophen Jeremy Bentham. Der führende Standard für die OCR historischer Handschriften, zugänglich über Transkribus.
  4. GNHK (GoodNotes Handwriting Kollection) — Ein Datensatz aus dem Jahr 2021 mit unbereinigten, handgeschriebenen englischen Notizen aus dem realen Leben. Eher vergleichbar mit unstrukturierten Produktionsdaten als mit sauberen IAM-Daten aus dem Labor.

Was sind die besten mehrsprachigen und nicht-lateinischen OCR-Datensätze?

 

Mehrsprachige OCR-Datensätze trainieren Modelle für Schriftsysteme jenseits des Englischen, darunter Chinesisch, Arabisch und mathematische Notation. Diese sind unerlässlich für die globale Dokumenten- und Handschrifterkennung.

  1. CASIA-HWDB — Der chinesische Standard-OCR-Benchmark mit 1.17 Millionen handgeschriebenen Zeichenproben von 1,020 Schreibern.
  2. Khat — 1,000 arabische Handschriften von 1,000 verschiedenen Schreibern, gescannt in verschiedenen Auflösungen. Der umfassendste frei zugängliche arabische OCR-Datensatz.
  3. CROHME — Wettbewerb zur Erkennung handgeschriebener mathematischer Ausdrücke online: Über 10,000 Ausdrücke mit mehr als 101 mathematischen Symbolen, sowohl online als auch offline. Unverzichtbar für die Texterkennung handgeschriebener Gleichungen.

Welche häufigen Fehlerquellen gibt es bei der Verwendung kostenloser OCR-Datensätze?

Drei Fallstricke tappen die meisten Teams.

Domänenkonflikt: Schulungen zu sauberem IAM oder COCO-Text und die Anwendung auf zerknitterten Rechnungen garantieren eine geringe Genauigkeit.

Lizenzblindheit: Einige Szenentext- und historische OCR-Datensätze sind nur für Forschungszwecke bestimmt oder erfordern eine Registrierung vor der kommerziellen Nutzung.

Annotationslücken: Vielen OCR-Datensätzen fehlen die Layout-Metadaten, die Begrenzungsrahmen auf Zeilenebene oder die Feldbezeichnungen, die Produktionssysteme benötigen.

Stellen Sie sich ein mittelständisches Logistikunternehmen vor, das das Lesen von Versandetiketten automatisiert. Durch das Training mit öffentlich zugänglichen Testbildern erreichen sie eine Trefferquote von 80 % bei den Vergleichstests, doch bei realen Etiketten mit Spiegelungen und Falten sinkt diese auf 58 %. Um diese Lücke zu schließen, waren gezielte Maßnahmen erforderlich. Datenanmerkung von 6,000 In-Domain-Label-Images vor dem Start.

Vorteile und Herausforderungen von Open-Source-Datensätzen

Vorteile und Herausforderungen von Open-Source-Datensätzen

Unternehmen müssen die Vorteile und Herausforderungen gegeneinander abwägen, um zu verstehen, ob sie sich für kostenlos nutzbare Daten für ihre ML-Anwendungen entscheiden müssen.

Vorteile

  • Die Daten sind leicht zugänglich. Aufgrund der Datenverfügbarkeit werden die Kosten für die Entwicklung der Anwendung erheblich reduziert.
  • Der Zeit- und Arbeitsaufwand für das Sammeln von Daten für die Anwendung wird erheblich reduziert, da der Datensatz leicht verfügbar ist.
  • Es gibt eine Fülle von Community-Foren oder Hilfegruppen, die beim Lernen, Anpassen und Optimieren des Datensatzes helfen.
  • Einer der Hauptvorteile des Open-Source-Datasets besteht darin, dass es keine Einschränkungen für die Anpassung gibt.
  • Open-Source-Daten sind einem großen Teil der Bevölkerung zugänglich und ermöglichen Analysen und Innovationen ohne finanzielle Barrieren.

Challenges

  • Die projektspezifischen Daten sind schwer zu beschaffen. Darüber hinaus besteht die Möglichkeit, dass Informationen fehlen und die verfügbaren Daten falsch verwendet werden.
  • Das Erfassen proprietärer Daten erfordert Zeit, Mühe und ist kostspielig
  • Während es einfacher sein könnte, Daten zu erfassen, können die Kosten für Wissen und Analyse den anfänglichen Vorteil überwiegen.
  • Auch andere Entwickler verwenden dieselben Daten, um Anwendungen zu entwickeln.
  • Diese Datensätze sind sehr anfällig für Sicherheitsverletzungen, Datenschutz und Zustimmung.

Wie unterstützt Shaip OCR- und Handschrifterkennungsprojekte?

Shaips OCR-Schulungsdatendienste Verknüpfung der Kuratierung offener Datensätze mit benutzerdefinierten Datensammlung Shaip unterstützt über 60 Sprachen und deckt gedruckte Dokumente, Handschriften, Quittungen und Ausweise ab. Die Annotations-Workflows von Shaip ergänzen öffentliche OCR-Datensätze um die fehlenden Ebenen: Begrenzungsrahmen auf Zeilenebene, Beschriftungen auf Feldebene, Qualitätskontrolle der Transkription und Metadaten des Schreibers.

Fazit

Die 22 oben genannten OCR-Datensätze bieten Ihnen eine umfassende Open-Source-Grundlage für die Erkennung von Dokumenten, Szenentexten, Ziffern, Handschrift und mehrsprachigen Daten bis 2026. Beginnen Sie mit dem OCR-Datensatz, der zu Ihrem Texttyp und Ihrer Erfassungsumgebung passt, validieren Sie ihn anhand einer separaten Stichprobe Ihrer realen Daten und planen Sie Budget für benutzerdefinierte Annotationen ein, um die Wissenslücken zu schließen. Diese Kombination ermöglicht eine schnellere Bereitstellung als eine Eigenentwicklung.

Welcher kostenlose OCR-Datensatz am besten geeignet ist, hängt von der jeweiligen Aufgabe ab. ICDAR Robust Reading ist führend bei der Texterkennung, FUNSD und SROIE bei der Dokumenten- und Beleg-OCR und IAM bei der Handschrifterkennung. Für die Ziffernerkennung gelten MNIST und SVHN als Standard. Die meisten Teams kombinieren zwei oder drei OCR-Datensätze aus verschiedenen Kategorien, anstatt sich auf einen einzigen zu verlassen.

Nicht alle Open-Source-OCR-Datensätze sind für die kommerzielle Nutzung frei zugänglich. MNIST, SVHN und COCO-Text verwenden freizügige Lizenzen, während IAM-, ICDAR- und historische Handschriftdatensätze häufig eine Registrierung erfordern oder die Nutzung auf Forschungszwecke beschränken. Prüfen Sie daher immer die Lizenz des jeweiligen Datensatzes, bevor Sie ein kommerzielles Modell trainieren.

OCR-Datensätze decken die Erkennung aller maschinenlesbaren Texte ab, darunter gedruckte Dokumente, Szenentexte und Ziffern. Handschriftdatensätze hingegen konzentrieren sich auf handgeschriebene Inhalte. Handschriftdatensätze wie IAM und Bentham trainieren HTR-Modelle, während Dokumenten- und Szenentext-OCR-Datensätze gedruckten und im Alltag vorkommenden Text verarbeiten.

Zu den mehrsprachigen OCR-Datensätzen gehören XFUND für sieben Sprachen von Formularen, CASIA-HWDB für Chinesisch, KHATT für Arabisch und ICDAR MLT für mehrsprachigen Szenentext. Die Kombination von schriftspezifischen OCR-Datensätzen mit synthetischer Datenaugmentation führt in der Regel zu besseren Ergebnissen als das Training mit einem einzelnen Datensatz.

Der Bedarf an individuellen Annotationen hängt davon ab, wie weit Ihre Dokumente von öffentlichen Daten entfernt sind. Saubere, gedruckte Formulare benötigen möglicherweise 1,000 bis 5,000 Beispiele aus dem jeweiligen Fachgebiet, während unleserliche Handschrift, Quittungen oder seltene Schriften oft 10,000 bis 50,000 Beispiele erfordern. Die Annotations-Pipelines von Shaip erzielen in der Regel eine um 15 bis 30 % höhere Genauigkeit als das OCR-Training ausschließlich mit öffentlichen Daten.

Hat Ihnen dieser Artikel gefallen? Folgen Sie Shaip auf LinkedIn, um weitere Neuigkeiten zu erhalten.

Social Share