verwahrsam.de
Digitalisierung & Dokumentenscanner

OCR (Texterkennung)

Kurz und klar: Das bedeutet OCR (Texterkennung) im Zusammenhang mit Aufbewahrung, Vernichtung und Digitalisierung von Dokumenten.

Kurz erklärt: OCR wandelt den Text auf einem gescannten Bild in durchsuchbaren, kopierbaren Fließtext um.

OCR steht für „Optical Character Recognition" (optische Zeichenerkennung) und analysiert die Pixel eines gescannten Dokuments, um darin enthaltene Buchstaben und Wörter zu erkennen. Das Ergebnis ist meist eine PDF-Datei, die zusätzlich zum Bild eine unsichtbare Textebene enthält — das Dokument sieht weiterhin wie das eingescannte Original aus, lässt sich aber durchsuchen, kopieren und teilweise durchsuchbar archivieren.

Die Erkennungsqualität hängt stark von der Scanauflösung, der Bildschärfe und der Qualität des Originaldokuments ab: Handschrift, sehr kleine Schrift oder verblasste Ausdrucke werden schlechter erkannt als sauber gedruckter maschineller Text. Viele Dokumentenscanner bringen eine OCR-Software direkt mit, sodass die Texterkennung automatisch beim Scanvorgang mitläuft, statt nachträglich manuell gestartet werden zu müssen.

Verwandte Begriffe

← Zurück zum Lexikon