So extrahieren Sie Text aus Bildern und Screenshots
Müssen Sie Text aus einem Screenshot kopieren, ein Dokument scannen oder eine gedruckte Seite digitalisieren? Die OCR-Technologie macht es sofort möglich – und mit Presend geschieht es vollständig in Ihrem Browser.
Was ist OCR?
OCR (Optical Character Recognition) ist die Technologie, die Bilder von Text in maschinenlesbaren Text umwandelt. Damit können Sie:
- Kopieren Sie Text aus einem Screenshot einer Website, der die Auswahl blockiert
- Durchsuchen Sie gescannte PDFs
- Digitalisieren Sie gedruckte Dokumente, ohne sie noch einmal abtippen zu müssen
- Extrahieren Sie Daten aus Fotos von Quittungen, Formularen oder Schildern
- Übersetzen Sie Text in Bildern, indem Sie ihn zunächst extrahieren
Das Datenschutzrisiko von Cloud OCR
Die meisten OCR-Dienste – Google Vision, Azure Computer Vision, Amazon Textract – erfordern das Hochladen Ihres Bildes in deren Cloud. Dies ist problematisch für:
- Krankenakten– Patientendaten durch HIPAA/DSGVO geschützt
- Juristische Dokumente— Anwaltsgeheimnis, NDAs
- Finanzberichte— Bankdaten, Steuerunterlagen
- Geschützte Informationen— Interne Memos, Quellcode-Screenshots
- Persönliche Korrespondenz— Private Nachrichten, E-Mails
Sogar Dienste, die behaupten, Dateien sofort zu löschen, verarbeiten sie dennoch in ihrer Infrastruktur, wodurch Prüfpfade entstehen und potenzielle Gefährdungen entstehen.
So funktioniert Tesseract.js
Tesseract.jsist eine reine JavaScript-Portierung der Tesseract OCR-Engine von Google, kompiliert für WebAssembly. Es läuft vollständig in Ihrem Browser:
- Das Sprachmodell (traineddata) wird einmal pro Sprache heruntergeladen (~4 MB für Englisch).
- Das Bild wird lokal mit Ihrer CPU oder GPU verarbeitet
- Der erkannte Text wird direkt an die Webseite zurückgegeben
- Es wird nichts an einen externen Server übermittelt
Tesseract ist dieselbe Engine, die Google Books, die Kamerafunktion von Google Translate und unzählige Apps zum Scannen von Dokumenten antreibt. Es unterstütztÜber 100 Spracheneinschließlich Skripten wie Arabisch, Chinesisch, Japanisch, Devanagari und Kyrillisch.
Unterstützte Eingabemethoden
- Ziehen und ablegen— Legen Sie ein beliebiges Bild auf dem Werkzeug ab
- Dateiauswahl— Klicken Sie, um ein Bild zu durchsuchen und auszuwählen
- Aus der Zwischenablage einfügen— Drücken Sie Strg+V (oder Befehl+V) an einer beliebigen Stelle auf der Seite, um einen Screenshot direkt einzufügen
Genauigkeitstipps
- Auflösung ist wichtig— Bilder mit höherer Auflösung führen zu besseren Ergebnissen. 300 DPI ist ideal für gescannte Dokumente.
- Der Kontrast ist der Schlüssel— Dunkler Text auf hellem Hintergrund funktioniert am besten. Invertierte Farben oder geringer Kontrast verringern die Genauigkeit.
- Verzerrung minimieren— Gerader, nicht gedrehter Text ist am einfachsten zu erkennen
- Saubere Bilder— Entfernen Sie nach Möglichkeit Rauschen, Falten und Schatten
- Richtige Sprache— Wählen Sie im Dropdown-Menü die richtige Sprache aus. Text in gemischten Sprachen funktioniert, weist jedoch möglicherweise eine geringere Genauigkeit auf
Anwendungsfälle
- Studenten— Kopieren Sie Text aus Lehrbuchfotos oder Vorlesungsfolien
- Entwickler— Extrahieren Sie Code aus Screenshots oder Fehlermeldungen
- Journalisten— Zitieren Sie Text aus Bildern von Dokumenten
- Forscher— Digitalisieren Sie gedruckte Arbeiten und Artikel
- Administratoren— Konvertieren Sie gescannte Formulare in bearbeitbaren Text
- Reisende— Schilder, Speisekarten und Dokumente in Fremdsprachen lesen
Schritt-für-Schritt-Anleitung
- Öffnen Sie das Tool– Gehe zuScreenshot zum Text
- Sprache auswählen— Wählen Sie die Sprache des Textes in Ihrem Bild
- Hochladen oder einfügen— Ziehen Sie ein Bild, klicken Sie, um es auszuwählen, oder drücken Sie Strg+V, um es aus der Zwischenablage einzufügen
- Warten Sie auf Anerkennung— Die Verarbeitung dauert je nach Bildgröße einige Sekunden
- Überprüfen und bearbeiten— Überprüfen Sie den extrahierten Text auf Fehler
- Kopieren oder herunterladen— Als TXT-Datei speichern oder in die Zwischenablage kopieren
Einschränkungen
- Handschrift— Tesseract funktioniert am besten mit gedrucktem Text. Bei kursiver oder unordentlicher Handschrift ist die Genauigkeit geringer.
- Komplexe Layouts– Mehrspaltiger Text, Tabellen und Formulare müssen möglicherweise manuell neu formatiert werden.
- Dekorative Schriftarten— Stilisierter oder künstlerischer Text wird möglicherweise nicht erkannt.
- Sehr kleiner Text– Text unter 10 Pixel wird möglicherweise übersehen.