OT OCR Tools

PDF-zu-Text-OCR

Extrahieren Sie Text aus gescannten PDFs im Browser mit pdf.js-Rendering und Tesseract.js-OCR. Privat, kostenlos und ohne Upload.

🔒 Läuft vollständig in Ihrem Browser — nichts wird hochgeladen

Drop one scanned PDF here or click to browse

Pages render and OCR locally in this browser tab.

Choose a PDF to begin.

0%

Advertisement

Text aus gescannten PDFs privat extrahieren

Gescannte PDFs sehen oft wie normale Dokumente aus, doch die Seiten sind in Wahrheit Bilder. Das bedeutet: Sie können weder einen Absatz markieren noch nach einer Zahl suchen oder einen Abschnitt in eine andere App einfügen. Dieses PDF-zu-Text-OCR-Tool wandelt solche reinen Bildseiten direkt in Ihrem Browser in bearbeitbaren Text um. Es eignet sich für alte Scans, Papierformulare, Belege, Buchseiten, unterschriebene Dokumente und jedes PDF, bei dem Kopieren und Suchen nicht funktionieren, weil der Text in Pixeln steckt.

Der gesamte Vorgang läuft clientseitig ab. pdfjs-dist lädt Ihre lokale PDF-Datei und rendert jede Seite auf einem HTML-Canvas, ähnlich wie ein PDF-Viewer im Browser eine Seite auf dem Bildschirm darstellt. Tesseract.js liest dann dieses Canvas und liefert die erkannten Wörter zurück. Das Tool wiederholt den Vorgang Seite für Seite, fügt zwischen den Seiten eine klare Trennlinie ein und legt den gesamten Text in einem bearbeitbaren Textfeld ab. Ihr PDF und der extrahierte Text bleiben auf Ihrem Gerät – es gibt keinen Upload, kein Konto und keine Server-Warteschlange.

Tipps für bessere PDF-OCR

Die OCR-Genauigkeit hängt von der Qualität des Scans ab. Gerade Seiten mit dunklem Text auf hellem Hintergrund funktionieren am besten. Unscharfe Seiten, starke Schatten, Handschrift, verzierte Schriften und Scans mit niedriger Auflösung können die Genauigkeit verringern. Wenn das Originaldokument verfügbar ist, scannen Sie es vor der OCR noch einmal mit höherer Auflösung. Halten Sie bei Kameraaufnahmen das Papier flach, schneiden Sie Tisch oder Hintergrund weg und sorgen Sie für eine gleichmäßige Beleuchtung der Seite.

Wählen Sie die Sprache, die dem Großteil des Dokuments entspricht. Bei der ersten Nutzung einer Sprache muss der Browser möglicherweise die OCR-Engine und das Sprachmodell herunterladen, daher kann der erste Durchlauf länger dauern. Danach beschleunigt das Browser-Caching künftige Aufträge in der Regel. Prüfen Sie das Ergebnis immer, bevor Sie es für Rechnungen, Rechtsdokumente, Namen, Adressen oder Zahlen verwenden, denn OCR kann ähnliche Zeichen wie O und 0 oder I und 1 verwechseln.

Ergebnis kopieren, bearbeiten und archivieren

Nach der Erkennung können Sie das Ergebnis direkt im Textfeld bearbeiten. Seitentrenner erleichtern den Vergleich des extrahierten Texts mit dem Original-PDF und das Entfernen von Kopfzeilen, Seiten- zahlen oder Scan-Artefakten. Nutzen Sie die Kopierschaltfläche für schnelle Notizen, E-Mail-Entwürfe und Suchen, oder laden Sie eine reine Textdatei herunter, um das OCR-Ergebnis neben dem Quell-PDF zu archivieren. Lassen Sie bei sehr langen gescannten Dokumenten den Tab geöffnet und vermeiden Sie den Wechsel in Energiesparmodi, die die Arbeit des Browsers anhalten können.

So verwenden Sie

  1. PDF hinzufügenZiehen Sie ein gescanntes PDF auf das Upload-Feld oder klicken Sie, um es auszuwählen.
  2. Sprache wählenWählen Sie die OCR-Sprache, die am besten zum Dokument passt.
  3. OCR startenJede Seite wird auf ein Canvas gerendert und der Reihe nach lokal erkannt.
  4. Kopieren oder herunterladenPrüfen Sie den zusammengeführten Text und kopieren Sie ihn oder speichern Sie ihn als .txt-Datei.

Häufig gestellte Fragen

Werden gescannte PDFs für die OCR hochgeladen?
Nein. Die PDF-Seiten werden in Ihrem Browser mit pdfjs-dist gerendert, und Tesseract.js liest die Seitenbilder lokal. Es wird nichts hochgeladen.
Warum ist der erste OCR-Durchlauf langsamer?
Beim ersten Durchlauf werden die OCR-Engine und das gewählte Sprachmodell heruntergeladen. Browser speichern diese Dateien meist im Cache, sodass spätere OCR-Durchläufe schneller sind.
Funktioniert das auch bei normalen Text-PDFs?
Es kann gerenderte Seiten per OCR erfassen, doch bei digitalen PDFs mit markierbarem Text geht direktes Kopieren oft schneller. Das Tool eignet sich am besten für gescannte oder reine Bild-PDFs.
Kann ich den extrahierten Text speichern?
Ja. Das zusammengeführte Ergebnis erscheint in einem bearbeitbaren Textfeld mit Seitentrennern, und Sie können es kopieren oder als .txt-Datei herunterladen.
Advertisement