OT OCR Tools

PDF naar tekst OCR

Haal tekst uit gescande pdf's in je browser met pdf.js-weergave en Tesseract.js-OCR. Privé, gratis en zonder uploads.

🔒 Draait volledig in uw browser — niets wordt geüpload

Drop one scanned PDF here or click to browse

Pages render and OCR locally in this browser tab.

Choose a PDF to begin.

0%

Advertisement

Haal privé tekst uit gescande pdf's

Gescande pdf's zien er vaak uit als gewone documenten, maar de pagina's zijn in werkelijkheid afbeeldingen. Dat betekent dat je geen alinea kunt selecteren, niet op een getal kunt zoeken en geen sectie in een andere app kunt plakken. Deze PDF naar tekst OCR-tool zet die pagina's met alleen afbeeldingen in je browser om in bewerkbare tekst. Handig voor oude scans, papieren formulieren, bonnetjes, boekpagina's, ondertekende documenten en elke pdf waarin kopiëren en zoeken niet werken omdat de tekst in pixels is opgesloten.

Het proces vindt volledig aan de clientzijde plaats. pdfjs-dist laadt je lokale pdf-bestand en rendert elke pagina op een HTML-canvas, zoals een pdf-viewer in de browser een pagina op het scherm toont. Tesseract.js leest dat canvas vervolgens en geeft de herkende woorden terug. De tool herhaalt dit pagina voor pagina, voegt een duidelijke scheiding tussen pagina's toe en plaatst de samengevoegde tekst in een bewerkbaar tekstvak. Je pdf en de uitgelezen tekst blijven op je apparaat: geen upload, geen account en geen serverwachtrij.

Tips voor betere pdf-OCR

De nauwkeurigheid van OCR hangt af van de kwaliteit van de scan. Rechte pagina's met donkere tekst op een lichte achtergrond werken het best. Onscherpe pagina's, zware schaduwen, handschrift, sierlijke lettertypen en scans met een lage resolutie kunnen de nauwkeurigheid verlagen. Is het brondocument beschikbaar, scan het dan opnieuw met een hogere resolutie voordat je OCR uitvoert. Houd bij scans met de camera het papier vlak, snijd de tafel of achtergrond weg en zorg dat de pagina gelijkmatig is verlicht.

Kies de taal die bij het grootste deel van het document past. De eerste keer dat je een taal gebruikt, moet de browser mogelijk de OCR-engine en het taalmodel downloaden, dus de eerste run kan langer duren. Daarna maakt browsercaching latere taken meestal sneller. Controleer het resultaat altijd voordat je het gebruikt voor facturen, juridische documenten, namen, adressen of getallen, want OCR kan soortgelijke tekens zoals O en 0 of I en 1 verwarren.

Het resultaat kopiëren, bewerken en archiveren

Als de herkenning klaar is, kun je het resultaat direct in het tekstvak bewerken. Paginascheidingen maken het makkelijker om de uitgelezen tekst met de originele pdf te vergelijken en koptekst, paginanummers of scanartefacten te verwijderen. Gebruik de kopieerknop voor snelle notities, e-mailconcepten en zoekopdrachten, of download een tekstbestand om de OCR-uitvoer naast de bron-pdf te archiveren. Laat bij zeer lange gescande documenten het tabblad open en vermijd energiebesparingsmodi die het werk van de browser kunnen pauzeren.

Hoe te gebruiken

  1. Voeg een pdf toeSleep één gescande pdf naar het uploadvak of klik om er een te kiezen.
  2. Kies de taalSelecteer de OCR-taal die het best bij het document past.
  3. Voer OCR uitElke pagina wordt op een canvas gerenderd en achter elkaar lokaal herkend.
  4. Kopieer of downloadControleer de samengevoegde tekst en kopieer die of sla hem op als .txt-bestand.

Veelgestelde vragen

Worden gescande pdf's geüpload voor OCR?
Nee. De pdf-pagina's worden in je browser gerenderd met pdfjs-dist en Tesseract.js leest de paginabeelden lokaal. Er wordt niets geüpload.
Waarom is de eerste OCR-run langzamer?
Bij de eerste run worden de OCR-engine en het gekozen taalmodel gedownload. Browsers cachen die bestanden meestal, dus latere OCR-runs zijn sneller.
Werkt dit ook op gewone tekst-pdf's?
Het kan gerenderde pagina's met OCR verwerken, maar bij digitale pdf's met selecteerbare tekst is direct kopiëren vaak sneller. Deze tool is het best voor gescande pdf's of pdf's met alleen afbeeldingen.
Kan ik de uitgelezen tekst opslaan?
Ja. Het samengevoegde resultaat verschijnt in een bewerkbaar tekstvak met paginascheidingen en je kunt het kopiëren of downloaden als .txt-bestand.
Advertisement