OCR da PDF a testo
Estrai il testo dai PDF scansionati nel browser con il rendering di pdf.js e l'OCR di Tesseract.js. Privato, gratuito e senza caricamenti.
🔒 Funziona interamente nel tuo browser — nulla viene caricatoEstrarre il testo dai PDF scansionati in modo privato
I PDF scansionati sembrano spesso documenti normali, ma le pagine sono in realtà immagini. Questo significa che non puoi selezionare un paragrafo, cercare un numero o incollare una sezione in un'altra app. Questo strumento OCR da PDF a testo trasforma quelle pagine composte solo da immagini in testo modificabile direttamente nel browser. È utile per vecchie scansioni, moduli cartacei, ricevute, pagine di libri, documenti firmati e qualsiasi PDF in cui copia e ricerca non funzionano perché il testo è intrappolato nei pixel.
L'intero processo avviene lato client. pdfjs-dist carica il file PDF locale e ne renderizza ogni pagina su un canvas HTML, proprio come fa il visualizzatore PDF di un browser sullo schermo. Tesseract.js legge poi quel canvas e restituisce le parole riconosciute. Lo strumento ripete l'operazione pagina per pagina, aggiunge un separatore chiaro tra le pagine e inserisce il testo combinato in un'area di testo modificabile. Il PDF e il testo estratto restano sul tuo dispositivo: nessun caricamento, nessun account, nessuna coda su un server.
Consigli per un OCR dei PDF più preciso
L'accuratezza dell'OCR dipende dalla qualità della scansione. Le pagine dritte con testo scuro su sfondo chiaro funzionano meglio. Pagine sfocate, ombre marcate, scrittura a mano, caratteri decorativi e scansioni a bassa risoluzione possono ridurre la precisione. Se il documento originale è disponibile, scansionalo di nuovo a una risoluzione più alta prima di avviare l'OCR. Per le scansioni con la fotocamera, tieni il foglio piatto, ritaglia il tavolo o lo sfondo e assicurati che la pagina sia illuminata in modo uniforme.
Scegli la lingua che corrisponde alla maggior parte del documento. La prima volta che usi una lingua, il browser potrebbe dover scaricare il motore OCR e il modello linguistico, quindi la prima esecuzione può richiedere più tempo. In seguito la cache del browser rende di solito più veloci i lavori successivi. Controlla sempre il risultato prima di usarlo per fatture, documenti legali, nomi, indirizzi o numeri, perché l'OCR può confondere caratteri simili come O e 0 oppure I e 1.
Copiare, modificare e archiviare il risultato
Al termine del riconoscimento puoi modificare il risultato direttamente nell'area di testo. I separatori di pagina rendono più semplice confrontare il testo estratto con il PDF originale e rimuovere intestazioni, numeri di pagina o artefatti di scansione. Usa il pulsante di copia per appunti rapidi, bozze di e-mail e ricerche, oppure scarica un file di testo semplice per archiviare il risultato OCR accanto al PDF di origine. Per documenti scansionati molto lunghi, esegui lo strumento tenendo aperta la scheda ed evita di passare alle modalità di risparmio energetico, che possono mettere in pausa il lavoro del browser.
Come usare
- Aggiungi un PDFTrascina un PDF scansionato nella casella di caricamento oppure fai clic per sceglierlo.
- Scegli la linguaSeleziona la lingua OCR che corrisponde meglio al documento.
- Avvia l'OCROgni pagina viene renderizzata su un canvas e riconosciuta localmente in sequenza.
- Copia o scaricaControlla il testo combinato, poi copialo o salvalo come file .txt.