OCR z PDF na tekst
Wyodrębniaj tekst ze skanowanych plików PDF w przeglądarce dzięki renderowaniu pdf.js i OCR Tesseract.js. Prywatnie, za darmo i bez przesyłania.
🔒 Działa całkowicie w Twojej przeglądarce — nic nie jest przesyłanePrywatne wyodrębnianie tekstu ze skanowanych plików PDF
Skanowane pliki PDF często wyglądają jak zwykłe dokumenty, ale ich strony to w rzeczywistości obrazy. Oznacza to, że nie można zaznaczyć akapitu, wyszukać liczby ani wkleić fragmentu do innej aplikacji. Narzędzie OCR z PDF na tekst zamienia takie strony zawierające wyłącznie obrazy na edytowalny tekst bezpośrednio w przeglądarce. Przydaje się przy starych skanach, papierowych formularzach, paragonach, stronach książek, podpisanych dokumentach oraz w każdym pliku PDF, w którym kopiowanie i wyszukiwanie nie działają, bo tekst jest uwięziony w pikselach.
Cały proces odbywa się po stronie klienta. Biblioteka pdfjs-dist wczytuje lokalny plik PDF i renderuje każdą stronę na elemencie canvas HTML, podobnie jak przeglądarkowa przeglądarka PDF wyświetla stronę na ekranie. Następnie Tesseract.js odczytuje ten canvas i zwraca rozpoznane słowa. Narzędzie powtarza to strona po stronie, dodaje wyraźny separator między stronami i umieszcza połączony tekst w edytowalnym polu tekstowym. Twój plik PDF i wyodrębniony tekst pozostają na Twoim urządzeniu – bez przesyłania, konta i kolejki na serwerze.
Wskazówki dla lepszego OCR w plikach PDF
Dokładność OCR zależy od jakości skanu. Najlepiej sprawdzają się proste strony z ciemnym tekstem na jasnym tle. Nieostre strony, mocne cienie, pismo odręczne, ozdobne czcionki i skany o niskiej rozdzielczości mogą obniżyć dokładność. Jeśli masz dostęp do oryginału, zeskanuj go ponownie w wyższej rozdzielczości przed uruchomieniem OCR. W przypadku zdjęć aparatem trzymaj kartkę płasko, przytnij stół lub tło i zadbaj o równomierne oświetlenie strony.
Wybierz język odpowiadający większości dokumentu. Przy pierwszym użyciu danego języka przeglądarka może musieć pobrać silnik OCR i model językowy, więc pierwsze uruchomienie może trwać dłużej. Potem buforowanie w przeglądarce zwykle przyspiesza kolejne zadania. Zawsze sprawdź wynik, zanim użyjesz go w fakturach, dokumentach prawnych, imionach, adresach lub liczbach, ponieważ OCR może pomylić podobne znaki, takie jak O i 0 albo I i 1.
Kopiowanie, edycja i archiwizacja wyniku
Gdy rozpoznawanie się zakończy, możesz edytować wynik bezpośrednio w polu tekstowym. Separatory stron ułatwiają porównanie wyodrębnionego tekstu z oryginalnym plikiem PDF oraz usunięcie nagłówków, numerów stron lub artefaktów skanowania. Użyj przycisku kopiowania do szybkich notatek, szkiców e-maili i wyszukiwania, albo pobierz zwykły plik tekstowy, aby zarchiwizować wynik OCR obok źródłowego pliku PDF. Przy bardzo długich skanowanych dokumentach uruchom narzędzie, pozostawiając kartę otwartą, i unikaj przełączania na tryby oszczędzania energii, które mogą wstrzymać pracę przeglądarki.
Jak używać
- Dodaj plik PDFUpuść jeden skanowany plik PDF na pole przesyłania lub kliknij, aby go wybrać.
- Wybierz językWybierz język OCR, który najlepiej pasuje do dokumentu.
- Uruchom OCRKażda strona jest renderowana na canvas i rozpoznawana lokalnie po kolei.
- Skopiuj lub pobierzSprawdź połączony tekst, a następnie skopiuj go lub zapisz jako plik .txt.