Obraz do przeszukiwalnego PDF
Zamień skan, zrzut ekranu lub zdjęcie w przeszukiwalny plik PDF w przeglądarce dzięki OCR Tesseract.js i pdf-lib. Bez wysyłania plików na serwer.
🔒 Działa całkowicie w Twojej przeglądarce — nic nie jest przesyłaneSpraw, by zeskanowany obraz był przeszukiwalny
Zdjęcie lub zrzut ekranu dokumentu łatwo udostępnić, ale trudno w nim wyszukiwać. Słowa są częścią obrazu, więc przeglądarka PDF nie znajdzie w pliku nazwiska, numeru faktury ani akapitu. To narzędzie Obraz do przeszukiwalnego PDF zachowuje oryginalny obraz jako widoczną stronę i dodaje do pliku PDF tekst OCR, dzięki czemu przeglądarki mogą wyszukiwać i zaznaczać rozpoznaną treść. Przydaje się przy jednostronicowych skanach, paragonach, listach, formularzach, zdjęciach tablic oraz zrzutach ekranu, które chcesz zarchiwizować jako PDF.
Wszystko działa w przeglądarce. Tesseract.js odczytuje wczytany obraz za pomocą OCR opartego na WebAssembly, a pdf-lib tworzy nowy dokument PDF bez kontaktu z serwerem. Strona ma rozmiar obrazu, więc PDF wygląda jak plik źródłowy. Na obrazie rysowana jest niewielka, mało widoczna warstwa tekstu, dzięki której rozpoznane słowa są dostępne dla wyszukiwarki PDF i narzędzi do zaznaczania tekstu. Obraz, wynik OCR i gotowy PDF pozostają w lokalnej pamięci przeglądarki do czasu pobrania pliku.
Jak uzyskać lepsze przeszukiwalne pliki PDF
Zacznij od najwyraźniejszego obrazu, jaki masz. Proste skany i ostre zrzuty ekranu zwykle działają lepiej niż zdjęcia telefonem robione pod kątem. Jeśli fotografujesz papier, połóż dokument na płaskiej powierzchni, zadbaj o równomierne oświetlenie i trzymaj aparat równolegle do kartki. Jeśli to możliwe, przed wczytaniem przytnij biurko, krawędzie i cienie. Wysoki kontrast między literami a tłem pomaga OCR rozdzielać znaki, zwłaszcza w drobnym druku.
Przed utworzeniem PDF wybierz język odpowiadający dokumentowi. Przy pierwszym użyciu danego języka przeglądarka może pobrać silnik OCR i model, co może spowolnić pierwsze zadanie; kolejne są zwykle szybsze, ponieważ pliki trafiają do pamięci podręcznej. OCR nie jest doskonały, dlatego wyszukaj ważne wyrazy w gotowym PDF i porównaj je z oryginalnym obrazem, zanim użyjesz pliku w dokumentacji, umowach, fakturach lub innych zastosowaniach wymagających wysokiej dokładności.
Co zawiera wygenerowany PDF
Wynikowy PDF zawiera jedną stronę z oryginalnym obrazem w pełnym rozmiarze oraz zaznaczalną warstwę tekstu wygenerowaną przez OCR. Dzięki temu plik sprawdza się w archiwach osobistych, aplikacjach do notatek, folderach z dokumentami i załącznikach e-mail, gdzie preferowany jest PDF zamiast obrazu. Warstwa tekstu służy do wyszukiwania, a nie do idealnego odtworzenia wyglądu, więc złożone kolumny, tabele lub pismo odręczne mogą nie być dokładnie wyrównane. Przy zadaniach wielostronicowych skorzystaj z narzędzi do OCR dla PDF lub zbiorczego OCR i w razie potrzeby połącz pliki w specjalnym edytorze PDF.
Jak używać
- Dodaj obrazUpuść skan, zrzut ekranu lub zdjęcie w polu wczytywania albo kliknij, aby wybrać plik.
- Wybierz językWybierz język, który najlepiej pasuje do tekstu na obrazie.
- Utwórz PDFUruchom OCR, osadź obraz na stronie PDF i dodaj przeszukiwalną warstwę tekstu.
- PobierzZapisz przeszukiwalny PDF bezpośrednio z przeglądarki.