OT OCR Tools

Image en PDF recherchable

Transformez un scan, une capture d'écran ou une photo en PDF recherchable dans votre navigateur avec l'OCR Tesseract.js et pdf-lib. Sans envoi de fichier.

🔒 S'exécute entièrement dans votre navigateur — rien n'est téléchargé

Drop one image here or click to browse

The visible image and OCR text layer are assembled locally.

Choose an image to begin.

0%

Advertisement

Rendre une image numérisée recherchable

La photo ou la capture d'écran d'un document se partage facilement, mais elle est difficile à consulter par recherche. Les mots font partie de l'image : un lecteur PDF ne peut donc pas trouver un nom, un numéro de facture ou un paragraphe dans le fichier. Cet outil Image en PDF recherchable conserve votre image d'origine comme page visible et ajoute au PDF le texte OCR afin que les lecteurs puissent rechercher et sélectionner le contenu reconnu. Il est utile pour les scans d'une seule page, les reçus, les courriers, les formulaires, les photos de tableau blanc et les captures d'écran que vous souhaitez archiver en PDF.

Tout s'exécute dans le navigateur. Tesseract.js lit l'image importée grâce à l'OCR WebAssembly, et pdf-lib crée un nouveau document PDF sans contacter de serveur. La page est dimensionnée selon l'image, de sorte que le PDF ressemble au fichier source. Une petite couche de texte à faible opacité est dessinée sur l'image pour rendre les mots reconnus disponibles pour la recherche PDF et les outils de sélection de texte. L'image, le résultat OCR et le PDF final restent dans la mémoire locale du navigateur jusqu'au téléchargement du fichier.

Comment obtenir de meilleurs PDF recherchables

Partez de l'image la plus nette dont vous disposez. Les scans bien droits et les captures d'écran nettes donnent généralement de meilleurs résultats que les photos prises de biais avec un téléphone. Si vous photographiez du papier, posez le document sur une surface plane, utilisez un éclairage uniforme et gardez l'appareil parallèle à la page. Recadrez si possible les bureaux, bordures et ombres avant l'import. Un fort contraste entre les lettres et le fond aide l'OCR à distinguer les caractères, surtout pour les petits textes.

Sélectionnez la langue correspondant au document avant de créer le PDF. La première fois qu'une langue est utilisée, le navigateur peut télécharger le moteur OCR et le modèle, ce qui peut ralentir le premier traitement ; les suivants sont généralement plus rapides, car les fichiers sont mis en cache. L'OCR n'est pas parfait : recherchez donc les termes importants dans le PDF final et comparez-les à l'image d'origine avant d'utiliser le fichier pour des dossiers, contrats, factures ou autres usages exigeant une grande précision.

Ce que contient le PDF généré

Le PDF obtenu contient une page avec l'image d'origine en pleine taille et une couche de texte sélectionnable générée par l'OCR. Le fichier convient ainsi aux archives personnelles, aux applications de notes, aux dossiers de documents et aux pièces jointes d'e-mail pour lesquels le PDF est préféré à une image. La couche de texte vise la recherche plutôt qu'une reconstitution visuelle parfaite ; les colonnes complexes, les tableaux ou l'écriture manuscrite peuvent donc ne pas être parfaitement alignés. Pour les travaux de plusieurs pages, utilisez les outils d'OCR de PDF ou d'OCR par lots et fusionnez les fichiers avec un éditeur PDF dédié si nécessaire.

Comment utiliser

  1. Ajoutez une imageDéposez un scan, une capture d'écran ou une photo dans la zone d'import, ou cliquez pour parcourir vos fichiers.
  2. Choisissez la langueSélectionnez la langue qui correspond le mieux au texte de l'image.
  3. Créez le PDFLancez l'OCR, intégrez l'image dans une page PDF et ajoutez une couche de texte recherchable.
  4. TéléchargezEnregistrez le PDF recherchable directement depuis votre navigateur.

Questions fréquemment posées

Mon image est-elle envoyée pour créer le PDF ?
Non. L'OCR s'exécute localement avec Tesseract.js, et pdf-lib crée le PDF dans votre navigateur. L'image et le PDF recherchable restent sur votre appareil.
Pourquoi le premier PDF recherchable est-il plus lent ?
La première exécution télécharge le moteur OCR et le modèle de la langue choisie. Votre navigateur les met généralement en cache pour accélérer les exécutions suivantes.
Le texte sera-t-il parfaitement aligné avec l'image ?
Le PDF conserve l'image d'origine comme page visible et ajoute une petite couche de texte à faible opacité pour la recherche et la sélection. Ce n'est pas un éditeur OCR à mise en page parfaite.
Quels formats d'image sont pris en charge ?
Utilisez les formats d'image courants du navigateur, comme PNG, JPG, WebP ou des captures d'écran. L'outil convertit l'image en page PDF localement.
Advertisement