OCR de PDF a texto
Extrae texto de PDF escaneados en tu navegador con el renderizado de pdf.js y el OCR de Tesseract.js. Privado, gratis y sin subir archivos.
🔒 Se ejecuta completamente en tu navegador — nada se cargaExtrae texto de PDF escaneados de forma privada
Los PDF escaneados suelen parecer documentos normales, pero sus páginas son en realidad imágenes. Eso significa que no puedes seleccionar un párrafo, buscar un número ni pegar una sección en otra aplicación. Esta herramienta de OCR de PDF a texto convierte esas páginas que solo contienen imágenes en texto editable directamente en tu navegador. Es útil para escaneos antiguos, formularios en papel, recibos, páginas de libros, documentos firmados y cualquier PDF en el que copiar y buscar no funcionan porque el texto está atrapado en píxeles.
El proceso se realiza por completo en el cliente. pdfjs-dist carga tu archivo PDF local y renderiza cada página en un canvas HTML, igual que un visor de PDF del navegador muestra una página en pantalla. Después Tesseract.js lee ese canvas y devuelve las palabras reconocidas. La herramienta repite el proceso página por página, añade un separador claro entre páginas y coloca el texto combinado en un área de texto editable. Tu PDF y el texto extraído permanecen en tu dispositivo: no hay subida, cuenta ni cola en un servidor.
Consejos para un mejor OCR de PDF
La precisión del OCR depende de la calidad del escaneo. Las páginas rectas con texto oscuro sobre un fondo claro funcionan mejor. Las páginas borrosas, las sombras marcadas, la escritura a mano, las fuentes decorativas y los escaneos de baja resolución pueden reducir la precisión. Si tienes el documento original, vuelve a escanearlo con una resolución mayor antes de ejecutar el OCR. En escaneos hechos con la cámara, mantén el papel plano, recorta la mesa o el fondo y asegúrate de que la página esté iluminada de forma uniforme.
Elige el idioma que coincida con la mayor parte del documento. La primera vez que uses un idioma, es posible que el navegador tenga que descargar el motor de OCR y el modelo de idioma, por lo que la primera ejecución puede tardar más. Después, la caché del navegador suele acelerar los trabajos posteriores. Revisa siempre el resultado antes de usarlo en facturas, documentos legales, nombres, direcciones o números, porque el OCR puede confundir caracteres parecidos como O y 0 o I y 1.
Copia, edita y archiva el resultado
Cuando termina el reconocimiento, puedes editar el resultado directamente en el área de texto. Los separadores de página facilitan comparar el texto extraído con el PDF original y eliminar encabezados, números de página o restos del escaneo. Usa el botón de copiar para notas rápidas, borradores de correo y búsquedas, o descarga un archivo de texto plano si quieres archivar el resultado del OCR junto al PDF de origen. En documentos escaneados muy largos, ejecuta la herramienta con la pestaña abierta y evita pasar a modos de ahorro de energía que puedan pausar el trabajo del navegador.
Cómo usar
- Añade un PDFSuelta un PDF escaneado en el cuadro de carga o haz clic para elegirlo.
- Elige el idiomaSelecciona el idioma de OCR que mejor coincida con el documento.
- Ejecuta el OCRCada página se renderiza en un canvas y se reconoce localmente de forma secuencial.
- Copia o descargaRevisa el texto combinado y luego cópialo o guárdalo como archivo .txt.