Saltar al contenido
ChasquiPDF Tu navaja suiza para PDF

← Todas las herramientas

OCR (PDF escaneado)

Convierte un escaneo en un PDF donde se puede buscar y copiar texto. Tambien extrae ese texto a .txt.

Opciones

Se listan solo los idiomas instalados (7). Para anadir mas, deja el .traineddata en storage/tessdata.

Que quieres obtener

Un PDF escaneado es, por dentro, una foto: no puedes buscar en el, ni copiar una linea, ni seleccionar un importe. El OCR (reconocimiento optico de caracteres) lee esas imagenes y les anade una capa de texto invisible encima, de modo que el documento sigue viendose igual pero ya se puede buscar, copiar e indexar.

Como aplicar OCR a un PDF escaneado, paso a paso

  1. Sube el PDF escaneado o la imagen del documento.
  2. Elige el idioma del texto: acertar con el idioma mejora mucho el reconocimiento de acentos y enes.
  3. Elige si quieres un PDF buscable o solo el texto en .txt, y descarga el resultado.

Preguntas frecuentes

Que precision tiene el OCR?

Sobre un escaneo limpio a 300 ppp suele superar el 95% de palabras correctas. Baja con documentos torcidos, con poco contraste, manuscritos o con tipografias muy decorativas.

Por que importa elegir bien el idioma?

Mucho. El mismo escaneo en espanol da "ano" o "espanol" mal escritos si lo procesas como ingles, porque el motor no espera enes ni tildes. Elegir espanol corrige practicamente todos esos casos.

Aumenta mucho el tamano del archivo?

No deberia. ChasquiPDF conserva las imagenes originales y solo anade la capa de texto, de modo que el PDF resultante suele pesar incluso algo menos que el de partida.

Sirve para textos manuscritos?

No. El OCR esta pensado para texto impreso; con letra a mano los resultados son muy pobres.

Herramientas relacionadas