Convertir documentos
Hacer un PDF buscable con OCR
Añade texto buscable a páginas escaneadas en más de 100 idiomas.
Elegir un archivo
Elige un PDF escaneado de hasta 80 páginas o 120 MB.
Cómo añadir OCR a un PDF escaneado
Un PDF escaneado contiene imágenes de las páginas. El OCR añade una capa de texto para buscar, seleccionar y copiar palabras sin cambiar la imagen visible.
Qué contiene un PDF buscable
Un PDF buscable combina la imagen original de cada página con una capa invisible de texto. La página mantiene su aspecto, pero Ctrl+F encuentra palabras y el contenido se puede seleccionar, copiar e indexar. La herramienta conserva la imagen visible y añade solo el texto reconocido.
Las páginas visibles no cambian. Solo se añade una capa invisible con cada línea reconocida en su posición correspondiente.
Cómo se reconoce el texto
Cada página que necesita reconocimiento se prepara con hasta 3.200 píxeles en su lado largo. En documentos fotografiados, se corrige la luz irregular antes de leer el texto. Esa imagen corregida solo se usa durante el reconocimiento y no sustituye a la página.
El reconocimiento usa Tesseract dentro del navegador. Puedes detectar el idioma o elegir entre más de cien modelos, incluidas escrituras de derecha a izquierda como el árabe y el hebreo. Las páginas que ya contienen texto se conservan, y el resumen indica cuántas necesitaron OCR.
Qué se comprueba al terminar
Antes de descargar, el resultado se vuelve a abrir. Se comparan el número, el tamaño, la orientación y el aspecto de las páginas, además del texto existente y el añadido. Si algo no coincide, no se ofrece la copia.
La herramienta se detiene si el PDF contiene una firma digital, porque añadir OCR la invalidaría. Si todo el texto legible ya es buscable, conserva el archivo original y no crea otra copia.
Límites del archivo para OCR
Cada trabajo admite hasta 80 páginas. Divide un documento más largo y procesa las partes por separado. Solo el paquete del idioma elegido puede necesitar una descarga; el PDF no se envía con esa petición.
El sistema operativo o un gestor documental puede indexar una carpeta de PDF buscables junto con otros archivos. Esto facilita localizar nombres, fechas o referencias en colecciones de escaneos.
Dónde se procesa el OCR
El navegador abre y dibuja el PDF, reconoce el texto y crea la capa buscable. El archivo, su nombre y el texto reconocido no se envían a un servidor de procesamiento.
Preguntas frecuentes
¿Qué es el OCR y cuándo lo necesito?
El OCR lee lo que está escrito en una página escaneada y añade encima una capa de texto invisible, para que puedas buscar y copiar el contenido del PDF. Lo necesitas cuando el texto de un PDF no se puede seleccionar ni encontrar.
¿Qué idiomas admite?
Hay más de 100 idiomas disponibles, incluidos español, árabe, alfabetos índicos, chino, japonés, coreano y variantes históricas.
¿El PDF se verá diferente?
No. El OCR añade texto Unicode invisible y buscable sobre las páginas originales, en lugar de reconstruir su apariencia visible.
¿El OCR sube mis páginas?
No se sube ninguna página del documento. El paquete de reconocimiento elegido se descarga y se guarda en caché, y el OCR se ejecuta en este navegador.