Convertir un PDF escaneado en texto buscable
Un escaneo es solo una foto de la página: no puedes buscar en él ni copiar una palabra. El OCR lee la imagen y descargas un PDF con texto buscable, un archivo de texto o ambos.
- Los archivos nunca salen de tu navegador.
- Sin cuenta
- Sin marca de agua
- Funciona en cualquier dispositivo
Cómo funciona
Paso 1: Elige o suelta un PDF escaneado, o una imagen JPG o PNG.
Paso 2: Selecciona uno o varios idiomas que coincidan con el texto y la salida: PDF buscable, archivo de texto o ambos.
Paso 3: Decide si se omiten las páginas que ya tienen texto y elige 200 o 300 DPI.
Paso 4: Pulsa OCR PDF, espera a que se procese cada página y descarga el resultado.
Qué hace el OCR con un documento escaneado
OCR significa reconocimiento óptico de caracteres. Cada página se dibuja como imagen, el motor de reconocimiento (Tesseract.js, que se ejecuta como WebAssembly en tu navegador) lee las letras y el texto se guarda junto con la posición de cada palabra en la página. En un PDF buscable, ese texto queda invisible detrás de la imagen original: la página se ve igual, pero puedes buscar en ella, seleccionarla y copiar fragmentos.
También puedes descargar el texto reconocido como archivo .txt, útil para pegarlo en un editor o pasarlo a otra herramienta. Primero eliges los idiomas, luego si se omiten las páginas que ya tienen texto y la resolución con la que se dibujan las páginas (200 o 300 DPI). Además de PDF, la herramienta acepta imágenes JPG y PNG como entrada.
Los documentos nunca se suben. Lo único que se descarga de la red es el motor OCR y los datos de idioma, desde un CDN público (jsDelivr) la primera vez que usas la herramienta, unos pocos megabytes en total. El CDN ve tu dirección IP y las cabeceras habituales de la petición, pero no tus documentos.
Por qué usar esta herramienta
Documentos sin subir
El reconocimiento se hace en tu navegador. Solo se descargan, una vez, el motor y los archivos de idioma desde un CDN público; tus páginas no salen de tu dispositivo.
Buscable y seleccionable
Con idiomas de alfabeto latino obtienes un PDF donde Ctrl+F funciona y puedes resaltar y copiar un párrafo, manteniendo el aspecto original de la página.
Diez idiomas, combinables
Hay inglés, francés, español, árabe, alemán, italiano, portugués, neerlandés, turco y ruso, y puedes marcar varios para páginas bilingües.
Omite lo que ya es texto
En un archivo que mezcla escaneos y páginas digitales, puedes dejar aparte las páginas que ya tienen texto y ahorrar tiempo.
Usos habituales
Buscar en un archivo de cartas antiguas escaneadas
Un archivo familiar o una pequeña oficina tiene cientos de escaneos nombrados solo por fecha. Tras el OCR, buscas un apellido en todos los resultados en lugar de abrir cada archivo.
Copiar un pasaje de un capítulo escaneado
Una estudiante fotografía un capítulo en la biblioteca y necesita una cita. El OCR lo convierte en texto que puede pegar en su trabajo y revisar después.
Extraer el texto de un documento en árabe o ruso
Para estos alfabetos la herramienta entrega el texto reconocido como descarga .txt, de modo que un contrato o aviso escaneado se pueda llevar a un editor o traducir.
Preparar un escaneo para otra herramienta
PDF a Word, PDF a Excel, PDF a texto y Comparar PDF leen texto y no encuentran nada en un escaneo. Pasa primero por OCR PDF para darles algo con lo que trabajar.
Digitalizar tickets y facturas
Un autónomo con la foto de un ticket en el móvil usa el JPG como entrada y obtiene texto del que copiar importes y fechas.
Páginas escaneadas o páginas que ya tienen texto
No todos los PDF necesitan OCR. Un archivo exportado desde un procesador de textos ya contiene texto real, y aplicarle OCR solo añadiría trabajo y pequeños errores. Un escaneo, en cambio, contiene solo imágenes. Prueba rápida: abre el archivo e intenta seleccionar una palabra con el cursor. Si no se resalta nada, o Ctrl+F no encuentra nada, las páginas son imágenes.
Los archivos mixtos son habituales, por ejemplo un contrato digital con unas páginas de firma escaneadas. La opción de omitir las páginas que ya tienen texto lo resuelve: las páginas digitales quedan intactas y solo se procesan las escaneadas. Después, el PDF buscable funciona con todas las herramientas de texto, así que puedes seguir con Comprimir PDF, PDF a Word o PDF a texto con resultados útiles.
- Prueba primero: si puedes seleccionar texto, la página no es un escaneo.
- Usa la opción de omitir en documentos mixtos.
- Busca después una palabra característica para confirmar el resultado.
Elegir idiomas y entender los alfabetos
El motor lee mejor cuando sabe qué esperar: selecciona el idioma del texto, no solo el que tú hablas. Si una página mezcla francés e inglés, marca ambos; el reconocimiento tarda algo más, pero deja de confundir los acentos de un idioma con ruido. Marcar muchos idiomas que no necesitas ralentiza el proceso y puede causar lecturas erróneas, así que elige solo los que aparecen en la página.
Hay una diferencia importante entre alfabetos. Para los idiomas de alfabeto latino (inglés, francés, español, alemán, italiano, portugués, neerlandés y turco), la herramienta puede crear un PDF buscable cuya capa de texto invisible queda detrás de la imagen de la página. Para árabe y ruso, que usan otros alfabetos, esa capa buscable no está disponible en esta herramienta. Los reconoce, pero entrega el resultado como archivo .txt. Si necesitas un PDF árabe buscable, esta herramienta no lo generará.
- Página bilingüe: marca los dos idiomas.
- Árabe o ruso: usa la descarga .txt.
- Cifras, fechas y nombres latinos dentro de una página árabe conviene revisarlos a ojo.
Cómo conseguir el resultado más preciso
La calidad de la imagen importa más que cualquier ajuste. La entrada más fiable es una página escaneada a 300 DPI, bien recta sobre el cristal, con luz uniforme y texto oscuro sobre fondo claro. Las fotos torcidas, las sombras, los pliegues, la tinta desvaída y la letra muy pequeña reducen la precisión. Si fotografías una página con el móvil, sostenlo paralelo al papel, evita tu propia sombra y llena el encuadre con la página.
Usa 300 DPI para letra pequeña, notas al pie y páginas densas, y 200 DPI cuando el texto es grande y quieres ir más rápido. Una resolución mayor también implica más memoria y más tiempo por página. Las tablas y los diseños a varias columnas se leen línea a línea, por lo que el orden del texto puede no coincidir con el diseño visual; revisa esas zonas a ojo.
- Escanea a 300 DPI o más siempre que puedas.
- Endereza y recorta las páginas inclinadas antes del OCR.
- No esperes un reconocimiento fiable de la escritura a mano.
- Revisa nombres, cifras y fechas comparándolos con la página original.
Formatos admitidos
- Entrada
- Archivos PDF (.pdf) e imágenes (.jpg, .jpeg, .png).
- Salida
- Un PDF buscable (imagen de la página más texto invisible) y/o un archivo de texto .txt.
La capa de texto del PDF buscable cubre idiomas de alfabeto latino. Para árabe y ruso, el texto reconocido se entrega como .txt.
Conviene saber
- La capa de texto invisible del PDF buscable solo admite idiomas de alfabeto latino. Para árabe y ruso obtienes el texto reconocido en un archivo .txt, no un PDF buscable.
- La precisión depende del escaneo: páginas a 300 DPI, rectas, bien iluminadas y con buen contraste dan los mejores resultados. La escritura a mano no se reconoce de forma fiable.
- El OCR es lento en documentos grandes: unos segundos por página en un portátil y más en un móvil.
- El primer uso descarga el motor y los datos de idioma desde un CDN público (jsDelivr), así que en ese momento hace falta conexión a internet.
- El reconocimiento puede equivocarse, sobre todo con letra pequeña, tablas y tipos de letra poco comunes; revisa todo lo importante.
Tus archivos nunca salen de tu navegador
Esta herramienta se ejecuta por completo en tu dispositivo, dentro del navegador. Tus archivos no se suben a nuestros servidores ni se guardan en ningún sitio. Al cerrar la pestaña se descarta todo.
El motor de OCR y los datos de idioma se descargan una sola vez desde una CDN pública la primera vez que usas OCR. Tus documentos nunca se suben.
Preguntas frecuentes
¿Se suben mis documentos para reconocerlos?
No. El reconocimiento se ejecuta en tu navegador y tus páginas nunca se suben. El motor OCR y los archivos de idioma se descargan una vez desde un CDN público (jsDelivr), que ve tu dirección IP y las cabeceras habituales de la petición, pero no tus documentos.
¿Qué idiomas admite OCR PDF?
Inglés, francés, español, árabe, alemán, italiano, portugués, neerlandés, turco y ruso. Puedes elegir uno o varios, por ejemplo cuando una página mezcla dos idiomas.
¿Puedo obtener un PDF buscable en árabe?
No. La capa de texto del PDF buscable funciona con idiomas de alfabeto latino. Para árabe y ruso, la herramienta reconoce el texto pero solo lo entrega como archivo .txt.
¿Cuánto tarda el OCR?
Calcula unos segundos por página en un portátil y más en un móvil, así que un documento largo puede tardar varios minutos. La primera vez además se invierte tiempo en descargar los datos de idioma.
¿Reconoce la escritura a mano?
No de forma fiable. El OCR funciona mejor con texto impreso; la escritura a mano suele salir con muchos errores o se pasa por alto.
¿Por qué el resultado tiene errores en algunos sitios?
Normalmente por la calidad de la imagen: poca resolución, inclinación, sombras, tinta desvaída o una tipografía que el motor no conoce. Vuelve a escanear a 300 DPI, elige el idioma correcto e inténtalo de nuevo.
Herramientas relacionadas
Guías relacionadas
- Cómo hacer buscable un PDF escaneadoConvierte un PDF escaneado en uno buscable con OCR: cómo saber si lo necesita, ajustes de idioma y DPI, qué esperar y cómo comprobar que el resultado funciona.
- Qué es el OCR y cómo funcionaEl OCR convierte imágenes de texto en texto real y buscable. Cómo funciona, qué influye en la precisión, sus límites con la letra manuscrita y qué produce.
- Cómo escanear documentos a PDFConvierte papel en un PDF limpio con la cámara del móvil o un escáner: consejos de luz y encuadre, orden de páginas, filtro de documento, tamaño y texto buscable.