PDF escaneado frente a PDF de texto, y el OCR

2026-07-06 · 6 min

Aunque parezcan iguales, por dentro son muy distintos. Por qué no puedes buscar el texto y cuándo necesitas OCR.

Iguales por fuera, distintos por dentro

Hay dos grandes tipos de PDF. Uno se crea con 'Guardar como PDF' desde Word u otro editor, y las letras son datos de texto reales. El otro se crea escaneando papel o haciendo una foto, y en realidad es solo una imagen.

Para el ojo humano parecen el mismo documento. Pero para el ordenador son completamente distintos: en el primero puede leer el texto; en el segundo solo ve un conjunto de puntos.

Comprueba en 30 segundos cuál es el tuyo

Lo más fácil es intentar seleccionar el texto con el ratón. Si se resalta, es un PDF de texto. Si no se selecciona por más que arrastres y solo marcas un área rectangular, es un PDF escaneado.

Otra forma es buscar: pulsa Ctrl+F y busca una palabra que sepas que está en el documento. Si no la encuentra, es que no es texto, sino imagen.

Qué es el OCR

El OCR (reconocimiento óptico de caracteres) es la tecnología que lee las letras dentro de una imagen y las convierte en texto. Aplicado a un PDF escaneado, mantiene el aspecto visual pero añade por detrás la información de texto, de modo que ya puedes buscar y copiar.

Sin embargo, el OCR no es perfecto. Si la impresión es de mala calidad, hay letra manuscrita o el texto está inclinado, aparecen errores de reconocimiento. Por eso conviene revisar siempre el resultado, sobre todo cifras importantes como importes, cantidades o fechas.

Lo mejor es evitar el escaneo desde el principio

Siempre que puedas, guarda el PDF directamente desde el archivo original. Imprimir un documento de Word para volver a escanearlo es convertir un texto perfecto en una foto: pierdes la búsqueda y aumentas el tamaño.

Cuando necesites una firma, puedes escanear solo la página firmada y unirla al PDF original de texto, manteniendo la calidad y la capacidad de búsqueda del resto.

Prueba ahora a unir o dividir tu PDF.