← Blog

Por qué no puedes seleccionar el texto de un PDF

Intentas copiar un párrafo y el ratón solo dibuja un rectángulo azul. No está roto: es que ahí dentro no hay texto, hay una fotografía.

Publicidad

Te pasan un PDF, necesitas copiar un par de frases, y al arrastrar el ratón no se resalta nada — o se marca un recuadro que abarca media página. Ctrl+F tampoco encuentra palabras que estás viendo con tus propios ojos.

No es un fallo del programa ni del archivo. Es que ese PDF no contiene texto.

Lo que hay realmente dentro

Un PDF puede guardar su contenido de dos formas completamente distintas, y por fuera se ven igual.

Como texto: el archivo sabe que ahí pone «Contrato de arrendamiento», con esa tipografía y en esa posición. Puedes seleccionarlo, copiarlo, buscarlo, y un lector de pantalla puede leerlo en voz alta.

Como imagen: el archivo solo sabe que tiene que dibujar una fotografía. Que esa fotografía contenga letras le resulta indiferente — para él son manchas de color. Tú las lees porque tienes ojos y cerebro; el ordenador no.

Por qué acaba siendo una imagen

  • Se escaneó. La causa más común. Un escáner es una cámara: produce imágenes, no texto.
  • Es una foto del móvil. Igual que lo anterior.
  • Se comprimió. Casi todos los compresores convierten cada página en imagen para poder reducirla. El documento adelgaza y, de paso, pierde el texto.
  • Se protegió a propósito. Algunas empresas exportan como imagen precisamente para que el contenido no se pueda copiar ni modificar con facilidad.

Cómo confirmarlo en un segundo

Pulsa Ctrl+F (o Cmd+F) y busca una palabra que estés viendo en pantalla. Si el buscador dice que no hay resultados, confirmado: es una imagen.

Por qué esto importa más de lo que parece

Un PDF que es imagen tiene tres consecuencias que suelen descubrirse en mal momento:

Google no puede leerlo. Si publicas documentos escaneados en tu web, para los buscadores están en blanco. No aparecerán en resultados por su contenido.

No es accesible. Una persona ciega que use lector de pantalla no puede acceder a ese documento en absoluto. En trámites y documentación pública esto puede ser un incumplimiento.

Pesa mucho más. Una página de texto ocupa unas decenas de kilobytes; la misma página escaneada, varios megas. Es la razón de que los documentos escaneados sean tan pesados.

Qué puedes hacer

Si necesitas el texto

Lo que necesitas se llama OCR (reconocimiento óptico de caracteres): un programa que mira la imagen, reconoce las formas de las letras y reconstruye el texto.

Opciones sin instalar nada: Google Drive hace OCR gratis — sube el PDF, clic derecho, «Abrir con → Documentos de Google», y te devuelve el texto (con erratas, pero funciona). Microsoft OneNote y Adobe Acrobat también lo incorporan.

Cuenta siempre con revisar el resultado: el OCR confunde con frecuencia el 0 con la O, el 1 con la l, y se pierde con manuscritos, sellos y escaneos torcidos.

Si solo necesitas leerlo o enviarlo

Entonces no tienes ningún problema que resolver. El documento se ve e imprime perfectamente. Si pesa demasiado, comprimirlo es justo lo indicado, porque al ser ya una imagen no pierdes nada que tuvieras.

Si quieres evitarlo en el futuro

Cuando el documento lo generas tú, exporta a PDF desde el programa original —Word, Excel, Google Docs— en lugar de imprimir y escanear. Conservarás el texto, el archivo pesará una fracción y será accesible y buscable.

Parece obvio, pero es sorprendente la cantidad de documentos que se imprimen solo para volver a escanearlos, perdiendo todo por el camino.

Un apunte sobre comprimir

Como comprimir convierte las páginas en imágenes, comprimir un PDF de texto le quita el texto. Si el documento tiene que seguir siendo buscable, no lo comprimas: reduce el peso por otra vía, dividiéndolo o quitando páginas.

En un documento que ya era escaneado, en cambio, comprimir no te quita nada, porque no había texto que perder.

Publicidad

Preguntas frecuentes

¿Por qué no puedo copiar el texto de un PDF escaneado?

Porque el archivo no contiene texto, sino una fotografía de cada página. Las letras que ves son parte de la imagen, así que el ordenador no puede identificarlas como palabras.

¿Cómo convierto un PDF escaneado en texto seleccionable?

Necesitas OCR. Google Drive lo hace gratis: sube el PDF y ábrelo con Documentos de Google. También lo incorporan OneNote y Adobe Acrobat. Revisa siempre el resultado, porque el OCR comete erratas.

¿Comprimir un PDF le quita el texto seleccionable?

Sí, si el documento lo tenía. La compresión convierte cada página en imagen, y con ello el texto deja de poder seleccionarse o buscarse. En un PDF ya escaneado no se pierde nada, porque no había texto.

¿Google indexa el contenido de un PDF escaneado?

No por su texto. Para los buscadores, un PDF que es solo imagen está prácticamente vacío, así que no aparecerá en resultados por lo que dice dentro.

Herramientas relacionadas

Comprimir PDF

Reduce el peso de un PDF demasiado grande para enviarlo.

Dividir PDF

Separa un PDF en páginas sueltas o extrae solo las que necesitas.

Combinar PDF

Une varios documentos PDF en un solo archivo.

Más artículos