Qué es en realidad un PDF y por qué no siempre puedes copiar el texto
Un PDF es una lista de instrucciones de dibujo. Dice: pon este glifo en esta coordenada, con esta fuente y a este tamaño; luego muévete aquí y dibuja el siguiente. No dice esto es un título, esto es un párrafo, esta columna va antes que aquella. Todo lo que un lector parece saber sobre la estructura de una página lo ha reconstruido después midiendo los huecos entre las marcas, lo que explica casi todo lo frustrante de los PDF.
Qué guarda de verdad un PDF
El texto de una página vive en un flujo de contenido, una secuencia corta de operadores:
BT
/F1 11 Tf
72 708 Td
[(In) -18 (v) 22 (oice)] TJ
180 0 Td
(2026-08-25) Tj
ET
Tf elige una fuente y un tamaño, Td mueve el cursor de texto y TJ dibuja glifos con desplazamientos de kerning entre ellos. Fíjate en lo que falta: no hay ningún carácter de espacio. El hueco anterior a la fecha es un salto de 180 unidades, y un extractor tiene que decidir si cada salto es un espacio, un tabulador, el límite de una columna o nada en absoluto. Un umbral un poco desviado te da Invoice2026-08-25 o I n v o i c e.
El orden de lectura tiene el mismo problema: los glifos salen en el orden en que se dibujaron. Una maquetación a dos columnas suele dibujar la columna izquierda de arriba abajo y después la derecha, en cuyo caso copiar funciona; si el generador dibujó línea a línea a lo ancho de la hoja, al copiar las columnas se entrelazan y no se entiende nada.
Distinguir un PDF de texto de un escaneo
Un documento escaneado no contiene texto en absoluto: es una fotografía de una página envuelta en un PDF. El reconocimiento óptico de caracteres añade una capa de texto invisible sobre la imagen, lo que hace que el archivo se pueda buscar, pero esa capa es una conjetura, así que sus errores salen a la luz como búsquedas fallidas y copias destrozadas.
| Comprobación | PDF de texto | PDF escaneado |
|---|---|---|
| Seleccionar una palabra | Se resalta carácter a carácter | No se selecciona nada, o se selecciona la página entera |
| Ampliar al 400% | Las letras siguen nítidas | Las letras se vuelven blandas o cuadriculadas |
| Tamaño por página | Normalmente de 20 a 100 KB | Normalmente de 300 KB a varios MB |
| Extraer imágenes del PDF | Devuelve las imágenes reales, o nada | Devuelve una imagen de página completa por cada página |
Fuentes, incrustación y subconjuntos
Una fuente o está incrustada, es decir, el programa de la fuente vive dentro del archivo, o está referenciada por nombre y métricas, de modo que el lector busca algo parecido en la máquina que la muestra. Las fuentes referenciadas son la razón por la que un documento se ve bien donde se hizo y mal en cualquier otro sitio: la sustituta tiene anchos de carácter distintos, así que las líneas se recomponen, las tablas se desbordan y una carta de una página pasa a ser de dos.
Las fuentes incrustadas casi siempre van en subconjuntos. Solo se incluyen los glifos que se usan, y a menudo se renumeran, así que el glifo de la A puede estar en el código 3. La correspondencia de vuelta a caracteres reales vive en una tabla ToUnicode aparte, y cuando falta o está mal la página se dibuja perfectamente mientras que el texto copiado llega como galimatías, porque lo que te entregan son códigos de glifo internos y no caracteres. Volver a guardar el archivo no lo arregla; las salidas son el documento de origen o el reconocimiento sobre las páginas renderizadas.
Tamaño de página, rectángulos y rotación
Las coordenadas van en puntos, a 72 por pulgada, y cada página lleva varios rectángulos. El MediaBox es la hoja completa; el CropBox es la región que se muestra en realidad, que puede ser más pequeña.
| Tamaño | Puntos | Milímetros |
|---|---|---|
| A4 | 595 x 842 | 210 x 297 |
| Letter | 612 x 792 | 216 x 279 |
| Legal | 612 x 1008 | 216 x 356 |
A4 y Letter se ven idénticos en pantalla y son distintos sobre papel, así que combinar un informe europeo con uno estadounidense da páginas que alternan de tamaño.
Cada página lleva además una marca de rotación de 0, 90, 180 o 270 grados, para que un contenido guardado de lado pueda mostrarse derecho. La herramienta de rotar PDF fija esa marca en lugar de redibujar nada, lo que la hace instantánea y sin pérdidas, pero las coordenadas de debajo no cambian: una herramienta que ignore la marca extrae el texto de lado, y combinar páginas con marcas mezcladas da un documento que parece homogéneo mientras que su contenido está en varias orientaciones.
Combinar, dividir y las partes que se rompen
Las páginas viven en un árbol de páginas. La herramienta de combinar PDF copia los objetos de página y todo lo que referencian a un solo archivo y reconstruye ese árbol; la de dividir PDF se lleva una rama. Las páginas pasan intactas; lo que va adjunto al documento no siempre.
- Los marcadores son un esquema aparte que apunta a objetos de página. Muchas herramientas de combinación lo descartan por completo, y al dividir quedan entradas apuntando a páginas que ya no están.
- Los campos de formulario se nombran a nivel de documento, no de página, así que combinar dos copias de un mismo formulario da dos campos llamados
name, que muchos lectores tratan como un solo campo con un valor compartido: rellenar uno rellena el otro. Aplánalos o renómbralos antes. - Las anotaciones, como los enlaces y los comentarios, viajan con sus páginas, pero un enlace interno cuya página de destino se quedó fuera de una división no tiene adónde ir.
Un archivo combinado suele ser más grande que sus partes porque los recursos compartidos se duplican: cuatro orígenes que incrustaron cada uno un subconjunto de la misma fuente dan cuatro subconjuntos, más cuatro perfiles de color y cuatro bloques de metadatos. También puede salir más pequeño, porque reescribirlo descarta los objetos sin usar y el historial de guardado: un documento guardado treinta veces lleva anexada cada revisión anterior.
Contraseñas, permisos y etiquetado
Hay dos tipos de contraseña y no son comparables. La contraseña de usuario hace falta para abrir el documento: el contenido está cifrado de verdad con una clave derivada de ella, así que sin ella no hay nada que leer. Los archivos modernos usan AES-256; los muy antiguos, RC4 de 40 bits, que es débil.
La contraseña de propietario activa marcas de permisos como no imprimir, no copiar y no editar. El archivo sigue cifrado, pero con una clave que cualquier lector puede derivar por su cuenta, porque la contraseña de usuario está vacía. Las marcas son una petición, que unos lectores respetan y otros ignoran: si un archivo se abre sin pedir nada, sus restricciones son orientativas, diga lo que diga el cuadro de propiedades.
El etiquetado es otra capa: un árbol de estructura opcional que marca títulos, listas, celdas de tabla y descripciones de figuras, y que fija un orden de lectura. Un lector de pantalla sobre un PDF etiquetado lee el documento; sobre uno sin etiquetar adivina a partir de las coordenadas, con el mismo resultado desordenado que el copiar y pegar. Los escaneos no están etiquetados por definición, el reconocimiento añade texto pero no estructura, y la salida de las herramientas de imágenes a PDF o de PDF a imágenes no tiene ninguna de las dos cosas.
Dónde está el tamaño y qué puede sostener el navegador
El tamaño del archivo son casi siempre las imágenes. Una página A4 necesita aproximadamente 1240 por 1754 píxeles a 150 dpi y 2480 por 3508 a 300 dpi, así que una fotografía colocada con 12 megapíxeles lleva muchos más datos de los que la impresión puede aprovechar, y reducir la resolución es el único cambio que encoge un documento de forma fiable. Volver a guardar un PDF que solo tiene texto aporta muy poco, porque sus flujos de contenido ya están comprimidos; cuando uno es inesperadamente grande, mira las fuentes incrustadas, el historial de guardado o los archivos adjuntos.
Todo esto ocurre localmente en el navegador, así que no se sube nada y el límite es la memoria, no el tamaño del archivo. Lo caro es renderizar: una página A4 a escala 4x son unos 2380 por 3368 píxeles, más o menos 32 MB de mapa de bits sin comprimir por una sola página, así que cincuenta páginas a esa escala agotan una pestaña del navegador mucho antes de que la máquina se inmute. Divide primero un documento muy grande y luego trabaja por lotes.