Los metadatos de un PDF, y lo que dicen de ti

Cada PDF lleva un pequeño expediente sobre cómo se hizo. Casi todo es inofensivo, una parte es un nombre y una fecha que no querías enviar, y vaciar el panel de propiedades no lo quita.

¿Qué guarda un PDF sobre su autor?

Una lista corta de campos, rellenada por lo que haya producido el archivo. Título, autor, asunto y palabras clave vienen del documento; el creador nombra el programa en el que se escribió el contenido, el productor nombra el que escribió el PDF, y dos fechas registran cuándo se creó y cuándo se cambió por última vez.

Nada de eso está en la página, y todo se abre en las propiedades del documento de cualquier lector. El campo de autor suele ser el nombre de la cuenta de quien instaló el programa, que es como un envío pensado para ser anónimo llega con un nombre completo pegado.

¿Por qué no siempre basta con vaciar las propiedades?

Porque un PDF guarda esos datos dos veces. Junto al antiguo diccionario de información, los archivos desde PDF 1.4 llevan un paquete XMP: los mismos campos en XML, más los esquemas propios que añadiera la aplicación que lo produjo. La mayoría de los lectores actuales muestran la copia XMP.

Editar una copia deja la otra a la vista, y por eso un archivo al que acabas de borrar el autor sigue mostrando el nombre antiguo. PDF 2.0 zanjó la cuestión declarando obsoleto casi todo el diccionario antiguo en favor de XMP y dejando solo las fechas de creación y modificación, pero siguen circulando archivos con los dos, y cualquier cosa que prometa quitar metadatos tiene que quitar ambos.

¿Qué más viaja con el archivo?

Más de lo que muestra el panel de propiedades. Guardar sobre un PDF a menudo añade el cambio en lugar de reescribir el documento, así que la versión anterior puede seguir dentro del mismo archivo. Los adjuntos también viven dentro de un PDF, los comentarios conservan su autor y su hora, y los marcadores conservan nombres de lo que el archivo fue antes.

Las imágenes traen su propia historia. Una foto colocada en una página conserva el bloque EXIF que escribió la cámara, con el modelo y, en un teléfono, las coordenadas donde se tomó. En la página no hay nada que lo insinúe.

¿Cómo lo reviso y lo quito antes de compartir?

Léelo primero. Las propiedades del documento de cualquier lector muestran los campos visibles, y con eso basta para detectar un nombre o un código interno de proyecto. Después limpia el archivo en lugar de editar los campos uno a uno, para que las dos copias se vayan juntas.

Cuando el archivo tiene un historial que prefieres no enviar, reescríbelo entero en lugar de guardar encima: una reescritura completa deja fuera las revisiones anteriores. Limpia al final, porque casi todas las herramientas estampan su propia línea de productor al salir.

Por dónde seguir

Eliminar metadatos PDF borra las dos copias de una vez, Editar metadatos PDF fija los campos que sí quieres que se vean, y Censurar PDF es para el contenido de la página, no para los datos sobre el archivo.

Censurar de forma que el texto desaparezca de verdad cubre la página en sí, y qué sale de tu dispositivo responde a la pregunta que plantea después un archivo ya limpio.