Ir al contenido
AI Metadata Remover

Guía de evidencia

PDF Info vs XMP: dónde se almacenan los metadatos de un documento

Aprende cómo los PDF almacenan metadatos en un diccionario Info y en el XMP del catálogo, por qué ambos importan y qué no sanea la eliminación verificada de propiedades de documento.

Última actualización: 6 min de lectura

Un PDF puede llevar metadatos de documento en dos ubicaciones principales cubiertas por este producto: un diccionario Info referenciado desde el tráiler del archivo, y un flujo de metadatos XMP referenciado desde el catálogo del documento. Un visor puede preferir una fuente, combinar ambas o mostrar valores en conflicto. Eliminar solo una ubicación puede dejar un nombre, una versión de software o una marca de tiempo visible en la otra.

El diccionario Info

El tráiler del PDF puede contener una referencia /Info que apunta a un diccionario de valores simples de cadena de texto y fecha del PDF. Las entradas comunes incluyen:

  • Title, Author, Subject, Keywords: propiedades descriptivas del documento.
  • Creator: la aplicación que creó el contenido original, como un procesador de texto o una herramienta de maquetación.
  • Producer: el componente que convirtió o renderizó el contenido original a PDF, como un controlador de impresión o una biblioteca PDF.
  • CreationDate y ModDate: marcas de tiempo de creación y modificación.
  • Entradas adicionales escritas por un productor en particular.

El PDF Metadata Viewer lee las entradas compatibles de este diccionario y las muestra por separado del XMP del catálogo.

El recuento de páginas y la versión del PDF pueden aparecer junto a los hallazgos. Describen la estructura y la extensión del documento. No son automáticamente metadatos personales.

El catálogo del documento también puede contener una referencia /Metadata a un flujo XMP. XMP se basa en XML y puede representar propiedades conocidas como título, autor, derechos, fecha y software. También puede contener espacios de nombres e historial de flujo de trabajo que no tienen equivalente directo en el diccionario Info.

El flujo XMP es un objeto PDF independiente y puede estar comprimido. Una herramienta que borra el diccionario Info pero deja intacta esta referencia del catálogo puede dejar los mismos valores visibles en el XMP. Lo contrario también es cierto.

Valores duplicados y en conflicto

El software PDF a menudo intenta sincronizar Info y XMP, pero el formato no garantiza que cada operación de guardado los mantenga alineados. Un documento creado en una aplicación, exportado por otra y editado por una tercera puede contener:

  • Un autor en Info y una secuencia de creador diferente en XMP.
  • Marcas de tiempo antiguas en una ubicación y marcas de tiempo más recientes en la otra.
  • Un título neutro en Info pero un nombre de proyecto en XMP.

Diferentes lectores pueden resolver esos conflictos de manera diferente. Por eso un informe de verificación útil debe inspeccionar ambas ubicaciones en lugar de tratar "Propiedades del documento" como una lista de campos única.

Creator frente a Producer

Estos campos responden a preguntas diferentes:

  • Creator suele nombrar la aplicación utilizada para crear el contenido original.
  • Producer suele nombrar el software que generó los bytes del PDF.

Un documento redactado en un procesador de texto y exportado a través de una biblioteca PDF puede revelar ambas herramientas. Esos valores pueden exponer una pila de software o un flujo de trabajo incluso cuando Author está vacío.

El PDF Metadata Editor expone Creator y Producer entre sus seis campos compatibles. Un campo en blanco se omite del nuevo diccionario Info. El editor no conserva silenciosamente el valor anterior.

Las fechas pueden existir en ambas ubicaciones

Info comúnmente almacena CreationDate y ModDate. XMP puede replicarlas como xmp:CreateDate, xmp:ModifyDate o campos relacionados. Las marcas de tiempo pueden revelar patrones de trabajo o información de zona horaria.

El PDF Remover elimina las referencias Info y Metadata del catálogo. El PDF Editor elimina las fechas antiguas y todas las demás entradas Info anteriores fuera de sus seis valores de formulario no vacíos, y luego elimina el XMP del catálogo sin crear un flujo XMP de reemplazo.

Cómo funciona aquí la eliminación de metadatos PDF

El PDF Metadata Remover procesa un PDF a la vez, de hasta 25 MB. qpdf WebAssembly se ejecuta localmente en un Web Worker reutilizable del navegador. El flujo de trabajo es:

  1. Inspeccionar la referencia Info del tráiler y la referencia Metadata del catálogo.
  2. Informar los hallazgos compatibles de Info y XMP, el recuento de páginas, la versión del PDF y los marcadores conservadores de firma.
  3. Eliminar las referencias Info y Metadata del catálogo del grafo de objetos de trabajo.
  4. Dejar que qpdf escriba una nueva copia del PDF.
  5. Volver a analizar la nueva copia en busca de Info y XMP del catálogo y verificar que el recuento de páginas no haya cambiado.

El original nunca se sobrescribe. Los PDF cifrados o protegidos con contraseña, los archivos malformados y los PDF que requieren recuperación estructural fallan de forma cerrada.

Esta es una reescritura completa con qpdf en lugar de una actualización incremental de metadatos. Las notas de PDF de ExifTool explican que la escritura de PDF usa actualizaciones incrementales, lo que puede dejar información antigua recuperable en el archivo. Una reescritura con qpdf reconstruye un archivo nuevo a partir del grafo de objetos actual, pero aun así no debe describirse como borrado forense universal. El contenido fuera de las dos ubicaciones de propiedades de documento queda fuera de esta garantía.

Cómo funciona aquí la edición de metadatos PDF

El PDF Metadata Editor reemplaza el registro Info anterior con solo los valores no vacíos ingresados para:

  • Title
  • Author
  • Subject
  • Keywords
  • Creator
  • Producer

Elimina las fechas antiguas, otras entradas Info anteriores y el XMP del catálogo. No crea XMP nuevo. Después de que qpdf escribe la nueva copia, la herramienta verifica la relectura exacta de los seis campos compatibles, comprueba que el XMP del catálogo ya no se detecte y confirma el recuento de páginas.

Esto es un reemplazo, no un parche in situ. Dejar un campo en blanco lo omite en lugar de conservar un valor obsoleto.

Verificación independiente

La salida se puede abrir nuevamente en el PDF Metadata Viewer. Comprueba estos resultados de forma independiente:

  • El diccionario Info no contiene valores anteriores, o solo los seis valores escritos intencionalmente por el editor.
  • El XMP del catálogo no se detecta.
  • El recuento de páginas coincide con el original.
  • Se comprende cualquier consecuencia sobre la firma.

ExifTool también es útil como lector independiente:

exiftool -G1 -a -s cleaned-document.pdf

Compara el resultado con el original, pero recuerda que diferentes lectores exponen diferentes subconjuntos de las estructuras PDF.

Buscar en los bytes crudos del PDF un autor antiguo conocido o un nombre de proyecto es otra señal de prueba útil. No es un método universal. Los flujos pueden estar comprimidos o codificados, por lo que una cadena de texto ausente en texto plano puede seguir existiendo en contenido codificado. Una cadena coincidente también puede pertenecer al texto visible de la página o a un objeto incrustado no relacionado. Trata la búsqueda de bytes como una prueba más junto con el reanálisis estructural, no como prueba por sí sola. El enfoque repetible del proyecto se resume en la evidencia de pruebas.

Firmas digitales

Una firma digital PDF cubre bytes específicos del archivo y el estado de la revisión. Reescribir el documento invalida la firma existente.

La herramienta del navegador solo busca estructuras de firma conservadoras. Si se detecta una posible firma, el Remover y el Editor requieren consentimiento explícito antes de reescribir. No validan el firmante, el certificado, la cadena de confianza, el estado de revocación ni la validez de la firma. El marcador es una advertencia, no un veredicto criptográfico.

Si la firma importa, conserva el archivo original firmado y no trates una copia reescrita como evidencia firmada.

Las propiedades de documento no son saneamiento de PDF

Este flujo de trabajo maneja el diccionario Info y el XMP a nivel de catálogo. No pretende inspeccionar ni eliminar:

  • JavaScript, acciones o enlaces externos.
  • Adjuntos y archivos incrustados.
  • Campos de formulario y anotaciones.
  • Texto oculto, capas o restos de redacción.
  • Metadatos dentro de imágenes, fuentes u otro contenido incrustado.

Si tu modelo de amenazas incluye contenido activo, texto oculto, adjuntos o recuperación forense, utiliza un flujo de trabajo dedicado de saneamiento o endurecimiento de PDF. La eliminación de propiedades de documento es más limitada por diseño.

Lista de verificación antes de compartir

  1. Inspecciona el original en el PDF Metadata Viewer y toma nota de los hallazgos de Info, XMP y firma.
  2. Elige eliminación o reemplazo. Usa el Remover para un resultado de propiedades de documento vacío, o el Editor para un registro Info limitado de seis campos.
  3. Conserva el original. La nueva copia no lo reemplaza.
  4. Revisa el reanálisis de la salida. Confirma Info, XMP del catálogo, la relectura exacta del editor y el recuento de páginas según corresponda.
  5. Verifica con un lector independiente si el documento es sensible.
  6. Respeta las firmas. Reescribir invalida una firma existente.
  7. Considera el PDF en su totalidad. Adjuntos, scripts, formularios, anotaciones, contenido oculto y metadatos de archivos incrustados siguen siendo preocupaciones separadas.
  8. Usa el informe seguro para compartir cuando necesites un registro de resultados sin el nombre del archivo ni los valores de metadatos.

Abordar tanto Info como XMP evita un resultado parcialmente limpio. Esto no convierte la eliminación de propiedades de documento en un saneamiento completo de PDF. Consulta más referencias conscientes del alcance en el centro de guías.