¿Qué información oculta hay en sus documentos?
Metadatos y datos ocultos en archivos Word, Excel y PDF: costes y mitigación
25 de agosto de 2026
Los documentos son mucho más ricos en datos que el contenido visible. Un archivo de Word, una hoja de Excel o un PDF es un contenedor que transporta información identificativa que nunca aparece en la página: quién lo escribió, quién lo editó, cuándo, desde qué carpeta de qué unidad de red, qué se eliminó por el camino y, a veces, conjuntos de datos enteros que nunca debieron salir del edificio.
Esa carga oculta viaja con el archivo cada vez que se sube a una herramienta de IA o se entrega a un tercero. Este artículo cubre qué hay realmente ahí, los costes potenciales de la exposición y cómo limpiar correctamente los metadatos de los documentos.
La versión breve
Tres áreas de atención:
- Metadatos — información descriptiva que el software registra automáticamente sobre el propio archivo: autores, fechas, rutas, recuentos de ediciones.
- Contenido oculto — contenido real que está presente pero no se muestra: pestañas ocultas de una hoja de cálculo, texto eliminado pero rastreado, comentarios, regiones recortadas de imágenes, filas filtradas.
- Eliminación fallida — contenido que se cree totalmente eliminado u oscurecido, pero solo cubierto a medias: recuadros negros dibujados sobre texto vivo, números difuminados, datos «eliminados» que siguen en caché en otro lugar del archivo.
Qué se esconde en un documento de Word
Word registra un historial continuo de la vida del documento. Incluso después de borrar el texto visible, parte de ese historial permanece.
- Nombres del autor y del último editor. Quién redactó realmente el documento «revisado por el socio», o que un borrador supuestamente neutro vino de la otra parte.
- El nombre de su organización, heredado de la licencia de la máquina donde se creó el archivo.
- La ruta completa de la carpeta. Un riesgo discreto pero latente. Una ruta como
S:\Clientes\Acme Corp\Asunto 17 — Investigación regulatoria\borrador.docxfiltra el cliente, el número de asunto y la naturaleza del encargo. - Marcas de tiempo y tiempo total de edición. Útiles para demostrar que un análisis «cuidadosamente ponderado» se produjo en once minutos, o que un documento existía antes de que alguien declarara que no.
- Control de cambios y texto eliminado. Desactivar la visualización del control de cambios no lo elimina.
- Comentarios: incluidos quién los escribió, cuándo, y los comentarios marcados como resueltos. Negociaciones internas, estrategia y «franqueza».
- Texto oculto e invisible: formateado como oculto, texto blanco sobre fondo blanco, colocado detrás de una imagen o en un cuadro de texto fuera del borde de la página.
- Imágenes recortadas. Al recortar una foto en Word, la porción recortada suele seguir almacenada en el archivo a tamaño completo. Recortar no es borrar.
- Objetos incrustados. Una tabla pequeña pegada desde una hoja de cálculo suele traer todo el libro subyacente, no solo las celdas visibles.
- Campos personalizados de un sistema de gestión documental: códigos de cliente, números de asunto, referencias de facturación, etiquetas de confidencialidad, todo adjunto de forma invisible.1
- Referencias de combinaciones de correspondencia y vínculos que apuntan a una lista de nombres y direcciones en una unidad compartida.
- Huellas de las sesiones de edición. Word marca cada sesión de edición con un identificador, que puede usarse para demostrar que dos documentos distintos se trabajaron en la misma sesión, en la misma máquina.2
Qué se esconde en una hoja de cálculo
Las hojas de cálculo suelen construirse a partir de otros archivos más grandes, y el archivo grande tiene la costumbre de ir de polizón.
- Hojas de cálculo ocultas. Una pestaña puede ocultarse de forma normal, o ponerse en un estado más profundo de «muy oculta» que ni siquiera aparece en el menú habitual de mostrar.3 Así ocurrió exactamente la mayor filtración de datos policiales de la historia del Reino Unido — más abajo.
- Filas y columnas ocultas, grupos contraídos y filas filtradas. Un filtro oculta filas; no las elimina.
- Celdas disfrazadas por el formato: texto blanco sobre fondo blanco, o un formato numérico que no muestra nada mientras el valor sigue debajo.
- Cachés de tablas dinámicas. Una tabla dinámica guarda su propia copia privada de los datos de origen. Borre la hoja de origen y la dinámica sigue teniendo todo; a veces, un doble clic en un total regenera los registros subyacentes completos.
- Fórmulas vinculadas a otros libros. El valor mostrado puede ser inofensivo mientras la fórmula nombra el archivo de otro cliente y su ubicación exacta en su servidor.
- Configuración de consultas y conexiones: nombres de servidores de bases de datos, direcciones internas y la lógica paso a paso usada para extraer y transformar los datos.
- Macros, que suelen contener nombres de usuario, rutas de servidor y código comentado de versiones anteriores.
- Reglas de formato condicional, que codifican en silencio lógica de negocio: umbrales de autoridad para transigir, niveles de reserva, suelos de precios.
- Comentarios y notas con nombres de autor, e historial de revisiones de libros compartidos.
- Contraseñas de hoja y de libro, que se quitan con facilidad y sirven sobre todo para generar una falsa sensación de seguridad.
Qué se esconde en un PDF
Un PDF con texto buscable está en capas, y las capas invisibles siguen acompañando al archivo.
- Recuadros negros sobre texto vivo. El fallo más habitual. Dibujar un rectángulo negro sobre un nombre no elimina el nombre; seleccione la página, copie, pegue en un editor de texto y a menudo es recuperable. Eso ocurrió en los escritos de Manafort, en Apple v. Samsung y en la publicación de 2025 de los archivos de Epstein.4
- Metadatos heredados de Word. Exportar a PDF suele llevar el nombre del autor, el título y a menudo la ruta original del archivo. Convertir a PDF no es un paso de limpieza.
- Una capa de texto buscable bajo una imagen escaneada. Si un documento se escaneó y se reconoció el texto, ese texto reconocido queda invisible bajo la imagen.
- Versiones anteriores del archivo. Los PDF pueden guardarse de forma incremental, de modo que estados previos del documento se añaden al mismo archivo y pueden reconstruirse.5
- Capas ocultas que se han desactivado, pero siguen en el archivo.
- Anotaciones, resaltados, notas adhesivas y sellos, con el nombre y la marca de tiempo de quien los añadió.
- Valores de campos de formulario, incluso en formularios que parecen aplanados para el usuario, y campos que nunca se mostraron.
- Archivos adjuntos e imágenes incrustadas, que pueden arrastrar sus propios datos de cámara y GPS — una fotografía de prueba puede revelar exactamente dónde y cuándo se tomó.
- Detalles de la firma, que revelan el nombre, el correo y el empleador del firmante.
- Pixelado y desenfoque, que no son una eliminación fiable. Cuando el contenido oculto es corto y predecible — un DNI, un número de cuenta, una fecha — la salida difuminada puede revertirse por fuerza bruta.6
Costes reales de los datos ocultos
Una pestaña oculta, una multa de 750.000 £ y una dimisión
En agosto de 2023, el Servicio de Policía de Irlanda del Norte respondió a una solicitud rutinaria de acceso a la información sobre plantilla publicando una hoja de cálculo en internet. La pestaña visible mostraba el número de efectivos. Una pestaña oculta del mismo archivo contenía el apellido, las iniciales, el rango y el puesto de los 9.483 agentes y empleados en activo.7 Solo se comprobó la hoja visible antes de subirla.
Las consecuencias fueron graves:
- Una multa de 750.000 £ de la Information Commissioner's Office, la mayor impuesta jamás a un organismo público del Reino Unido, confirmada en apelación.8
- La dimisión del jefe de policía.9
- Litigios de más de 4.000 empleados, con una exposición estimada de 24–37 millones de £.10
- Agentes que reubicaron sus hogares, cortaron el contacto con la familia y cambiaron sus rutinas diarias por temor a su seguridad; nueve de cada diez aceptaron un equipo de seguridad doméstica financiado.9
El hallazgo central del regulador es el que conviene recordar: la organización no tenía un procedimiento que exigiera comprobar los archivos publicados en busca de datos ocultos. El archivo se publicó en su formato de trabajo original, en lugar de convertirse o reconstruirse. Una organización del sector privado que cometiera el mismo error no habría recibido la reducción aplicada a los organismos públicos, y se habría enfrentado a un máximo teórico de 17,5 millones de £.8 En la UE, una filtración equivalente puede constituir una violación del RGPD, con notificación a la autoridad de control — en España, la AEPD — y sanciones administrativas.
Fallos de redacción en escritos judiciales
- Escritos de Paul Manafort (2019). Los letrados presentaron documentos ante un tribunal federal cuyas redacciones se podían anular copiando y pegando, revelando información que había sido confidencial.4 Sigue siendo el ejemplo de advertencia de referencia.
- Material de un gran jurado. Un juez magistrado ordenó a los letrados explicar por qué no debían ser sancionados después de que un escrito expuesto revelara testimonio protegido; la explicación fue una «debilidad técnica» al convertir de Word a PDF, y un periodista recuperó el texto simplemente seleccionando y pegando los recuadros negros.11
- Apple v. Samsung. Condiciones confidenciales de licencias y cifras de ingresos eran extraíbles de un PDF presentado, las publicó la prensa y motivaron una moción de sanciones.12
- Un asunto de familia en Florida. Un despacho fue sancionado con 30.000 $ por presentar material sin redactar que contenía el nombre de un menor, un número de identificación nacional e información médica.12
- La publicación de 2025 de los archivos de Epstein. Se publicaron documentos con redacciones que se deshicieron con la misma prueba de copiar y pegar, generando de inmediato un debate profesional sobre qué deben hacer los destinatarios de una redacción fallida.13
Solo metadatos
- Un tribunal de apelación consideró recusar a los letrados que usaron información privilegiada expuesta por metadatos no eliminados. El tribunal declinó la recusación pero impuso otras sanciones, y afirmó con claridad que el deber de competencia de un abogado incluye comprender los metadatos y la tecnología que los maneja.14
- En otro asunto, los letrados que producían no eliminaron los metadatos de un documento privilegiado parcialmente redactado; el despacho receptor intentó usar el material recuperado como prueba en juicio, pero el tribunal lo limitó.15
- Una auditoría del sistema de presentación de los tribunales federales de EE. UU. halló unos 1.600 asuntos con números de la Seguridad Social sin redactar — el hallazgo que impulsó las normas actuales de redacción obligatoria.4
La exposición general, en todas las jurisdicciones, incluye: multas regulatorias, sanciones pecuniarias y condenas en costas, escritos expulsados del expediente, órdenes de justificación, remisión a órganos disciplinarios, argumentos de que se ha renunciado al privilegio y reclamaciones por mala praxis.16
Por qué las soluciones habituales no bastan del todo
Los enfoques habituales comparten una debilidad: operan sobre el archivo original.
- Dibujar recuadros o resaltar añade una capa encima. El contenido sigue debajo.
- Borrar el texto visible puede dejarlo en el control de cambios, en una copia en caché o en un estado anterior guardado dentro del mismo archivo.
- Los inspectores de documentos integrados capturan una cantidad útil, pero son opcionales, fáciles de olvidar con plazos apretados y solo buscan las categorías que conocen.
- «Solo exportar a PDF» arrastra los metadatos en lugar de eliminarlos, y puede conservar una capa de texto oculta.
- Proteger con contraseña una hoja puede dificultar el acceso humano directo, pero se puede romper y sigue arrastrando metadatos accesibles antes del desbloqueo.
Cómo lo aborda CamoText
CamoText no superpone, enmascara ni edita su archivo original. Extrae el texto, lo procesa en local en su dispositivo y escribe una salida enteramente nueva. El archivo original no se altera nunca. Como la salida se escribe de nuevo y no se deriva del contenedor de entrada, no hay metadatos del archivo original que heredar: ni autores, ni rutas, ni marcas de tiempo, ni comentarios, ni pestañas ocultas, ni cachés de tablas dinámicas, ni vínculos o medios incrustados, ni versiones anteriores enterradas. Eso no llega al archivo nuevo.
Esto se mantiene incluso cuando se activa la conservación del formato para salidas de Word, Excel, Markdown y texto enriquecido: los vínculos, los medios y el resto de metadatos se eliminan por defecto, precisamente porque son una vía tan habitual de exposición accidental. En documentos de Word también puede elegir si el control de cambios se acepta o se rechaza durante el procesamiento, en lugar de dejarlo viajar de forma invisible.
El trabajo central de CamoText es usar y enmascarar solo el contenido visible, ejecutándose totalmente sin conexión, sin nube, sin llamadas a API y sin conexión a internet. Si después necesita recuperar los términos originales, una clave guardada en local los reinserta en su propia máquina.
Una lista de comprobación
- Nada de archivos de trabajo. Produzca en su lugar un extracto creado ad hoc.
- Aplique la prueba de copiar y pegar a cualquier PDF con redacciones. Seleccione todo, copie, pegue en un editor de texto plano. Si aparece el texto oculto, nunca se eliminó.
- Asuma que el contenido contraído permanece en una hoja de cálculo, incluidas las que no aparecen en la lista de mostrar.
- Documente su procedimiento. Equipe a su personal con herramientas e instrucciones sencillas.
- Produzca un archivo nuevo y limpio en lugar de tratar el original y dejar datos ocultos.
Metadatos y herramientas de IA
Este riesgo se agudiza cuando los documentos van a una IA. Subir un archivo a un modelo en la nube envía el contenedor entero y los metadatos. Un modelo al que se pide revisar un contrato no tiene motivo para mencionar que también recibió el historial de redacción y el número de asunto del cliente, pero esa información ya ha salido de su control.
Pegar texto limpio, recién escrito, es más ligero, más barato y más rápido de procesar para el modelo, y limita el acceso a lo que es legible por un humano. Consulte nuestras guías sobre anonimizar documentos para análisis con IA y preparar documentos confidenciales para revisión con IA.
Resumen
Los documentos llevan mucho más de lo que muestran. Las herramientas que cubren u oscurecen el archivo original suelen pasar por alto muchos vectores ocultos de información. Generar un archivo limpio desde cero elimina esa carga.
Notas
- Los sistemas de gestión documental como iManage y NetDocuments escriben identificadores de cliente y de asunto en las propiedades personalizadas y en las variables del documento. Son invisibles en el uso normal y sobreviven al envío por correo fuera del despacho.
-
Técnicamente son identificadores de guardado de revisión, o «RSID», almacenados en el componente
settings.xmlde un archivo .docx. Word asigna un valor por sesión de edición, lo que permite vincular dos documentos a la misma sesión y máquina; a veces decisivo en disputas de autoría y falsificación. -
En el modelo de objetos de Excel, la visibilidad de una hoja puede fijarse en
xlSheetVeryHidden, lo que la elimina del diálogo estándar de Mostrar. Solo puede revelarse con las herramientas de desarrollador o inspeccionando el archivo directamente. - American Bar Association, The Judges' Journal: «Embarrassing Redaction Failures» — cubre los escritos de Manafort, la guía técnica de Adobe sobre métodos de redacción inadecuados y la auditoría de Public.Resource.Org que identificó unos 1.600 asuntos federales con números de la Seguridad Social sin redactar.
- Conocidas como actualizaciones incrementales. La especificación PDF permite anexar los cambios al final del archivo en lugar de reescribirlo, de modo que los estados previos del documento siguen presentes en el flujo de bytes y cualquiera que mire puede reconstruirlos.
- El pixelado y el desenfoque son transformaciones deterministas. Cuando el contenido subyacente procede de un espacio pequeño y estructurado, un atacante puede generar candidatos, aplicar la misma transformación y comparar el resultado. Los ataques publicados de depixelado lo han demostrado de forma reiterada.
- Privacy World: «Data Breaches and Spreadsheets — How to Avoid Fines When Excelling» — relato detallado de cómo se preparó, revisó y publicó la hoja de cálculo del PSNI con la pestaña oculta intacta.
- Information Commissioner's Office: «What price privacy? Poor PSNI procedures culminate in £750k fine» — véase también el aviso previo de intención de la ICO y la noticia de la BBC sobre la confirmación de la multa.
- Personnel Today: «Breach of staff data sees Northern Ireland police service hit with £750k fine» — informa de la dimisión del entonces jefe de policía Simon Byrne y de los pagos de seguridad doméstica a los afectados.
- Infosecurity Magazine: «Widespread Security Flaws Blamed for PSNI Data Breach» — sobre la escala del litigio resultante y su coste estimado.
- Nextpoint: «Don't Make These Mistakes with Redacted Legal Documents» — incluye la orden de justificación por material de gran jurado expuesto por recuadros negros aplicados al convertir de Word a PDF.
- RedactLaw: «When Redaction Fails — High-Profile Legal Redaction Disasters and What They Cost» — cubre la revelación de licencias en Apple v. Samsung y la sanción de 30.000 $ en un tribunal de familia de Florida.
- The Tech Savvy Lawyer: «How To Redact PDF Documents Properly and Recover Data from Failed Redactions» — escrito justo después de la publicación de diciembre de 2025, y un resumen útil de las obligaciones de un destinatario según las normas profesionales sobre material enviado por error.
- American Bar Association Litigation News: «Accidental Misuse of Privileged Metadata Results in Sanctions» — el tribunal declinó recusar a los letrados pero impuso otras sanciones y no descartó la recusación en el futuro, afirmando que el deber de competencia se extiende a la tecnología usada para manejar prueba electrónica.
- National Law Review: «Electronically Stored Information — Pitfalls and Ways to Avoid Mistakes» — analiza Hur v. Lloyd & Williams, en el que metadatos no limpiados de un documento privilegiado parcialmente redactado llevaron a una orden que prohibió al despacho receptor referirse a ellos.
- RedactLaw: «FRCP 5.2 Compliance — Protecting Sensitive Information in Court Filings» — sobre el abanico de consecuencias, y el punto de que la parte que presenta asume la obligación de redactar con independencia de quién produjo originalmente el documento. Véase también el National Law Review sobre los peligros de la redacción.