Análisis Forense de Documentos - Analizador Gratuito de PDF, Word, Excel y PowerPoint
Análisis Forense de Documentos
Suelta un PDF o un documento de Office. De un PDF se reconstruye el historial de ediciones guardado a guardado; de un archivo de Word, Excel o PowerPoint se leen completos sus metadatos, el control de cambios, el contenido oculto, los enlaces externos y el código de las macros - sin subir nada.
Suelta aquí un PDF o un documento de Office
.pdf .docx .xlsx .pptx .docm .xlsm .pptm .doc .xls .ppt .rtf - o haz clic para buscarlo en tu dispositivo
Elegir documentoDocumentos compatibles
- PDF - historial de revisiones, qué cambió entre guardados, comprobación de censuras, JavaScript incrustado, cobertura de las firmas, fuentes, imágenes y adjuntos.
- Word, Excel, PowerPoint - metadatos, control de cambios y comentarios, texto, hojas y diapositivas ocultos, enlaces externos, objetos incrustados, código de macros VBA y XLM. Incluye .docm/.xlsm/.pptm y los .doc/.xls/.ppt antiguos.
- RTF - estructura de grupos y cada objeto OLE incrustado.
Los propios bytes del archivo deciden qué análisis se ejecuta; la extensión solo es un respaldo. Carga un documento para ver aquí sus herramientas de análisis.
Resumen del documento
Lo que declara la propia estructura del archivo, antes de representar ninguna página.
Historial de revisiones
Cada guardado incremental que queda en este archivo, del más antiguo al más reciente. Selecciona uno para ver qué objetos escribió.
Qué cambió entre guardados
El contenido de las páginas se vuelve a leer tal como estaba en cada revisión y se compara, así que ves el texto que un guardado posterior añadió o eliminó.
--
Comprobación de censuras
Texto que sigue en el flujo de contenido debajo de algo pintado encima. Un recuadro oscuro dibujado sobre él lo oculta a quien lee, no al archivo - y esto se informa como una pista que revisar, nunca como un veredicto, porque el sombreado de una tabla y la superposición de una figura tienen exactamente el mismo aspecto.
--
Metadatos
El diccionario de información del documento y cualquier paquete XMP incrustado, mostrados tal como están almacenados.
JavaScript incrustado
Scripts almacenados dentro del documento, junto con los disparadores que los ejecutarían. Se muestran como texto plano y nunca se ejecutan.
--
Firmas digitales
Qué campos de firma existen y qué parte del archivo cubre cada uno.
--
Fuentes, imágenes y adjuntos
Lo que el documento lleva dentro, qué páginas usan cada fuente, qué guardado la introdujo y qué imágenes incrustadas se pueden volver a extraer.
Grafo de objetos
Todos los objetos indirectos del archivo, con la revisión que los escribió por primera vez y la que los modificó por última vez.
--
| N.º | Tipo | Subtipo | Clase | Flujo | Rev. | Claves |
|---|
Cadenas
Texto imprimible encontrado en cualquier parte del archivo en bruto, incluidas revisiones que un lector nunca mostraría.
--
Resumen del documento
Qué es este documento, quién queda registrado en él y qué destaca en la forma en que se creó.
Metadatos
Las propiedades que Office escribe en cada documento - autor, organización, tiempo total de edición, número de revisiones - mostradas interpretadas y como XML sin procesar. Los archivos anteriores a 2007 muestran en su lugar sus conjuntos de propiedades OLE.
Revisiones y contenido oculto
Control de cambios, comentarios, texto oculto, hojas y diapositivas ocultas, y los identificadores de sesión de guardado que Word conserva de cada edición. Nada de esto se ve en una lectura normal del documento.
Macros (VBA y XLM)
El código completo de cada módulo VBA, descomprimido del proyecto. Nada se ejecuta, emula ni resuelve - el código se muestra como texto, y las construcciones que merecen una lectura más atenta se señalan junto a él. Las hojas de macros de Excel 4.0, que se ejecutan desde las celdas sin ningún proyecto VBA en el archivo, aparecen aparte más abajo.
Enlaces y referencias externas
Cada relación que declara el documento, señalando todo lo que apunta fuera del archivo. Los destinos remotos se muestran como texto plano y nunca se contactan - esta página no hace ninguna petición de red.
Objetos incrustados y multimedia
Imágenes y archivos incrustados dentro del documento, contrastando el tipo que declara el nombre de cada uno con lo que realmente son sus primeros bytes. Cualquier imagen puede guardarse en tu dispositivo y examinarse en el análisis forense de imágenes, donde se lee su propio EXIF. En un archivo RTF esta pestaña muestra en su lugar la estructura de grupos y cada objeto OLE incrustado.
Integridad y firmas del contenedor
Un archivo moderno de Office es un archivo ZIP. Su índice se contrasta con la cabecera de cada parte, y cada parte que se lee se verifica contra su suma de verificación registrada. Cualquier firma digital guardada en el paquete aparece con las partes que cubre - y las que no.
Partes del documento
Cada archivo dentro del contenedor. Selecciona uno para leerlo como texto.
Texto de todas las partes
Texto legible extraído de cada parte del documento, incluidos encabezados, pies de página y partes que nunca se muestran.
--
Entender el análisis forense de documentos
Por qué un PDF recuerda sus propias ediciones
Cuando un PDF se edita y se guarda de forma incremental, el editor no reescribe el archivo. Añade al final los objetos que cambiaron, una nueva tabla de referencias cruzadas que describe dónde quedaron y un nuevo tráiler que apunta al anterior. Los bytes originales siguen ahí, intactos, debajo. Recorrer esa cadena de tráilers hacia atrás reconstruye el documento tal como estaba en cada guardado - lo que se parece más a leer un registro de control de versiones que a cualquier conjetura estadística sobre si un archivo fue alterado. Para mostrar qué modificó un guardado, el flujo de contenido de cada página se lee tal como estaba en la revisión anterior y en la posterior, y ambas se comparan línea a línea.
Un .docx es un ZIP lleno de XML
Desde 2007, los archivos de Word, Excel y PowerPoint son archivos ZIP corrientes que contienen un árbol de partes XML. Por eso sobrevive dentro de ellos tanto material que el lector nunca ve: el cuerpo del documento, los metadatos, el control de cambios, los comentarios, las relaciones con otros archivos y cualquier proyecto de macros son partes independientes que conviven dentro del archivo. Borrar texto de una página no lo elimina necesariamente de las partes, y desactivar «mostrar marcas» no cambia nada de lo que hay almacenado - solo cambia lo que se dibuja en pantalla.
La censura que no censuró nada
La forma más habitual de que se escape información sensible de un documento no es un ataque ingenioso. En un PDF es un recuadro oscuro dibujado sobre un texto que sigue en el flujo de contenido debajo; en un archivo de Office es un documento enviado con el control de cambios todavía registrado, con comentarios aún adjuntos o con texto simplemente marcado como oculto en lugar de eliminado - todo almacenado completo, con el nombre del autor y una marca de tiempo, y todo invisible en una lectura normal. Excel añade su propia variante: una hoja puede marcarse como «muy oculta», un estado que no se puede deshacer desde la interfaz de Excel.
Los scripts y las macros se leen, nunca se ejecutan
Un PDF puede llevar JavaScript con disparadores que lo ejecutarían al abrirlo; un documento de Office puede llevar un proyecto VBA, guardado como un archivo compuesto y comprimido con un esquema propio de Microsoft. Esta herramienta extrae ambos como texto plano - recorriendo el contenedor VBA para localizar dónde cada módulo deja de ser bytecode compilado y empieza a ser código comprimido, y descomprimiéndolo completo, incluso en proyectos marcados como «bloqueados para su visualización». Saber que existe una macro dice muy poco; leer lo que hace lo dice todo. Nada se ejecuta, emula ni resuelve, y nunca se contacta con ningún destino externo al que apunte el documento.
Indicios, no pruebas
Todo lo que aparece en esta página describe lo que está almacenado en el archivo, que no es lo mismo que lo que ocurrió ni lo que se pretendía. Que un PDF tenga varias revisiones es completamente normal: añadir un comentario, rellenar un campo de formulario, firmar o simplemente volver a guardar generan una. Muchísimas macros de negocio corrientes llaman a Shell o CreateObject; muchos documentos legítimos llevan control de cambios porque la revisión sigue en curso; una hoja oculta es a menudo solo una tabla de consulta que alguien apartó. Del mismo modo, un resultado vacío no es un certificado de limpieza - guardar con casi cualquier conversor elimina por completo el historial de un PDF, y esta herramienta lee estructura y texto sin evaluar lo que una macro haría realmente al ejecutarse. Trata cada hallazgo como una pista que corroborar con la fuente original y con las personas implicadas y, cuando haya mucho en juego, recurre a alguien cualificado en lugar de fiarte de una única lectura automatizada.
Puntos clave
- Una sola zona de carga, el análisis correcto: los propios bytes del archivo deciden si se lee como PDF o como documento de Office, así que un archivo renombrado no puede colarse.
- El historial de un PDF se reconstruye, no se adivina: cada guardado incremental que queda en el archivo se lista con su rango de bytes, su productor y los objetos que escribió.
- Oculto no es lo mismo que borrado: el control de cambios, los comentarios, el texto oculto, las diapositivas ocultas y las hojas muy ocultas se leen directamente de un archivo de Office, y el texto bajo un recuadro de censura en un PDF se informa como pista.
- Los scripts y las macros se muestran, nunca se ejecutan: el JavaScript incrustado y cada módulo VBA se extraen como texto plano, y los destinos externos se listan, nunca se siguen.
- Nada sale de tu dispositivo: cada análisis, descompresión y comparación se ejecuta en tu navegador.