Panorama#
Después de anclar a una persona por sus identificadores (2.2), la investigación pasa al contenido: las imágenes, los mapas, los documentos y los videos que el objetivo produce o que lo mencionan. La rama de contenido del árbol de pivoteo que trazó la metodología (2.1) tiene un patrón propio y durable, que conviene enunciar antes de recorrer cada tipo de medio: no se trata de mirar el artefacto, sino de extraer la propiedad estable que lleva incrustada y dispararla en paralelo contra muchas fuentes. Una foto no vale por lo que muestra sino por el GPS de su EXIF, el serial de la cámara y el thumbnail que esconde; una coordenada no se «clickea» en un mapa sino que se lanza contra veinte proveedores a la vez porque cada uno guardó una imagen de una fecha distinta; un documento importa menos por su texto que por la metadata que nombra a su autor y su computadora.
De ese patrón se desprende el rasgo que hace productiva toda la categoría: el contenido filtra más de lo que su
autor quiso. El difuminado de una matrícula desaparece unos metros más adelante en la misma secuencia de calle;
el recorte de una foto no sobrescribe el thumbnail incrustado, que conserva la versión original sin recortar; la
metadata de un .docx guarda el nombre de la máquina en que se creó. El oficio del contenido es sistematizar la
extracción de esas fugas y convertirlas en pivotes hacia nuevos identificadores.
flowchart TD A["Artefacto\n(foto · mapa · documento · video)"] P["Propiedad estable incrustada\n(GPS · serial · metadata · ID de video)"] F1["Proveedor 1\n(una fecha / porción)"] F2["Proveedor 2"] F3["Proveedor N"] X["Cruce\n(pivote a nuevo identificador)"] A -->|"extraer la fuga"| P P -->|"disparar en paralelo"| F1 & F2 & F3 F1 & F2 & F3 --> X X -.->|"username / rostro / autor"| ID["identidad (2.2)"] X -.->|"dominio / IP / bucket"| INF["infraestructura (2.4)"] classDef n fill:#1e293b,stroke:#475569,color:#e2e8f0; class A,P,F1,F2,F3,X,ID,INF n;
Geoint: la coordenada GPS como ancla#
El error del principiante en geolocalización es buscar una dirección por texto y mirar el mapa que sale. El flujo
durable es otro: obtener la coordenada GPS exacta —en Google Maps, clic derecho sobre el punto y «¿Qué hay
aquí?» da una lat/long más precisa que la búsqueda textual— y luego disparar esa lat/long contra todos los
proveedores mediante URLs estáticas construidas con parámetros. La razón por la que ninguno reemplaza a otro es
que cada servicio guarda imágenes de fechas y ángulos distintos: Google (mapa, terreno, satélite y street
view controlado por heading, pitch y fov), Bing con su vista Bird’s Eye, Zoom Earth (que compone NASA,
Bing y ArcGIS y se captura a pantalla completa sin marca de agua), Here, Yandex (superior fuera de Estados Unidos),
Descartes Labs (que busca por imagen: «traer todo lo que se parezca a este estadio») y Snapchat (stories públicas
por zona). La lección estructural es la misma del patrón general: construir la consulta a partir de un
identificador estable —el GPS— y paralelizar las fuentes.
Sobre esa base se apilan cuatro capas. Las imágenes históricas —Historic Aerials, World Imagery Wayback—
muestran capturas fechadas del mismo punto y revelan vehículos o estructuras que hoy no están. Los street views
colaborativos —Mapillary, KartaView— son el hallazgo fuerte: embeben fotos a nivel calle subidas por
particulares desde el celular, y a diferencia de Google o Bing —que difuminan toda cara y matrícula— parecen
difuminar solo cuando la matrícula es legible; unos metros después el recuadro de difuminado desaparece y, con
recorte más ajuste de brillo y contraste, la placa se lee. Además exponen el username de quien subió las
fotos, su historial y su patrón de viaje diario —si esa persona fuera el objetivo, su rutina de desplazamiento
es pública, un salto directo de vuelta a la identidad (2.2)—. La tercera capa son los
límites de parcela (Acre Value): el nombre del dueño es de pago, pero suele salir de la respuesta JSON que la
página misma pide —Inspector → Red → la entrada xhr de la parcela trae el campo owner—. Y la cuarta es la
datación por sombras (Shade Map): mover el mes y la hora hasta que las sombras de una imagen aérea coincidan
estima cuándo se tomó, técnica aplicable a cualquier foto de redes con ubicación y época conocidas.
Documentos: la categoría olvidada#
Los documentos son la clase más descuidada, y se dividen en tres: los que hablan del objetivo, los que él
creó y llegaron a ser públicos sin querer, y la metadata que llevan dentro. Se localizan con los operadores
ext: y filetype: (Google prefiere ext:, Bing exige filetype:; se combinan con OR y con site:), pero el
filón está en el almacenamiento en la nube mal configurado. Consultas como site:amazonaws.com ext:xls "password" o site:storage.googleapis.com "confidential" recuperan documentos de buckets públicos, y Gray Hat
Warfare —que indexó más de mil millones de archivos abiertos en AWS— devuelve, ante una búsqueda como «password
xls», documentos con credenciales activas. Bazzell no exagera su valor: «he localizado documentos
extremadamente sensibles desde esta fuente en numerosas ocasiones». Los buckets, los dominios y la infraestructura
en la nube son el terreno de la infraestructura (2.4). Se suman Google Docs y Drive
públicos, Scribd (que identifica quién subió el archivo → su perfil), los repositorios de presentaciones y las
decenas de paste sites —Pastebin, doxbin, ghostbin— donde los grupos criminales publican datos robados, tema
que retoma el capítulo de filtraciones (2.6).
La metadata embebida es el tercer eje y el más revelador: trae el nombre del autor y de quien modificó el
archivo, la empresa, la versión del software, el nombre de la computadora o la red y hasta el tiempo total de
edición. Se extrae en línea (Extract Metadata, Jeffrey’s Viewer) pero preferentemente en local —para no
filtrar la investigación a un tercero—: exiftool sobre una carpeta genera una planilla con la metadata de todos
los archivos. El caso arquetípico es el del asesino BTK (Dennis Rader): la policía de Wichita examinó un .doc
en un disquete, la metadata nombraba al autor «Dennis» y ligaba a una iglesia luterana; el OSINT sobre esos dos
datos condujo al arresto.
# metadata de todos los archivos de una carpeta, en local (no filtra la investigación)
exiftool * -csv > Report.csv
# extracción manual: un .pptx / .docx es un ZIP
mv Presentacion.pptx Presentacion.zip && unzip Presentacion.zip
# -> docProps/app.xml : versión de Office + identificadores únicos (ligan documentos al mismo autor)
# -> word/media/ | ppt/media/ : imágenes internas, analizables por su propia EXIF
exiftool existe precisamente para esto. La misma regla vale para las imágenes del apartado
siguiente: un reverse image search distribuye la foto al motor.Imágenes: reverse image search y EXIF#
Un reverse image search entrega una imagen al motor y devuelve dónde más aparece —otros perfiles del objetivo, alias que reusan la misma foto real— o rostros y objetos parecidos. Hay que consultar los cinco motores porque cada uno cubre un rincón distinto: Google Lens, Bing Visual Search, TinEye (duplicados exactos), Yandex —«su servicio es superior a todos los demás», encuentra lo que los otros no— y Baidu. Dos reglas: se apunta al URL directo de la imagen a máxima resolución (no a la página que la contiene), y recortar la imagen para dejar solo al objetivo mejora mucho los resultados, sobre todo en Yandex. Los motores especializados completan el cuadro: FaceCheck (reconocimiento facial contra miles de millones de fotos ya públicas, devuelve el mismo rostro en distintas fechas y ropa), CarNet (identifica año, marca y modelo de un vehículo borroso de un timbre o una dashcam) y Repost Sleuth (copias en Reddit). La API de Flickr liga correo, cuenta, username e identificador de usuario entre sí —otro puente de vuelta a la identidad (2.2)—.
El segundo tesoro de una imagen es su EXIF —los metadatos que graba la cámara—: marca y modelo, lente, exposición, fecha y hora, y en réflex y celulares el número de serie del equipo, que permite agrupar todas las fotos tomadas con la misma cámara (Camera Trace busca por serial). Si el GPS estaba activo, la EXIF trae el geotag (lat/long, que Jeffrey’s Exif Viewer traduce a dirección, mapa y hasta dirección de encuadre). El detalle más potente es el thumbnail delator: al recortar una foto, muchos programas no sobrescriben la miniatura incrustada, de modo que dentro de la imagen recortada persiste la versión original sin recortar —un mecanismo que la policía usó para identificar a productores de material de abuso que se recortaban a sí mismos de las imágenes—. Conviene recordar que algunas redes (Facebook) borran la EXIF al subir y otras (Flickr) no, y que la versión a máxima resolución suele conservarla. Para juzgar si una imagen fue manipulada están Foto Forensics (error level analysis) y Forensically (detector de clonado, ruido, PCA, metadata y thumbnail, que corre localmente en el navegador y no sube nada al servidor), además de Aperisolve para esteganografía —el análisis estadístico que el capítulo de esteganografía (3.12) desarrolla en profundidad—.
Video: el mismo libreto, más superficie#
El video reproduce todo lo anterior sobre una superficie mayor. YouTube se busca por término o canal y se filtra
por fecha, duración y tipo, y varios trucos —durables como concepto, no como cadena exacta— amplían el acceso:
el bypass de restricción por país (una utilidad devuelve el mapa de países permitidos y se combina con una VPN),
y sobre todo la extracción de frames estáticos (i.ytimg.com/vi/<id>/maxresdefault.jpg y las miniaturas
0..3.jpg), que permite hacer reverse image search de un video sin siquiera reproducirlo. La metadata
precisa sale de la API de datos de YouTube, y el perfil de youtube.com/feeds/videos.xml?user=<u> —que revela
el channel ID y, clave, la fecha y hora exactas de creación de la cuenta—. Los comentarios son buscables,
y los videos borrados sobreviven espejados en el Internet Archive. En archive.org, además, el meta.xml de un
video expone el correo de quien lo subió y la fecha exacta; el TV News Archive indexa el
closed-captioning de más de dos millones de noticieros, de modo que se pueden buscar palabras dichas al aire.
flowchart LR V["Video / canal"] FR["Frames\n(maxresdefault.jpg)"] MD["API + XML\n(channel ID · fecha de\ncreación de cuenta)"] UP["archive.org meta.xml\n(email del uploader)"] DEL["Internet Archive\n(video borrado)"] V --> FR -->|"reverse image"| RI["¿dónde más aparece?"] V --> MD -->|"perfil"| ID["identidad (2.2)"] V --> UP -->|"correo"| ID V --> DEL classDef n fill:#1e293b,stroke:#475569,color:#e2e8f0; class V,FR,MD,UP,DEL,RI,ID n;
Broadcast streams: capturar el flujo, no la web#
La última capa de contenido son las emisiones en vivo, y su principio operativo es capturar el flujo, no la
página: en lugar de abrir el sitio del canal —cargado de rastreadores y comerciales forzados—, se identifica el
archivo master.m3u8 de la transmisión con una extensión como Stream Detector y se lo reproduce en un
reproductor propio (Video JS). Cuatro dominios cierran el capítulo. La TV en vivo se agrega desde servicios
como TubiTV o Pluto. La radio comercial se resuelve con Radio Browser, cuya API colaborativa lista casi toda
estación del mundo. Las radios SDR remotas —software-defined radio— son el hallazgo más singular: KiwiSDR
y WebSDR permiten controlar radios físicas conectadas a antenas en cualquier parte del mundo y tunear de 1 KHz a
30 MHz, oyendo «exactamente lo que se oiría estando físicamente en la ubicación de la radio» —AM, onda corta,
banda ciudadana y radioaficionados (HAM), que discuten en tiempo real incendios, rescates y barricadas antes que
cualquier medio—. Y los escáneres de emergencia (Broadcastify) transmiten el tráfico de policía, bomberos y
servicios médicos en vivo por estado y condado, con archivos rebobinables que se consultan sin orden judicial.
Defensa, encuadre púrpura y detección#
Este capítulo es la capa de recolección de contenido del footprinting, y su lente púrpura tiene una cara ofensiva y otra defensiva especialmente accionable.
flowchart LR
subgraph RED["Recolección de contenido (red)"]
A["buckets / cloud\nmal configurado"] --> B["credenciales vivas\n+ rutas internas"]
C["metadata de documentos"] --> D["usuarios + stack\ntecnológico → phishing/exploit"]
E["geoint + EXIF geotag"] --> F["pretexto físico /\nubicación de infra"]
G["reverse face / image"] --> H["alias operativo →\nidentidad real"]
end
subgraph BLUE["Higiene de publicación (blue)"]
I["auditar buckets propios\n(Gray Hat Warfare)"] --> J["cerrar + rotar credenciales"]
K["strip de metadata\n(app.xml · thumbnail EXIF)"] --> L["publicar sin fugas"]
M["geotag off + revisión\nde fotos del personal"] --> N["reducir la huella"]
end
classDef n fill:#1e293b,stroke:#475569,color:#e2e8f0;
class A,B,C,D,E,F,G,H,I,J,K,L,M,N n;Del lado ofensivo (red), los documentos en la nube mal configurada filtran credenciales vivas, nombres de empleados y rutas internas que alimentan directamente el acceso inicial; la metadata de documentos públicos —autor, versión de software, nombre de máquina y dominio— mapea usuarios y stack tecnológico para el spear-phishing y para elegir exploits (el mismo insumo que la fase de recon del recon ofensivo (2.5) lleva hacia el ataque); el geoint prepara un pretexto físico; y el reverse image y facial ligan el alias operativo de un objetivo con su identidad real para la ingeniería social.
Del lado defensivo (blue / CTI), las mismas técnicas se invierten. Para la inteligencia de amenazas, la
metadata y los identificadores únicos de documentos permiten atribuir una campaña —misma plantilla o mismo autor
entre muestras—, el reverse face vincula a los actores de fraude y BEC con sus perfiles reales, y los escáneres de
emergencia dan conciencia situacional en un incidente físico. Para el defensor de la superficie propia —lo más
accionable del capítulo— el programa es concreto: (1) auditar los propios buckets y almacenamiento en la nube
con las mismas dorks y Gray Hat Warfare antes que el atacante, cerrándolos y rotando toda credencial filtrada; (2)
quitar la metadata de documentos e imágenes antes de publicarlos, porque el app.xml, el número de serie y el
thumbnail EXIF sin recortar son fugas reales; (3) política de geotag desactivado y revisión de qué exponen las
fotos del personal y las instalaciones; y (4) monitoreo de la propia huella en street views y buscadores faciales.
En MITRE ATT&CK el capítulo cubre la táctica de reconocimiento: T1596 (Search Open Technical Databases, para el
almacenamiento en la nube), T1593 (Search Open Websites/Domains), T1592.002 (Gather Victim Host Information:
Software, vía metadata) y T1589 (Gather Victim Identity Information). Como toda la fase de recon, su mitigación
es Pre-compromise (M1056) sumada a la higiene de publicación: no se detecta en el perímetro, se reduce lo que se
expone.
Referencias#
osint/bazzell-osint/cap-05— Contenido: geoint (la coordenada GPS como ancla y las URLs estáticas por proveedor, street views colaborativos Mapillary/KartaView y su fuga de matrícula/patrón de viaje, Acre Value víaxhr, datación por sombras); documentos (dorkingext:/filetype:, buckets mal configurados y Gray Hat Warfare, metadata conexiftooly el caso BTK, extracción manual.pptx→.zip); imágenes (reverse search en cinco motores con Yandex superior, FaceCheck/CarNet, EXIF con serial/geotag/thumbnail delator, Foto Forensics/Forensically); video (frames, API/XML, uploader email de archive.org, TV News Archive); y broadcast streams (Stream Detector→m3u8, KiwiSDR remoto, Broadcastify).- Michael Bazzell, OSINT Techniques (10ª ed., 2023), capítulos de mapas, documentos, imágenes, video y emisiones; inteltechniques.com para las herramientas —recordando que las URLs concretas caducan y lo durable es el patrón de extraer la propiedad incrustada y paralelizar las fuentes—.
- Herramientas: ExifTool, Jeffrey’s Exif Viewer, Forensically (análisis local), Gray Hat Warfare.
- MITRE ATT&CK — Reconnaissance (TA0043): T1596, T1593 y T1592/002, con mitigación Pre-compromise (M1056).