Panorama#

Después de anclar a una persona por sus identificadores (2.2), la investigación pasa al contenido: las imágenes, los mapas, los documentos y los videos que el objetivo produce o que lo mencionan. La rama de contenido del árbol de pivoteo que trazó la metodología (2.1) tiene un patrón propio y durable, que conviene enunciar antes de recorrer cada tipo de medio: no se trata de mirar el artefacto, sino de extraer la propiedad estable que lleva incrustada y dispararla en paralelo contra muchas fuentes. Una foto no vale por lo que muestra sino por el GPS de su EXIF, el serial de la cámara y el thumbnail que esconde; una coordenada no se «clickea» en un mapa sino que se lanza contra veinte proveedores a la vez porque cada uno guardó una imagen de una fecha distinta; un documento importa menos por su texto que por la metadata que nombra a su autor y su computadora.

De ese patrón se desprende el rasgo que hace productiva toda la categoría: el contenido filtra más de lo que su autor quiso. El difuminado de una matrícula desaparece unos metros más adelante en la misma secuencia de calle; el recorte de una foto no sobrescribe el thumbnail incrustado, que conserva la versión original sin recortar; la metadata de un .docx guarda el nombre de la máquina en que se creó. El oficio del contenido es sistematizar la extracción de esas fugas y convertirlas en pivotes hacia nuevos identificadores.

flowchart TD
  A["Artefacto\n(foto · mapa · documento · video)"]
  P["Propiedad estable incrustada\n(GPS · serial · metadata · ID de video)"]
  F1["Proveedor 1\n(una fecha / porción)"]
  F2["Proveedor 2"]
  F3["Proveedor N"]
  X["Cruce\n(pivote a nuevo identificador)"]
  A -->|"extraer la fuga"| P
  P -->|"disparar en paralelo"| F1 & F2 & F3
  F1 & F2 & F3 --> X
  X -.->|"username / rostro / autor"| ID["identidad (2.2)"]
  X -.->|"dominio / IP / bucket"| INF["infraestructura (2.4)"]
  classDef n fill:#1e293b,stroke:#475569,color:#e2e8f0;
  class A,P,F1,F2,F3,X,ID,INF n;

Geoint: la coordenada GPS como ancla#

El error del principiante en geolocalización es buscar una dirección por texto y mirar el mapa que sale. El flujo durable es otro: obtener la coordenada GPS exacta —en Google Maps, clic derecho sobre el punto y «¿Qué hay aquí?» da una lat/long más precisa que la búsqueda textual— y luego disparar esa lat/long contra todos los proveedores mediante URLs estáticas construidas con parámetros. La razón por la que ninguno reemplaza a otro es que cada servicio guarda imágenes de fechas y ángulos distintos: Google (mapa, terreno, satélite y street view controlado por heading, pitch y fov), Bing con su vista Bird’s Eye, Zoom Earth (que compone NASA, Bing y ArcGIS y se captura a pantalla completa sin marca de agua), Here, Yandex (superior fuera de Estados Unidos), Descartes Labs (que busca por imagen: «traer todo lo que se parezca a este estadio») y Snapchat (stories públicas por zona). La lección estructural es la misma del patrón general: construir la consulta a partir de un identificador estable —el GPS— y paralelizar las fuentes.

Sobre esa base se apilan cuatro capas. Las imágenes históricas —Historic Aerials, World Imagery Wayback— muestran capturas fechadas del mismo punto y revelan vehículos o estructuras que hoy no están. Los street views colaborativos —Mapillary, KartaView— son el hallazgo fuerte: embeben fotos a nivel calle subidas por particulares desde el celular, y a diferencia de Google o Bing —que difuminan toda cara y matrícula— parecen difuminar solo cuando la matrícula es legible; unos metros después el recuadro de difuminado desaparece y, con recorte más ajuste de brillo y contraste, la placa se lee. Además exponen el username de quien subió las fotos, su historial y su patrón de viaje diario —si esa persona fuera el objetivo, su rutina de desplazamiento es pública, un salto directo de vuelta a la identidad (2.2)—. La tercera capa son los límites de parcela (Acre Value): el nombre del dueño es de pago, pero suele salir de la respuesta JSON que la página misma pide —Inspector → Red → la entrada xhr de la parcela trae el campo owner—. Y la cuarta es la datación por sombras (Shade Map): mover el mes y la hora hasta que las sombras de una imagen aérea coincidan estima cuándo se tomó, técnica aplicable a cualquier foto de redes con ubicación y época conocidas.

Documentos: la categoría olvidada#

Los documentos son la clase más descuidada, y se dividen en tres: los que hablan del objetivo, los que él creó y llegaron a ser públicos sin querer, y la metadata que llevan dentro. Se localizan con los operadores ext: y filetype: (Google prefiere ext:, Bing exige filetype:; se combinan con OR y con site:), pero el filón está en el almacenamiento en la nube mal configurado. Consultas como site:amazonaws.com ext:xls "password" o site:storage.googleapis.com "confidential" recuperan documentos de buckets públicos, y Gray Hat Warfare —que indexó más de mil millones de archivos abiertos en AWS— devuelve, ante una búsqueda como «password xls», documentos con credenciales activas. Bazzell no exagera su valor: «he localizado documentos extremadamente sensibles desde esta fuente en numerosas ocasiones». Los buckets, los dominios y la infraestructura en la nube son el terreno de la infraestructura (2.4). Se suman Google Docs y Drive públicos, Scribd (que identifica quién subió el archivo → su perfil), los repositorios de presentaciones y las decenas de paste sites —Pastebin, doxbin, ghostbin— donde los grupos criminales publican datos robados, tema que retoma el capítulo de filtraciones (2.6).

La metadata embebida es el tercer eje y el más revelador: trae el nombre del autor y de quien modificó el archivo, la empresa, la versión del software, el nombre de la computadora o la red y hasta el tiempo total de edición. Se extrae en línea (Extract Metadata, Jeffrey’s Viewer) pero preferentemente en local —para no filtrar la investigación a un tercero—: exiftool sobre una carpeta genera una planilla con la metadata de todos los archivos. El caso arquetípico es el del asesino BTK (Dennis Rader): la policía de Wichita examinó un .doc en un disquete, la metadata nombraba al autor «Dennis» y ligaba a una iglesia luterana; el OSINT sobre esos dos datos condujo al arresto.

# metadata de todos los archivos de una carpeta, en local (no filtra la investigación) exiftool * -csv > Report.csv # extracción manual: un .pptx / .docx es un ZIP mv Presentacion.pptx Presentacion.zip && unzip Presentacion.zip # -> docProps/app.xml : versión de Office + identificadores únicos (ligan documentos al mismo autor) # -> word/media/ | ppt/media/ : imágenes internas, analizables por su propia EXIF
Nunca subir a un servicio en línea un archivo sensible que no esté ya en internet. Un documento clasificado, una pieza de evidencia o un archivo bajo secreto de sumario, al cargarse en un visor de metadata o en un buscador inverso, queda entregado a un tercero —y puede comprometer su clasificación o su valor probatorio—. La extracción local con exiftool existe precisamente para esto. La misma regla vale para las imágenes del apartado siguiente: un reverse image search distribuye la foto al motor.

Imágenes: reverse image search y EXIF#

Un reverse image search entrega una imagen al motor y devuelve dónde más aparece —otros perfiles del objetivo, alias que reusan la misma foto real— o rostros y objetos parecidos. Hay que consultar los cinco motores porque cada uno cubre un rincón distinto: Google Lens, Bing Visual Search, TinEye (duplicados exactos), Yandex —«su servicio es superior a todos los demás», encuentra lo que los otros no— y Baidu. Dos reglas: se apunta al URL directo de la imagen a máxima resolución (no a la página que la contiene), y recortar la imagen para dejar solo al objetivo mejora mucho los resultados, sobre todo en Yandex. Los motores especializados completan el cuadro: FaceCheck (reconocimiento facial contra miles de millones de fotos ya públicas, devuelve el mismo rostro en distintas fechas y ropa), CarNet (identifica año, marca y modelo de un vehículo borroso de un timbre o una dashcam) y Repost Sleuth (copias en Reddit). La API de Flickr liga correo, cuenta, username e identificador de usuario entre sí —otro puente de vuelta a la identidad (2.2)—.

El segundo tesoro de una imagen es su EXIF —los metadatos que graba la cámara—: marca y modelo, lente, exposición, fecha y hora, y en réflex y celulares el número de serie del equipo, que permite agrupar todas las fotos tomadas con la misma cámara (Camera Trace busca por serial). Si el GPS estaba activo, la EXIF trae el geotag (lat/long, que Jeffrey’s Exif Viewer traduce a dirección, mapa y hasta dirección de encuadre). El detalle más potente es el thumbnail delator: al recortar una foto, muchos programas no sobrescriben la miniatura incrustada, de modo que dentro de la imagen recortada persiste la versión original sin recortar —un mecanismo que la policía usó para identificar a productores de material de abuso que se recortaban a sí mismos de las imágenes—. Conviene recordar que algunas redes (Facebook) borran la EXIF al subir y otras (Flickr) no, y que la versión a máxima resolución suele conservarla. Para juzgar si una imagen fue manipulada están Foto Forensics (error level analysis) y Forensically (detector de clonado, ruido, PCA, metadata y thumbnail, que corre localmente en el navegador y no sube nada al servidor), además de Aperisolve para esteganografía —el análisis estadístico que el capítulo de esteganografía (3.12) desarrolla en profundidad—.

Video: el mismo libreto, más superficie#

El video reproduce todo lo anterior sobre una superficie mayor. YouTube se busca por término o canal y se filtra por fecha, duración y tipo, y varios trucos —durables como concepto, no como cadena exacta— amplían el acceso: el bypass de restricción por país (una utilidad devuelve el mapa de países permitidos y se combina con una VPN), y sobre todo la extracción de frames estáticos (i.ytimg.com/vi/<id>/maxresdefault.jpg y las miniaturas 0..3.jpg), que permite hacer reverse image search de un video sin siquiera reproducirlo. La metadata precisa sale de la API de datos de YouTube, y el perfil de youtube.com/feeds/videos.xml?user=<u> —que revela el channel ID y, clave, la fecha y hora exactas de creación de la cuenta—. Los comentarios son buscables, y los videos borrados sobreviven espejados en el Internet Archive. En archive.org, además, el meta.xml de un video expone el correo de quien lo subió y la fecha exacta; el TV News Archive indexa el closed-captioning de más de dos millones de noticieros, de modo que se pueden buscar palabras dichas al aire.

flowchart LR
  V["Video / canal"]
  FR["Frames\n(maxresdefault.jpg)"]
  MD["API + XML\n(channel ID · fecha de\ncreación de cuenta)"]
  UP["archive.org meta.xml\n(email del uploader)"]
  DEL["Internet Archive\n(video borrado)"]
  V --> FR -->|"reverse image"| RI["¿dónde más aparece?"]
  V --> MD -->|"perfil"| ID["identidad (2.2)"]
  V --> UP -->|"correo"| ID
  V --> DEL
  classDef n fill:#1e293b,stroke:#475569,color:#e2e8f0;
  class V,FR,MD,UP,DEL,RI,ID n;

Broadcast streams: capturar el flujo, no la web#

La última capa de contenido son las emisiones en vivo, y su principio operativo es capturar el flujo, no la página: en lugar de abrir el sitio del canal —cargado de rastreadores y comerciales forzados—, se identifica el archivo master.m3u8 de la transmisión con una extensión como Stream Detector y se lo reproduce en un reproductor propio (Video JS). Cuatro dominios cierran el capítulo. La TV en vivo se agrega desde servicios como TubiTV o Pluto. La radio comercial se resuelve con Radio Browser, cuya API colaborativa lista casi toda estación del mundo. Las radios SDR remotassoftware-defined radio— son el hallazgo más singular: KiwiSDR y WebSDR permiten controlar radios físicas conectadas a antenas en cualquier parte del mundo y tunear de 1 KHz a 30 MHz, oyendo «exactamente lo que se oiría estando físicamente en la ubicación de la radio» —AM, onda corta, banda ciudadana y radioaficionados (HAM), que discuten en tiempo real incendios, rescates y barricadas antes que cualquier medio—. Y los escáneres de emergencia (Broadcastify) transmiten el tráfico de policía, bomberos y servicios médicos en vivo por estado y condado, con archivos rebobinables que se consultan sin orden judicial.

Defensa, encuadre púrpura y detección#

Este capítulo es la capa de recolección de contenido del footprinting, y su lente púrpura tiene una cara ofensiva y otra defensiva especialmente accionable.

flowchart LR
  subgraph RED["Recolección de contenido (red)"]
    A["buckets / cloud\nmal configurado"] --> B["credenciales vivas\n+ rutas internas"]
    C["metadata de documentos"] --> D["usuarios + stack\ntecnológico → phishing/exploit"]
    E["geoint + EXIF geotag"] --> F["pretexto físico /\nubicación de infra"]
    G["reverse face / image"] --> H["alias operativo →\nidentidad real"]
  end
  subgraph BLUE["Higiene de publicación (blue)"]
    I["auditar buckets propios\n(Gray Hat Warfare)"] --> J["cerrar + rotar credenciales"]
    K["strip de metadata\n(app.xml · thumbnail EXIF)"] --> L["publicar sin fugas"]
    M["geotag off + revisión\nde fotos del personal"] --> N["reducir la huella"]
  end
  classDef n fill:#1e293b,stroke:#475569,color:#e2e8f0;
  class A,B,C,D,E,F,G,H,I,J,K,L,M,N n;

Del lado ofensivo (red), los documentos en la nube mal configurada filtran credenciales vivas, nombres de empleados y rutas internas que alimentan directamente el acceso inicial; la metadata de documentos públicos —autor, versión de software, nombre de máquina y dominio— mapea usuarios y stack tecnológico para el spear-phishing y para elegir exploits (el mismo insumo que la fase de recon del recon ofensivo (2.5) lleva hacia el ataque); el geoint prepara un pretexto físico; y el reverse image y facial ligan el alias operativo de un objetivo con su identidad real para la ingeniería social.

Del lado defensivo (blue / CTI), las mismas técnicas se invierten. Para la inteligencia de amenazas, la metadata y los identificadores únicos de documentos permiten atribuir una campaña —misma plantilla o mismo autor entre muestras—, el reverse face vincula a los actores de fraude y BEC con sus perfiles reales, y los escáneres de emergencia dan conciencia situacional en un incidente físico. Para el defensor de la superficie propia —lo más accionable del capítulo— el programa es concreto: (1) auditar los propios buckets y almacenamiento en la nube con las mismas dorks y Gray Hat Warfare antes que el atacante, cerrándolos y rotando toda credencial filtrada; (2) quitar la metadata de documentos e imágenes antes de publicarlos, porque el app.xml, el número de serie y el thumbnail EXIF sin recortar son fugas reales; (3) política de geotag desactivado y revisión de qué exponen las fotos del personal y las instalaciones; y (4) monitoreo de la propia huella en street views y buscadores faciales.

En MITRE ATT&CK el capítulo cubre la táctica de reconocimiento: T1596 (Search Open Technical Databases, para el almacenamiento en la nube), T1593 (Search Open Websites/Domains), T1592.002 (Gather Victim Host Information: Software, vía metadata) y T1589 (Gather Victim Identity Information). Como toda la fase de recon, su mitigación es Pre-compromise (M1056) sumada a la higiene de publicación: no se detecta en el perímetro, se reduce lo que se expone.

Referencias#

  • osint/bazzell-osint/cap-05Contenido: geoint (la coordenada GPS como ancla y las URLs estáticas por proveedor, street views colaborativos Mapillary/KartaView y su fuga de matrícula/patrón de viaje, Acre Value vía xhr, datación por sombras); documentos (dorking ext:/filetype:, buckets mal configurados y Gray Hat Warfare, metadata con exiftool y el caso BTK, extracción manual .pptx.zip); imágenes (reverse search en cinco motores con Yandex superior, FaceCheck/CarNet, EXIF con serial/geotag/thumbnail delator, Foto Forensics/Forensically); video (frames, API/XML, uploader email de archive.org, TV News Archive); y broadcast streams (Stream Detector→m3u8, KiwiSDR remoto, Broadcastify).
  • Michael Bazzell, OSINT Techniques (10ª ed., 2023), capítulos de mapas, documentos, imágenes, video y emisiones; inteltechniques.com para las herramientas —recordando que las URLs concretas caducan y lo durable es el patrón de extraer la propiedad incrustada y paralelizar las fuentes—.
  • Herramientas: ExifTool, Jeffrey’s Exif Viewer, Forensically (análisis local), Gray Hat Warfare.
  • MITRE ATT&CK — Reconnaissance (TA0043): T1596, T1593 y T1592/002, con mitigación Pre-compromise (M1056).