PROVENANCE

Metodología y trazabilidad.

Cómo llega un registro desde la publicación oficial hasta una página de este sitio, qué hace la IA con él y qué sabemos que es imperfecto. Si vas a citar este archivo, lee esta página primero.

De dónde salen los datos

La única fuente es la publicación oficial: el catálogo que el Departamento de Guerra de EE. UU. publica en war.gov/ufo, más los videos servidos a través de DVIDS. Aquí no hay nada tomado de foros de ovnis, colecciones privadas ni literatura secundaria. Si un registro no está en la publicación oficial, no está en este archivo.

Cómo se procesa cada registro

  1. 01Se descarga el catálogo oficial y se compara con lo que ya tenemos, de modo que solo se reprocesa lo nuevo o lo que cambió.
  2. 02El texto de ubicación se geocodifica cuando nombra un lugar real; entradas como «Various» u «órbita terrestre baja» quedan deliberadamente fuera del mapa.
  3. 03A los documentos se les extrae el texto, y las páginas escaneadas pasan por OCR. Las páginas que salen ilegibles se marcan como tales en vez de descartarse en silencio.
  4. 04Un modelo de lenguaje redacta un resumen y una transcripción para los documentos, y una descripción visual para video e imágenes, de modo que el material se vuelve buscable por lo que realmente contiene.
  5. 05Los resúmenes y las descripciones se traducen a los otros cinco idiomas, se reconstruyen el índice de búsqueda y el grafo de entidades, y todo el sitio se regenera como páginas estáticas.

Qué hace la IA y qué no debe hacer

El modelo transcribe, resume, describe imágenes y traduce. Tiene instrucción de no interpretar, no concluir y no rellenar vacíos: si una página no se puede leer, la respuesta correcta es decirlo. Cada bloque generado por IA está señalado como tal en el sitio, y el documento original siempre está enlazado al lado. La IA nunca decide si un avistamiento tiene explicación — ese juicio, cuando existe, es el del comentario de la agencia dentro del archivo.

Limitaciones conocidas

Escaneos ilegibles

Buena parte del corpus son copias al carbón mecanografiadas, microfilmes o papel muy tachado de los años cuarenta a sesenta. Cuando el OCR falla, el contador de páginas te dice exactamente cuánto se pudo leer — «4 de 55 páginas legibles» — en lugar de dar a entender una cobertura completa.

Documentos sin resumen

No todos los documentos llevan un resumen de IA. Cuando el OCR devuelve la mayor parte de un documento como ilegible, no se publica ningún resumen: 27 registros muestran hoy solo la descripción oficial. Un resumen escrito sobre páginas que no se pueden leer sería una suposición, y este archivo no supone. Esos registros vuelven a tener resumen únicamente si la fuente se procesa con éxito más adelante.

Traducción automática

Las cinco versiones no inglesas de cada resumen son traducciones automáticas, y los documentos en sí nunca se traducen: la transcripción que buscas siempre es el inglés original. Cuando la traducción y el original no coincidan, manda el original.

Extracción automática de entidades

El grafo de conocimiento se construye extrayendo del texto personas, lugares, agencias, descripciones de naves y fenómenos. Es una ayuda de navegación, no un hallazgo: una entidad solo se conserva cuando el término aparece en texto legible o en la descripción oficial, y los casi duplicados se fusionan con criterio conservador.

Política de correcciones

Si algo aquí está mal, se corrige y la corrección se documenta. Escribe a leonardo.sapuy@hotmail.com indicando el registro, el pasaje y, de ser posible, la página del PDF original. Los errores de hecho en transcripciones, resúmenes o traducciones se corrigen en los datos de origen y el sitio se reconstruye; cuando un error afectó a un resumen de IA, el resumen se retira en vez de parcharlo con una suposición. Esta página se actualiza cada vez que se detecta y corrige un problema sistémico como el descrito arriba.

leonardo.sapuy@hotmail.com

Last reviewed: 2026-07-26

Acerca de — archivo independiente de registros UAP desclasificados