PROVENANCE

Metodologia e proveniência.

Como um registro sai da divulgação oficial e chega a uma página deste site, o que a IA faz com ele e o que sabemos que ainda é imperfeito. Se você pretende citar este acervo, leia esta página antes.

De onde vêm os dados

A única fonte é a divulgação oficial: o catálogo que o Departamento de Guerra dos EUA publica em war.gov/ufo, mais os arquivos de vídeo servidos pelo DVIDS. Nada aqui vem de fóruns de OVNIs, coleções particulares ou literatura secundária. Se um registro não está na divulgação oficial, ele não está neste acervo.

Como cada registro é processado

  1. 01O catálogo oficial é baixado e comparado com o que já temos, de modo que só registros novos ou alterados são reprocessados.
  2. 02O texto de localização é geocodificado quando nomeia um lugar real; entradas como “Various” ou “Low-Earth orbit” ficam deliberadamente fora do mapa.
  3. 03Dos documentos se extrai o texto, e as páginas digitalizadas passam por OCR. As páginas que voltam ilegíveis são marcadas como tal, em vez de serem descartadas em silêncio.
  4. 04Um modelo de linguagem escreve um resumo e uma transcrição para os documentos, e uma descrição visual para vídeos e imagens, para que o material se torne pesquisável pelo que de fato contém.
  5. 05Resumos e descrições são traduzidos para os outros cinco idiomas, o índice de busca e o grafo de entidades são reconstruídos, e todo o site é regerado como páginas estáticas.

O que a IA faz — e o que ela não pode fazer

O modelo transcreve, resume, descreve imagens e traduz. Ele é instruído a não interpretar, concluir nem preencher lacunas: se uma página não pode ser lida, a resposta correta é dizer isso. Todo bloco gerado por IA no site vem identificado como tal, e o documento original está sempre linkado ao lado. A IA nunca decide se um avistamento foi explicado — esse juízo, quando existe, cabe ao comentário da agência dentro do próprio arquivo.

Limitações conhecidas

Digitalizações ilegíveis

Boa parte do acervo é cópia carbono datilografada, microfilme ou papel fortemente censurado das décadas de 1940 a 1960. Quando o OCR falha, o contador de páginas informa exatamente quanto era legível — “4 de 55 páginas legíveis” — em vez de sugerir cobertura completa.

Documentos sem resumo

Nem todo documento tem resumo gerado por IA. Quando o OCR devolve a maior parte de um documento como ilegível, nenhum resumo é publicado: 27 registros mostram hoje apenas a descrição oficial. Um resumo escrito sobre páginas que não podem ser lidas seria um palpite, e este acervo não dá palpites. Esses registros só voltam a ter resumo se a fonte for processada com sucesso mais adiante.

Tradução automática

As cinco versões não inglesas de cada resumo são traduzidas automaticamente, e os documentos em si nunca são traduzidos — a transcrição que você pesquisa é sempre o original em inglês. Quando a tradução e o original divergem, o original prevalece.

Extração automática de entidades

O grafo de conhecimento é construído extraindo do texto pessoas, lugares, agências, descrições de objetos e fenômenos. É um recurso de navegação, não um achado: uma entidade só é mantida quando o termo aparece em texto legível ou na descrição oficial, e quase duplicatas são unificadas de forma conservadora.

Política de correções

Se algo aqui está errado, é corrigido e a correção fica documentada. Escreva para leonardo.sapuy@hotmail.com indicando o registro, o trecho e, se possível, a página do PDF original. Erros factuais em transcrições, resumos ou traduções são corrigidos nos dados de origem e o site é reconstruído; quando o erro afetou um resumo gerado por IA, o resumo é retirado em vez de ser remendado com uma suposição. Esta página é atualizada sempre que um problema sistêmico — como o descrito acima — é identificado e corrigido.

leonardo.sapuy@hotmail.com

Last reviewed: 2026-07-26

Sobre — um acervo independente de registros UAP desclassificados