PROVENANCE
Méthodologie et provenance.
Comment un document passe de la publication officielle à une page de ce site, ce que l'IA en fait, et ce que nous savons être imparfait. Si vous comptez citer cette archive, commencez par lire cette page.
D'où viennent les données
La seule source est la publication officielle : le catalogue que le département de la Guerre des États-Unis met en ligne sur war.gov/ufo, ainsi que les vidéos diffusées via DVIDS. Rien ici ne provient de forums OVNI, de collections privées ou de littérature secondaire. Si un document ne figure pas dans la publication officielle, il ne figure pas dans cette archive.
Comment chaque document est traité
- 01Le catalogue officiel est téléchargé puis comparé à ce que nous détenons déjà, afin de ne retraiter que les documents nouveaux ou modifiés.
- 02Le lieu indiqué est géocodé lorsqu'il désigne un endroit réel ; des mentions comme « Various » ou « Low-Earth orbit » sont délibérément laissées hors de la carte.
- 03Le texte des documents est extrait et les pages numérisées passent par une reconnaissance optique de caractères (OCR). Les pages qui en ressortent illisibles sont signalées comme telles, plutôt que discrètement écartées.
- 04Un modèle de langage rédige un résumé et une transcription pour les documents, ainsi qu'une description visuelle pour les vidéos et les images, afin que le matériel devienne consultable par ce qu'il contient réellement.
- 05Les résumés et les descriptions sont traduits dans les cinq autres langues, l'index de recherche et le graphe d'entités sont reconstruits, et l'ensemble du site est régénéré sous forme de pages statiques.
Ce que fait l'IA, et ce qu'elle ne doit pas faire
Le modèle transcrit, résume, décrit les images et traduit. Il a pour consigne de ne pas interpréter, ne pas conclure et ne pas combler les vides : si une page est illisible, la bonne réponse est de le dire. Chaque bloc généré par IA est signalé comme tel sur le site, et le document original est toujours accessible juste à côté. L'IA ne décide jamais si une observation est expliquée : ce jugement, lorsqu'il existe, appartient au commentaire de l'agence figurant dans le dossier.
Limites connues
Numérisations illisibles
Une grande partie du corpus se compose de copies carbone dactylographiées, de microfilms ou de documents fortement caviardés, des années 1940 aux années 1960. Lorsque l'OCR échoue, le compteur de pages indique exactement la part réellement lisible — « 4 des 55 pages lisibles » — au lieu de laisser croire à une couverture complète.
Documents sans résumé
Tous les documents n'ont pas de résumé généré par IA. Lorsque l'OCR renvoie la plus grande partie d'un document comme illisible, aucun résumé n'est publié : 27 dossiers n'affichent aujourd'hui que la description officielle. Un résumé rédigé sur des pages qui ne peuvent pas être lues relèverait de la supposition, et cette archive ne suppose pas. Ces dossiers ne retrouveront un résumé que si la source est traitée avec succès ultérieurement.
Traduction automatique
Les cinq versions non anglaises de chaque résumé sont traduites automatiquement, et les documents eux-mêmes ne sont jamais traduits : la transcription dans laquelle vous effectuez vos recherches reste toujours l'anglais d'origine. En cas de désaccord entre une traduction et l'original, c'est l'original qui prévaut.
Extraction automatique d'entités
Le graphe de connaissances est construit en extrayant du texte les personnes, les lieux, les agences, les descriptions d'appareils et les phénomènes. C'est une aide à la navigation, pas un constat : une entité n'est conservée que si le terme apparaît dans du texte lisible ou dans la description officielle, et les quasi-doublons sont fusionnés avec prudence.
Politique de corrections
Si quelque chose est erroné ici, l'erreur est corrigée et la correction documentée. Écrivez à leonardo.sapuy@hotmail.com en précisant le document, le passage et, si possible, la page du PDF original. Les erreurs factuelles dans les transcriptions, les résumés ou les traductions sont corrigées dans les données source, puis le site est reconstruit ; lorsqu'une erreur affecte un résumé produit par IA, ce résumé est retiré plutôt que rafistolé en conjecture. Cette page est mise à jour chaque fois qu'un problème systémique — comme celui décrit ci-dessus — est détecté et corrigé.
Last reviewed: 2026-07-26
À propos — une archive indépendante de documents UAP déclassifiés →