Limitações

Transparência radical sobre o que falta:

Cobertura

  • Só war.gov/UFO/: AARO (aaro.mil) e ODNI (dni.gov/uap) ainda não estão incluídos.
  • Antes de 1947: cobertura esparsa. Foo Fighters, Ghost Rockets e Battle of Los Angeles têm página, mas o material primário existe principalmente em arquivos militares ainda não desclassificados.
  • Incidentes fora do corpus: páginas sem documento primário suficiente não são promovidas para indexação. A existência de uma página de tópico não significa que o acervo possua evidência oficial sobre ela.

Qualidade do OCR

  • Manuscrito: pode haver letras trocadas, palavras omitidas e erros em abreviações ou nomes próprios.
  • Documentos muito redigidos: páginas com >50% de pixels pretos têm OCR pobre por design.
  • Datas inferidas: quando o documento não tem data explícita, podem ser usados metadados do catálogo ou inferência automatizada. Confira o PDF antes de citar.
  • Confiança automática: é um sinal técnico, não uma revisão humana nem uma garantia de exatidão.

Vídeos

  • Transcrição de áudio: ainda não implementada na v1. Player funciona, mas legendas sincronizadas virão na v1.1.
  • Frames-chave: vídeos ainda não têm extração de frames como itens visuais.

Tradução

  • Idiomas suportados: inglês (padrão), PT-BR e espanhol.
  • Tradução de OCR completo: só títulos, resumos e captions são traduzidos. Texto OCR fica no idioma original (predominantemente EN).
  • Tradução automática: pode alterar nuances, siglas e nomes. A versão em inglês também pode conter síntese automática; nenhuma tradução substitui a fonte.

Busca

  • Sem busca semântica: full-text com BM25, sem embeddings. "platillo volador" não acha "flying saucer" sem digitar uma das duas formas exatamente.
  • Latência de re-index: novo conteúdo aparece após o próximo build (~minutos), não em tempo real.

Mudanças no site oficial

  • Diff automático: ainda em desenvolvimento. Por enquanto, snapshots manuais do manifest.
  • Itens removidos do war.gov: mantemos o arquivo localmente, mas pode haver atraso até detectarmos a remoção.
  • Histórico público: ainda não há página pública com todas as versões, timestamps independentes, dumps mensais ou ancoragem externa de hashes.

Atribuição

  • Em alguns documentos, agência primária e secundária ficam ambíguas — usamos a primeira agência mencionada no entities.agencies da extração. Pode não refletir a fonte real.

Resumos, entidades e conteúdo editorial

  • Títulos, resumos, entidades e relações podem ser gerados ou ampliados por IA.
  • Artigos do blog são análise editorial baseada nas fontes citadas; não fazem parte do documento oficial.
  • Uma afirmação no OCR ou em um relatório registra o que a fonte diz, não que a afirmação foi comprovada.

Privacidade e correções

  • Documentos oficiais podem conter nomes ou dados de civis. Detectores automáticos de e-mail e telefone têm falsos positivos e falsos negativos.
  • Candidatos a dados pessoais devem passar por revisão antes da publicação de novos lotes.
  • Para relatar dado pessoal, erro material ou link quebrado, abra uma issue no repositório indicando a URL e a página. Correções precisam ser propagadas para o site, busca, API e cópias distribuídas.

Se você encontrar um erro material, abra uma issue no GitHub. Inclua o link do documento, a página e, quando possível, a imagem ou trecho da fonte original.