Do arquivo original ao arquivo pronto para a IA

Um procedimento curto, que preserva o conteúdo útil do documento e retira o que identifica as pessoas citadas nele.

Anonimizar um documento antes de enviá-lo a uma ferramenta de inteligência artificial não é a mesma coisa que anonimizá-lo para publicação. Aqui o objetivo é duplo: retirar o que identifica pessoas e, ao mesmo tempo, preservar tudo aquilo de que a ferramenta precisa para produzir uma resposta útil.

A boa notícia é que os dois objetivos quase nunca entram em conflito. Um contrato continua sendo um contrato depois que os nomes saem, e a análise pedida à IA costuma depender das cláusulas, não das partes.

Este é o procedimento recomendado, seguido de uma verificação final antes do envio.

Antes de começar: decida o que precisa permanecer

A pergunta que orienta todo o processo é o que você vai pedir à ferramenta. Se a tarefa é resumir, comparar versões, extrair obrigações ou classificar o documento, nada disso depende da identidade das pessoas.

Já existem casos em que algum elemento precisa ficar. Datas costumam importar para prazos; valores importam para análises financeiras; a distinção entre as partes importa para entender obrigações recíprocas. Rótulos numerados resolvem esse último ponto, porque preservam a diferença entre uma pessoa e outra sem revelar quem são.

O passo a passo

  1. Reúna o documento completo
    Inclua anexos, comprovantes e páginas digitalizadas. Um anexo esquecido costuma conter exatamente os dados que o restante do trabalho tentou proteger.
  2. Envie o PDF para a plataforma
    Na DocSec, o arquivo é carregado e passa por reconhecimento óptico de caracteres quando contém páginas escaneadas ou imagens.
  3. Deixe a identificação automática rodar
    O modelo marca nomes, números de documento, endereços, telefones, e-mails, dados bancários e informações sensíveis, classificando cada ocorrência por tipo.
  4. Revise as marcações
    Revise todas as páginas, inclusive os trechos não marcados pela IA. Percorra também as ocorrências pelo painel, confirme o que deve sair, acrescente o que faltou e remova o que foi marcado por engano.
  5. Prefira rótulos numerados
    Eles mantêm a coerência do texto: a ferramenta de IA entende que as menções a uma mesma pessoa se referem à mesma entidade, sem acesso à identidade dela.
  6. Exporte e use a versão anonimizada
    O arquivo exportado sai com a informação removida do conteúdo, e é ele que deve ser enviado à ferramenta de inteligência artificial.

Verificação final antes do envio

  • Abra o PDF exportado e busque pelos dados que deveriam ter saído, conferindo também o texto extraível. A ausência de resultados é apenas uma checagem complementar: não comprova que as imagens e o conteúdo oculto estão livres desses dados.
  • Confira cabeçalhos, rodapés, carimbos, assinaturas e a última página, onde dados costumam escapar.
  • Revise os anexos digitalizados com atenção, especialmente se a qualidade da digitalização for baixa.
  • Verifique os metadados do arquivo, como autor e título, que podem carregar o nome de quem o produziu.
  • Avalie o que restou: cargo, unidade, data e valor, combinados, ainda permitem identificar alguém?

O que não funciona

Alguns atalhos parecem resolver e não resolvem.

  • Desenhar retângulos pretos no editor de PDF: o texto costuma permanecer no arquivo e é lido por qualquer ferramenta que extraia conteúdo, inclusive pela própria IA.
  • Substituir manualmente os nomes por XXX ao longo do documento: além de demorado, o método esquece ocorrências e destrói o contexto entre menções.
  • Converter tudo em imagem sem remover os dados visíveis: OCR e ferramentas de IA com leitura de imagens podem continuar lendo essas informações. A conversão, por si só, não anonimiza o documento.
  • Confiar apenas na busca por CPF: dados pessoais aparecem em formatos variados, e nomes não têm padrão previsível.

Perguntas frequentes

A IA ainda consegue analisar um documento anonimizado?

Sim, desde que o conteúdo preservado seja suficiente para a tarefa. Rótulos ajudam a manter o contexto, mas a remoção de informações pode afetar resumos, comparações e outras análises. A resposta precisa ser revisada, sem presumir equivalência com a análise do original.

Preciso anonimizar também nomes de empresas?

Depende da finalidade. Dados de pessoa jurídica não são dados pessoais, mas o nome de uma empresa pequena pode identificar indiretamente seus sócios, e informações comerciais podem ser confidenciais por outros motivos.

E se o PDF for digitalizado?

O reconhecimento óptico de caracteres identifica o texto das páginas em imagem antes da análise, o que permite marcar e remover os dados pessoais encontrados nelas.

Como manter a diferença entre as pessoas citadas no documento?

Com rótulos numerados. Cada pessoa recebe um identificador estável ao longo do texto, o que preserva o contexto da leitura e da análise sem revelar a identidade de ninguém.

Continue explorando