Anonimizador de PDF com revisão humana

Remova dados pessoais de arquivos PDF sem depender de tarjas manuais e sem deixar o texto original escondido dentro do arquivo.

O PDF é o formato em que os documentos circulam: petições, contratos, laudos, ofícios, relatórios e processos inteiros. Também é o formato em que os dados pessoais mais escapam, porque a maneira mais comum de esconder uma informação em um PDF, que é desenhar um retângulo por cima, não apaga coisa alguma.

Anonimizar um PDF corretamente significa remover o conteúdo do arquivo, e não apenas cobri-lo. É isso que impede que o nome tarjado seja recuperado com um comando de copiar e colar.

A DocSec identifica automaticamente os dados pessoais do arquivo, mostra cada ocorrência para revisão e exporta um PDF em que a informação marcada deixa de existir.

Como anonimizar um PDF na DocSec

  1. Envie o arquivo
    O PDF é carregado na plataforma. Se for um documento digitalizado ou composto por imagens, o OCR reconhece o texto das páginas antes da análise.
  2. Deixe a IA localizar os dados
    O modelo percorre o documento inteiro e marca nomes, números de documento, endereços, telefones, e-mails e demais informações pessoais, classificando cada ocorrência por tipo.
  3. Revise ocorrência por ocorrência
    Use os filtros por tipo de dado para percorrer as marcações, verifique o que está por trás de cada rótulo e confira se o conjunto está correto.
  4. Ajuste o que for necessário
    Acrescente marcações que a análise não encontrou, remova as que não deveriam estar ali e altere a classificação quando o tipo de dado estiver incorreto.
  5. Exporte o PDF anonimizado
    O arquivo é gerado com as informações removidas e os rótulos aplicados, pronto para ser enviado, publicado ou usado em outras ferramentas.

Por que uma tarja apenas visual não protege o PDF

Editores de texto, ferramentas de desenho e visualizadores de PDF permitem sobrepor uma forma opaca a um trecho da página. Visualmente, a informação some. Estruturalmente, o PDF continua guardando o texto original em uma camada por baixo do desenho.

O resultado é conhecido: quem recebe o arquivo seleciona a área tarjada, copia e lê o conteúdo. O mesmo acontece com ferramentas de extração de texto e com a busca dentro do documento. Episódios de divulgação indevida de dados sigilosos em documentos oficiais já aconteceram exatamente assim.

Converter o documento em imagem não anonimiza os dados que continuam visíveis: eles podem ser lidos por pessoas, OCR ou ferramentas de IA com leitura de imagens. A conversão só elimina o texto sob uma tarja se ela for incorporada à imagem e as camadas originais forem descartadas; também pode prejudicar a busca e a acessibilidade.

A anonimização efetiva remove o conteúdo marcado do arquivo exportado e mantém o restante do texto legível, pesquisável e acessível.

Quais dados são identificados no PDF

A análise cobre as informações que identificam uma pessoa direta ou indiretamente, incluindo as categorias que a LGPD trata como sensíveis.

  • Nomes de pessoas, apelidos e assinaturas
  • CPF, RG, CNH, PIS, título de eleitor e outros números de documento
  • Endereços, CEP, telefones e endereços de e-mail
  • Datas de nascimento e informações de filiação
  • Dados bancários, números de conta, cartões e valores associados a uma pessoa
  • Informações de saúde, dados biométricos e demais dados sensíveis

Como o critério do que deve sair do documento varia conforme a finalidade, a lista identificada pela IA é o ponto de partida da revisão, não uma decisão final.

PDFs digitalizados e documentos escaneados

Boa parte dos documentos que precisam de anonimização não nasceu digital: são cópias escaneadas, digitalizações de processos antigos ou fotografias de papéis. Nesses arquivos não existe texto selecionável, e nenhuma busca encontra um CPF.

A DocSec aplica reconhecimento óptico de caracteres antes da análise, o que permite localizar e anonimizar dados pessoais também nessas páginas. Documentos com qualidade de digitalização ruim exigem atenção redobrada na revisão, e é para isso que o painel de ocorrências existe.

Antes de compartilhar o PDF, confira

  • Todas as ocorrências do mesmo nome foram tratadas, inclusive em cabeçalhos, rodapés, carimbos e anexos?
  • Os metadados do arquivo, como autor e histórico de edição, foram considerados?
  • Restaram informações que, combinadas, ainda permitem identificar a pessoa, como cargo, matrícula e unidade?
  • O documento exportado foi aberto novamente e testado com uma busca pelos dados que deveriam ter saído?
  • A finalidade do compartilhamento justifica manter os dados que permaneceram no arquivo?

Perguntas frequentes

Como anonimizar um PDF sem que o texto continue no arquivo?

É preciso usar uma ferramenta que remova o conteúdo do PDF, e não que apenas desenhe uma forma sobre ele. Na DocSec, a informação marcada é retirada do arquivo exportado, de modo que não pode ser selecionada, copiada nem localizada por busca no documento final.

Dá para anonimizar um PDF digitalizado?

Sim. A plataforma aplica OCR nas páginas que são imagens, reconhece o texto e permite marcar e remover os dados pessoais encontrados, do mesmo modo que em um PDF nativo.

Anonimizar o PDF deixa o documento ilegível?

Não. Apenas as informações marcadas saem do arquivo, substituídas por rótulos que indicam o tipo de dado removido. Os rótulos numerados preservam o contexto: é possível acompanhar que duas menções se referiam à mesma pessoa sem revelar quem ela é.

É possível anonimizar vários documentos com o mesmo critério?

Sim. A identificação automática aplica o mesmo modelo a todos os documentos, o que padroniza o ponto de partida da revisão. O licenciamento corporativo é dimensionado conforme o volume de documentos e a quantidade de usuários da organização.

Continue explorando