Anonimização visual de documentos médicos brasileiros, rodando inteiramente na sua máquina.
Você arrasta um laudo, uma ficha, uma receita ou uma guia TISS. A ferramenta encontra os dados pessoais, mostra cada um marcado sobre a imagem para você conferir, e exporta uma versão com os dados apagados. Nenhum arquivo sai do computador em nenhum momento.
Prefere Docker? Veja o modo avançado.
Compartilhar um caso clínico é rotina, mas tarjar dado pessoal à mão em dezenas de arquivos é o tipo de tarefa que ninguém faz direito por muito tempo.
Prontuário de paciente saindo da clínica para um servidor de terceiro é exatamente o risco que a LGPD trata como sensível.
Ferramenta genérica não sabe o que é CNS, CRM, RQE, guia TISS ou carteirinha de convênio, e não valida CPF nem CNPJ.
É o erro clássico de PDF de tribunal: a tarja é uma camada, e o texto continua lá embaixo, selecionável.
CPF, CNPJ e CNS passam por validação de dígito verificador. CRM, RQE, COREN, CNES, guia e senha TISS são reconhecidos nativamente.
Nome de paciente, nome de médico ou profissional
CPF, CNPJ, RG, CNS
Prontuário, identificador genérico
Telefone, e-mail
Logradouro, cidade, UF, CEP
Data, data de nascimento, idade
CRM, RQE, COREN
Hospital, clínica, laboratório, CNES
Número de guia, senha de autorização, carteirinha
URL, endereço IP
Números suspeitos que não se encaixam em nenhuma categoria conhecida também são tarjados, por decisão de projeto: na dúvida, cobre. Faltou alguma coisa? Você pode desenhar a tarja à mão direto sobre o documento.
Um mapa de deslocamento liga cada caractere encontrado pelo OCR à sua posição exata na imagem, e é isso que permite tarjar o pixel certo, sem tokenizar nada de novo.
PNG, JPG, WEBP ou PDF, direto na interface local.
Lê o texto e guarda a posição exata de cada caractere na imagem.
Encontra os dados pessoais no texto, treinado para o contexto clínico brasileiro.
Confere dígito verificador de CPF, CNPJ e CNS antes de marcar qualquer coisa.
Você confere cada marcação na tela antes de exportar.
PNG com a região reescrita em preto puro. Não existe camada, não existe "embaixo".
A promessa de rodar offline não deveria ser aceita na base da confiança: dá para conferir com um sniffer de rede.
Roda inteiramente na sua máquina. Nenhum arquivo sai do computador em nenhum momento, nem para treinar modelo, nem para qualquer servidor.
OCR e modelo de PII treinados em português, com validadores reais de CPF, CNPJ e CNS e identificadores do sistema de saúde brasileiro.
O export reescreve os bytes da imagem em preto puro. Não é um retângulo por cima: não há texto selecionável nem camada para recuperar.
Se uma entidade é encontrada mas não consegue ser localizada na imagem, o export é bloqueado. Prefere não deixar exportar a deixar vazar.
Licença Apache 2.0. Código aberto, auditável por qualquer pessoa, sem custo de licença.
Corpus de teste com gabarito e baselines versionados. Falso negativo é tratado como falha crítica do projeto.
Escolha o instalador do Windows para começar em minutos, ou Docker se você já tem o ambiente.
Windows · não precisa de Docker
Um instalador que baixa e prepara o resto sozinho na primeira execução, runtime Python e modelos de IA inclusos. Não precisa instalar Python, Docker nem nada por conta própria.
Este instalador ainda não é assinado digitalmente. Estamos em processo de credenciamento na SignPath Foundation, que assina projetos open source de graça. Até lá, o Windows deve mostrar um aviso de "editor desconhecido" (SmartScreen). É esperado, não é vírus: clique em Mais informações → Executar assim mesmo. A primeira execução também é lenta (alguns minutos, baixando ~5 GB de modelos), mas depois disso o app abre rápido e funciona bem.
Docker · Windows, macOS ou Linux
Para quem já usa Docker, quer rodar em servidor, ou precisa de GPU. Requer Docker 24+ com Compose v2, 8 GB de RAM e cerca de 4 GB de espaço para os modelos.
git clone https://github.com/Xdiag-IA/xdiag-privacy.git
cd xdiag-privacy && docker compose up --buildDepois disso, abra http://localhost:5173 e arraste um documento. A pasta samples/ traz documentos sintéticos para testar sem usar dado de paciente real.
Sim. É software livre sob licença Apache 2.0, sem custo de licença, e o código está aberto no GitHub para qualquer pessoa auditar ou contribuir.
Não, seja pelo instalador do Windows ou por Docker. A ferramenta roda inteiramente na sua máquina. Depois de baixados os modelos na primeira execução, dá para conferir com um sniffer de rede que nenhum tráfego sai do computador durante o uso.
Porque o instalador ainda não é assinado digitalmente. Estamos em processo de credenciamento na SignPath Foundation, que assina gratuitamente projetos open source, e assim que aprovado, o aviso some. Até lá, é seguro clicar em "Mais informações → Executar assim mesmo".
Não. Ela auxilia o tratamento de dados pessoais sensíveis, mas não substitui DPO, encarregado de dados, política de privacidade nem revisão jurídica. Nenhum modelo de IA acerta 100% das vezes, então sempre confira o resultado antes de compartilhar qualquer documento.
O export de texto funciona. O export de imagem para documentos multipágina ainda está em desenvolvimento e fica bloqueado de propósito, em vez de exportar só a primeira página em silêncio.
Não. Roda em CPU por padrão. GPU NVIDIA é suportada como configuração opcional para acelerar o processamento.
O repositório tem um CONTRIBUTING.md com o processo. Falso negativo (a ferramenta não detectar um dado pessoal) é considerado o bug mais valioso do projeto. Falhas de segurança devem ser reportadas pelo canal privado descrito no SECURITY.md, nunca em issue pública.
Clone o repositório, rode localmente e contribua se encontrar um falso negativo, o bug mais valioso do projeto.
Xdiag-IA/xdiag-privacy