Passa um contrato digitalizado pela sua ferramenta de ocultação habitual, e ela reporta alegremente «nenhum dado pessoal encontrado» — numa página cheia de nomes. Nada deu erro, por isso confia nela. Esse falhanço silencioso é o modo de falha mais perigoso na ocultação de documentos, e acontece porque uma digitalização é uma imagem, não texto.
Factos essenciais
- Um PDF digitalizado é uma imagem, por isso as ferramentas de ocultação baseadas em texto não encontram texto e podem reportar em silêncio «nenhum dado pessoal encontrado» numa página cheia deles.
- Ocultar uma digitalização exige OCR para localizar os dados pessoais como regiões da imagem e, depois, cobrir esses pixels.
- Um pipeline adequado de ocultação de digitalizações reconstrói uma camada de texto pesquisável para que o documento ocultado se mantenha utilizável.
- O OCR e a ocultação no dispositivo mantêm as digitalizações sensíveis — documentos de identificação, registos médicos, acordos assinados — fora dos servidores de terceiros.
A resposta breve
Um PDF digitalizado é uma imagem, não texto, por isso as ferramentas de ocultação baseadas em texto não encontram nada para ocultar e falham tudo em silêncio. Para ocultar uma digitalização precisa de uma ferramenta que aplique OCR para localizar os dados pessoais como regiões da imagem, oculte essas regiões e, idealmente, reconstrua uma camada de texto pesquisável. Fazê-lo no dispositivo mantém os originais digitalizados — muitas vezes os documentos mais sensíveis que detém — fora dos servidores de terceiros.
Porque é que os documentos digitalizados desmontam a ocultação normal
Abra um contrato digitalizado e tente selecionar uma palavra. Não consegue — não há texto, apenas pixels. Este é o modo de falha que apanha as pessoas:
- A ocultação por pesquisa de texto não encontra nada. Uma ferramenta que oculta procurando nomes não tem texto para procurar, por isso reporta «nenhum dado pessoal encontrado» numa página cheia deles.
- As caixas pretas manuais acarretam o risco habitual — e agora está a inspecionar cada página à mão.
- O documento pode ainda assim fugir através de metadados ou de uma camada de OCR anexada, mesmo quando a página visível parece limpa.
As digitalizações precisam de um pipeline fundamentalmente diferente.
O pipeline certo para a ocultação de digitalizações
- Aplique OCR à página para reconhecer o texto e, ponto crucial, onde cada palavra se encontra na imagem (a sua caixa delimitadora).
- Detete os dados pessoais nesse texto reconhecido — nomes, identificadores, moradas, números de conta.
- Oculte as regiões de imagem correspondentes a essas deteções — cobrindo efetivamente os pixels, não sobrepondo uma forma removível.
- Reconstrua uma camada de texto limpa e pesquisável para que o documento ocultado se mantenha utilizável e pesquisável, menos as entidades removidas.
Salte o passo 4 e a sua digitalização «ocultada» torna-se uma imagem plana e não pesquisável; faça os passos 1–3 de forma descuidada e ou falha dados ou oculta em excesso. O princípio subjacente é o mesmo dos PDF de texto: uma marca não é ocultação a menos que o conteúdo por baixo dela tenha desaparecido (veja ocultar PDF jurídicos sem a nuvem).
Porque é que fazê-lo no dispositivo importa ainda mais nas digitalizações
Os documentos digitalizados são, desproporcionadamente, os sensíveis — acordos assinados, registos médicos, cópias de documentos de identificação, notas manuscritas. Carregar esses para um serviço de OCR e ocultação na nuvem é a versão de maior risco do problema. O OCR e a ocultação no dispositivo significam que nem as suas digitalizações saem da sua máquina.
Perguntas frequentes
Porque é que a minha ferramenta de ocultação disse «nenhum dado pessoal encontrado» num PDF digitalizado?
Porque procurou texto e a digitalização não o tem. Precisa de uma ocultação baseada em OCR que funcione sobre a própria imagem.
Ocultar uma digitalização torna-a não pesquisável?
Só se a ferramenta não reconstruir uma camada de texto. Uma boa mantém o documento pesquisável ao mesmo tempo que remove as entidades ocultadas.
O texto removido pode ainda ser recuperado de uma digitalização ocultada?
Não, se os pixels forem efetivamente cobertos e nenhuma camada de texto oculta os conservar — que é exatamente o que um pipeline adequado no dispositivo assegura.
Em conclusão
Se a sua ferramenta de ocultação não consegue aplicar OCR, não consegue ocultar uma digitalização — só lhe consegue dizer, erradamente, que não havia nada para ocultar. Use uma ferramenta que encontre os dados pessoais como regiões de imagem, cubra os pixels e mantenha o resultado pesquisável, tudo no seu próprio dispositivo.
O promptShield executa OCR, deteção e ocultação em PDF digitalizados e imagens inteiramente no seu dispositivo, cobrindo as regiões de imagem reais e mantendo o resultado pesquisável — sem carregamento, mesmo para as suas digitalizações mais sensíveis. Experimente-o no seu próprio documento.