Pasa un contrato escaneado por su herramienta de censura habitual y esta informa alegremente de que «no se han encontrado datos personales» — en una página llena de nombres. Nada ha dado error, así que se fía. Ese fallo silencioso es el modo de fallo más peligroso de toda la censura de documentos, y ocurre porque un escaneado es una imagen, no texto.
Datos clave
- Un PDF escaneado es una imagen, así que las herramientas de censura basadas en texto no encuentran texto y pueden informar en silencio de que «no se han encontrado datos personales» en una página repleta de ellos.
- Censurar un escaneado requiere OCR para localizar los datos personales como regiones de la imagen, y luego pintar sobre esos píxeles.
- Una canalización de censura de escaneados adecuada reconstruye una capa de texto apta para búsquedas, de modo que el documento censurado sigue siendo utilizable.
- El OCR y la censura en el dispositivo mantienen los escaneados sensibles — documentos de identidad, historiales médicos, acuerdos firmados — fuera de los servidores de terceros.
La respuesta breve
Un PDF escaneado es una imagen, no texto, así que las herramientas de censura basadas en texto no encuentran nada que censurar y lo pasan todo por alto en silencio. Para censurar un escaneado necesita una herramienta que ejecute OCR para localizar los datos personales como regiones de la imagen, censure esas regiones y, en el mejor de los casos, reconstruya una capa de texto apta para búsquedas. Hacerlo en el dispositivo mantiene los originales escaneados — a menudo los documentos más sensibles que posee — fuera de los servidores de terceros.
Por qué los documentos escaneados rompen la censura normal
Abra un contrato escaneado e intente seleccionar una palabra. No puede — no hay texto, solo píxeles. Este es el modo de fallo que atrapa a la gente:
- La censura por búsqueda de texto no encuentra nada. Una herramienta que censura buscando nombres no tiene texto que buscar, así que informa de que «no se han encontrado datos personales» en una página llena de ellos.
- Los recuadros negros manuales conllevan el riesgo habitual — y ahora, además, está revisando cada página a ojo.
- El documento aún puede filtrar datos a través de los metadatos o de una capa de OCR adjunta, incluso cuando la página visible parece limpia.
Los escaneados necesitan una canalización fundamentalmente distinta.
La canalización adecuada para censurar escaneados
- Aplique OCR a la página para reconocer el texto y, algo crucial, dónde se sitúa cada palabra en la imagen (su cuadro delimitador).
- Detecte los datos personales en ese texto reconocido — nombres, identificadores, direcciones, números de cuenta.
- Censure las regiones de imagen que corresponden a esas detecciones — pintando de verdad sobre los píxeles, no superponiendo una forma que se pueda quitar.
- Reconstruya una capa de texto limpia y apta para búsquedas de modo que el documento censurado siga siendo utilizable y consultable, menos las entidades eliminadas.
Sáltese el paso 4 y su escaneado «censurado» se convierte en una imagen plana no consultable; haga los pasos 1 a 3 con descuido y o bien se le escapan datos o bien censura de más. El principio de fondo es el mismo que para los PDF de texto: una marca no es censura a menos que el contenido que hay debajo haya desaparecido (vea la censura de PDF jurídicos sin la nube).
Por qué el dispositivo importa aún más en los escaneados
Los documentos escaneados son, de forma desproporcionada, los sensibles — acuerdos firmados, historiales médicos, copias de documentos de identidad, notas manuscritas. Subir esos a un servicio de OCR y censura en la nube es la versión de mayor riesgo del problema. El OCR y la censura en el dispositivo hacen que incluso sus escaneados no salgan nunca de su equipo.
Preguntas frecuentes
¿Por qué mi herramienta de censura dijo «no se ha encontrado información personal» en un PDF escaneado?
Porque buscó texto y el escaneado no tiene ninguno. Necesita una censura basada en OCR que trabaje sobre la propia imagen.
¿Censurar un escaneado lo dejará no consultable?
Solo si la herramienta no reconstruye una capa de texto. Una buena mantiene el documento consultable a la vez que elimina las entidades censuradas.
¿Puede recuperarse el texto eliminado de un escaneado censurado?
No, si los píxeles se pintan de verdad por encima y ninguna capa de texto oculta los conserva — que es exactamente lo que garantiza una canalización adecuada en el dispositivo.
En resumen
Si su herramienta de censura no sabe hacer OCR, no puede censurar un escaneado — solo puede decirle, erróneamente, que no había nada que censurar. Use una herramienta que encuentre los datos personales como regiones de imagen, pinte por encima de los píxeles y mantenga el resultado consultable, todo en su propio dispositivo.
promptShield ejecuta OCR, detección y censura en PDF e imágenes escaneados enteramente en su dispositivo, pintando sobre las regiones reales de la imagen y manteniendo el resultado consultable — sin subidas, ni siquiera para sus escaneados más sensibles. Pruébelo con su propio documento.