U haalt een gescand contract door uw gebruikelijke zwartlakkingstool, en die meldt opgewekt “geen persoonsgegevens gevonden” — op een pagina vol namen. Er ging niets fout, dus u vertrouwt erop. Die stilzwijgende misser is de gevaarlijkste faalwijze in documentzwartlakking, en hij gebeurt omdat een scan een plaatje is, geen tekst.
Kernpunten
- Een gescande pdf is een afbeelding, dus tekstgebaseerde zwartlakkingstools vinden geen tekst en kunnen stilzwijgend “geen persoonsgegevens gevonden” melden op een pagina die er vol mee staat.
- Een scan zwartlakken vereist OCR om persoonsgegevens als gebieden van de afbeelding op te sporen, en die pixels vervolgens over te schilderen.
- Een goede pijplijn voor gescande zwartlakking herbouwt een doorzoekbare tekstlaag zodat het zwartgelakte document bruikbaar blijft.
- OCR en zwartlakking op het apparaat houden gevoelige scans — identiteitsbewijzen, medische gegevens, ondertekende overeenkomsten — van de servers van derden af.
Het korte antwoord
Een gescande pdf is een afbeelding, geen tekst, dus tekstgebaseerde zwartlakkingstools vinden niets om zwart te lakken en missen stilzwijgend alles. Om een scan zwart te lakken hebt u een tool nodig die OCR uitvoert om de persoonsgegevens als gebieden van de afbeelding op te sporen, die gebieden zwartlakt en idealiter een doorzoekbare tekstlaag herbouwt. Dit op het apparaat doen houdt de gescande originelen — vaak de gevoeligste documenten die u hebt — van de servers van derden af.
Waarom gescande documenten gewone zwartlakking breken
Open een gescand contract en probeer een woord te selecteren. Dat lukt niet — er is geen tekst, alleen pixels. Dit is de faalwijze die mensen te grazen neemt:
- Zwartlakking op basis van tekstzoeken vindt niets. Een tool die zwartlakt door naar namen te zoeken, heeft geen tekst om in te zoeken, dus meldt hij “geen persoonsgegevens gevonden” op een pagina die er vol mee staat.
- Handmatige zwarte vlakken dragen het gebruikelijke risico — en nu bekijkt u ook nog eens elke pagina met het blote oog.
- Het document kan nog steeds lekken via metagegevens of een gekoppelde OCR-laag, zelfs wanneer de zichtbare pagina er schoon uitziet.
Scans hebben een fundamenteel andere pijplijn nodig.
De juiste pijplijn voor gescande zwartlakking
- Verwerk de pagina met OCR om de tekst te herkennen en, cruciaal, waar elk woord op de afbeelding zit (het begrenzingsvak ervan).
- Detecteer persoonsgegevens in die herkende tekst — namen, identificatienummers, adressen, rekeningnummers.
- Lak de beeldgebieden zwart die overeenkomen met die detecties — door de pixels werkelijk over te schilderen, niet door er een verwijderbare vorm overheen te leggen.
- Herbouw een schone, doorzoekbare tekstlaag zodat het zwartgelakte document bruikbaar en doorzoekbaar blijft, minus de verwijderde entiteiten.
Slaat u stap 4 over, dan wordt uw “zwartgelakte” scan een niet-doorzoekbare platte afbeelding; doet u stap 1–3 slordig, dan mist u ofwel gegevens ofwel lakt u te veel zwart. Het onderliggende principe is hetzelfde als voor tekst-pdf's: een markering is geen zwartlakking tenzij de inhoud eronder weg is (zie juridische pdf's zwartlakken zonder de cloud).
Waarom op het apparaat nog meer telt bij scans
Gescande documenten zijn onevenredig vaak de gevoelige — ondertekende overeenkomsten, medische gegevens, kopieën van identiteitsbewijzen, handgeschreven notities. Die uploaden naar een cloud-OCR-en-zwartlakkingsdienst is de versie van het probleem met de hoogste inzet. OCR en zwartlakking op het apparaat betekent dat zelfs uw scans nooit uw machine verlaten.
Veelgestelde vragen
Waarom zei mijn zwartlakkingstool “geen persoonsgegevens gevonden” bij een gescande pdf?
Omdat hij naar tekst zocht en de scan er geen heeft. U hebt OCR-gebaseerde zwartlakking nodig die op de afbeelding zelf werkt.
Wordt een scan door zwartlakking niet-doorzoekbaar?
Alleen als de tool geen tekstlaag herbouwt. Een goede tool houdt het document doorzoekbaar terwijl de zwartgelakte entiteiten worden verwijderd.
Kan de verwijderde tekst nog worden hersteld uit een zwartgelakte scan?
Niet als de pixels werkelijk zijn overgeschilderd en geen verborgen tekstlaag ze behoudt — wat precies is wat een goede pijplijn op het apparaat waarborgt.
De kern van de zaak
Kan uw zwartlakkingstool geen OCR uitvoeren, dan kan hij een scan niet zwartlakken — hij kan u alleen ten onrechte vertellen dat er niets zwart te lakken viel. Gebruik een tool die persoonsgegevens als beeldgebieden opspoort, de pixels overschildert en het resultaat doorzoekbaar houdt, allemaal op uw eigen apparaat.
promptShield voert OCR, detectie en zwartlakking op gescande pdf's en afbeeldingen volledig op uw apparaat uit, schildert over de daadwerkelijke beeldgebieden en houdt het resultaat doorzoekbaar — geen upload, zelfs niet voor uw gevoeligste scans. Probeer het op uw eigen document.