Mesuré le 2026-05-27 · promptShield 1.0.14 · Presidio 2.2.362
Microsoft Presidio face à promptShield
Comparés en duel sur 14 documents PDF dans 7 langues. Même extraction de texte, mêmes documents, aucun réglage asymétrique. Script et CSV bruts publiés — vérifiez par vous-même.
En bref
Presidio (installation par défaut)
666
détections émises · fort niveau de bruit
promptShield 1.0.14
252
détections émises · même corpus · bruit filtré
Sur les contrats (où les données sont de vraies données personnelles), promptShield remonte exactement les mêmes 209 détections à fort signal que Presidio. L'écart de 414 détections se concentre sur les états financiers, où les détections brutes sont composées de 30 à 70 % de bruit (noms de cabinets d'audit, sièges sociaux, mentions de pays à portée juridictionnelle).
Comparatif des fonctionnalités
| Fonctionnalité | promptShield | Presidio |
|---|---|---|
Reconnaisseur regex multilingue (60+ types) Presidio : EN en priorité par défaut | ◦ | |
Modèle d'entités multilingue (Davlan) Presidio : nécessite un reconnaisseur d'entités HuggingFace personnalisé | ◦ | |
Couche LLM optionnelle pour les données personnelles contextuelles | ||
Validation par somme de contrôle US NPI / ABA / DEA Presidio : NPI et MBI inclus, ABA/DEA partiels | ◦ | |
Validation par somme de contrôle AU TFN / ABN / ACN / Medicare | ||
Validation par somme de contrôle BR CPF / CNPJ | ||
Validation par somme de contrôle CH AHV | ||
Validation par somme de contrôle MX CLABE | ||
Validation par somme de contrôle NL BSN / RSIN | ||
Validation du NIR français (sécurité sociale) | ||
Filtre des formules juridictionnelles standard « régi par les lois de X » → X non signalé | ||
Fusion des détections PERSON au sein d'une page « Pierre Dubois » conservé, « Pierre » seul écarté | ||
Filtre des noms de services génériques (ORG) | ||
Filtre des intitulés de fonction (PERSON) | ||
Application desktop aboutie avec GUI de revue | ||
Tokenisation réversible (encode / decode) Presidio : couche d'anonymisation séparée | ◦ | |
100 % hors ligne (aucune dépendance cloud) | ||
Reconnaisseurs personnalisés via API | ||
Bibliothèque Python pour intégration sur mesure | ||
Intégration Azure AI Language |
✓ = inclus par défaut · ◦ = disponible via configuration personnalisée · ✗ = absent
Catégories de bruit que Presidio (installation par défaut) émet et que promptShield supprime
URL dans les pieds de page de contrats
Lien vers la politique de confidentialité, URL de la page de support, contact juridique générique. ~8 à 10 détections par contrat, dont quasiment aucune n'est une donnée personnelle que l'examinateur souhaite masquer.
UrlRecognizerMentions isolées de pays / villes en prose juridictionnelle
« régi par les lois de France », « siège social à Paris », « société constituée en Allemagne ». Dans un état financier français, Presidio émet 73 détections LOCATION ; presque toutes ne sont que du décor contractuel.
filter_jurisdiction_boilerplate + filter_standalone_countryFragments PERSON
Le même nom apparaît en trois détections distinctes : « Pierre », « Dubois », « Pierre Dubois ». Sur un contrat italien, Presidio émet 26 détections PERSON — les mêmes noms répétés et fragmentés en prénom, nom et nom complet.
filter_span_coalescenceNoms génériques de services tagués ORG
« Marketing », « Vorstand », « Direction Générale », « Board of Directors », « Comitato di Direzione ». Ce ne sont pas des organisations que l'examinateur souhaite masquer.
filter_generic_org (liste de 90 entrées × 7 langues)Intitulés de fonction tagués PERSON
« CEO », « Directeur », « Geschäftsführer » avec majuscule en début de ligne, parfois mal tagués comme PERSON par le modèle d'entités.
filter_role_titlesQuand choisir Presidio plutôt
Presidio est le bon choix quand :
- Vous bâtissez un pipeline DLP Python sur mesure et voulez un contrôle au niveau de la bibliothèque.
- Vous devez intégrer des services cloud (Azure AI Language, AWS Comprehend) sous une seule abstraction de données personnelles.
- Vous voulez affiner vos propres reconnaisseurs pour des types d'entités propriétaires.
- Vous traitez des flux de texte (et non des documents bornés) et cherchez une bibliothèque pensée comme un service.
Presidio (par Microsoft) et promptShield partagent tous deux l'esprit MIT. À chaque besoin son outil.
Quand choisir promptShield
- Vous anonymisez des documents PDF/DOCX/XLSX bornés sur le poste de travail.
- Vous voulez des sommes de contrôle propres à chaque pays clés en main (TFN, CPF, NPI, IBAN, etc.) sans avoir à les écrire vous-même.
- Vous voulez un workflow GUI abouti (revue, masquage, tokenisation, export) plutôt qu'une bibliothèque à intégrer.
- Vos clients ne peuvent pas envoyer leurs documents à un service cloud pour des raisons de conformité.
Reproduisez-le vous-même
Chaque chiffre de cette page provient du script publié dans le dépôt public. Aucun chiffre ne sort d'une exécution interne et invérifiable.
git clone https://github.com/promptshield-Inc/pii-detection-benchmarks
cd pii-detection-benchmarks
pip install -r requirements.txt
python benchmark.pySorties : results/presidio_counts_<date>.csv + results/presidio_entities_<date>.csv. Le script Presidio est totalement autonome — pas besoin d'installer promptShield pour vérifier le côté Presidio.
Questions fréquentes
Microsoft Presidio est-il gratuit ?
Oui. Microsoft publie Presidio sous licence MIT, sans redevance quel que soit le volume traité. Le coût est en temps d'ingénierie plutôt qu'en argent : Presidio fournit des briques de détection, pas un flux de travail fini. Une mise en production suppose donc de construire autour l'extraction des documents, une interface de relecture et le stockage qu'impose votre politique de conservation. Savoir si cela revient moins cher qu'une licence dépend de ce que vous avez déjà en place.
Faut-il être développeur pour utiliser Microsoft Presidio ?
En pratique, oui. Presidio est une bibliothèque Python que l'on pilote par le code ou via un service que vous hébergez vous-même ; le projet ne fournit ni application de bureau ni interface pour l'utilisateur final. C'est un choix de conception, pas un manque : l'outil est fait pour s'insérer dans une chaîne que quelqu'un d'autre assemble. Si ce sont des juristes, des analystes ou des responsables conformité qui manipulent les documents, il faut construire quelque chose devant Presidio avant que cela ne leur parvienne.
Microsoft Presidio est-il un outil DLP ?
Pas à lui seul. Presidio détecte et anonymise les données personnelles dans le contenu qu'on lui transmet, ce qui constitue une brique de la prévention des fuites de données, mais il n'embarque rien de l'appareillage qui l'entoure : ni moteur de politiques, ni application sur les postes ou le réseau, ni alertes, ni piste d'audit. Beaucoup d'équipes s'en servent comme couche de détection dans un dispositif DLP qu'elles bâtissent elles-mêmes. Acheté comme produit DLP fini, ce n'en est pas un.
Quels sont les principaux concurrents de Microsoft Presidio ?
Cela dépend de la partie que vous remplacez. Comme bibliothèque de détection, les comparaisons les plus proches sont les services cloud de traitement des données personnelles — Azure AI Language, Google Cloud DLP, AWS Comprehend — que Presidio sait d'ailleurs appeler plutôt que concurrencer. Comme moyen d'obtenir concrètement des documents masqués, l'ensemble de comparaison est celui des outils finis : promptShield, Adobe Acrobat ou les services de masquage en ligne, où l'arbitrage se joue entre le coût d'une licence et l'ingénierie que vous feriez autrement vous-même.
promptShield est-il open source comme Presidio ?
Non. Presidio est une bibliothèque open source sous licence MIT et promptShield est un produit commercial : c’est une vraie différence, qu’il vaut mieux dire clairement. Ce qui est public, c’est ce qui compte pour faire confiance à cette page : le banc d’essai, les documents de test et les fichiers de résultats bruts sont publiés, et la partie Presidio du script fonctionne seule, sans que promptShield soit installé. Vous n’avez pas à croire ces chiffres sur parole.
promptShield utilise-t-il Presidio en interne ?
Non. Le moteur de détection est le nôtre, et ce choix relève de l’architecture, pas d’un jugement sur la qualité de Presidio : promptShield traite des documents finis sur un appareil qui peut n’avoir aucun réseau, là où Presidio est pensé comme une bibliothèque pour des flux de texte dans une chaîne serveur. La couche qui décide de ce qu’un relecteur écarterait concentre l’essentiel du travail, et il fallait qu’elle soit la nôtre.
Peut-on utiliser les deux ensemble ?
Ils interviennent à des endroits différents et se combinent sans friction. Presidio convient bien à l’analyse à gros volume au sein de vos propres systèmes, où une bibliothèque s’intègre à une chaîne de traitement. promptShield convient à l’ensemble plus restreint de documents où une personne doit relire ce qui a été trouvé et répondre du résultat avant que le fichier ne parte. Couverture large et automatique dans la chaîne, traitement soigneux et vérifié par un humain pour les documents qui engagent.
Mises en garde honnêtes
- Installation par défaut uniquement. Une installation Presidio affinée (reconnaisseurs personnalisés + backend d'entités à transformer + seuils de confiance ajustés) comblerait l'essentiel de l'écart de précision. Nous mesurons ce que la plupart des utilisateurs de Presidio déploient le premier mois.
- Corpus synthétique. Les vrais documents clients comportent un bruit plus riche (erreurs OCR, originaux scannés, mises en page multicolonnes) que nous ne mesurons pas ici.
- Pas de vérité terrain étiquetée. Les chiffres « les deux / nous seuls / Presidio seul » sont un indicateur indirect de précision, pas une mesure F1 stricte. Étiqueter à la main 14 PDF sur 7 langues représente ~40 heures de travail ; nous ne l'avons pas encore fait.
- Deux classes de documents. Contrats + états financiers. Dossiers médicaux, formulaires RH et dossiers d'immigration feraient apparaître des écarts différents.
Ça vous a été utile ? Dites-le-nous.