Effacer une information sur un document scanné : pourquoi un rectangle blanc ne suffit pas
Avant d'envoyer la copie d'un document, on a souvent une information à retirer : un numéro de compte sur un relevé d'identité bancaire, une adresse, une signature, un numéro de sécurité sociale. Sur un document scanné, la tentation est de poser un rectangle blanc ou noir par-dessus avec un logiciel de PDF. À l'écran, l'information disparaît. Dans le fichier, elle est toujours là. Nous l'avons vérifié sur un courrier scanné, et comparé avec l'effacement réel que propose désormais l'éditeur PDF de FileXvert.
Un scan ne contient pas de texte, mais une image
Un PDF créé par un traitement de texte décrit ses lettres sous forme de caractères. Un PDF issu d'un scanner ou d'une application de numérisation contient tout autre chose : une photographie de la page, stockée en image. Les lettres que vous lisez sont des pixels sombres sur un fond clair.
Poser un rectangle sur cette page ajoute simplement un dessin par-dessus l'image. L'image, elle, n'est pas modifiée : elle reste intégrée au fichier, complète. N'importe quel outil d'extraction d'images, dont beaucoup sont gratuits, la ressort en quelques secondes, rectangle en moins.
Notre test
Nous avons créé un courrier bancaire fictif, numérisé comme le ferait un scanner de bureau : une page A4 à 200 points par pouce (1654 × 2339 pixels), avec un léger grain et un fond grisé. Il porte une ligne « IBAN » fictive. Nous l'avons enregistré sous les deux formes les plus courantes : une image JPEG, comme la plupart des applications de numérisation, et une image noir et blanc compressée en CCITT groupe 4, comme beaucoup de scanners réglés pour les documents.
Sur chaque version, nous avons masqué la ligne IBAN de deux façons : en dessinant un rectangle de la couleur du fond, et avec l'outil « Effacer une zone » de FileXvert. Puis nous avons extrait l'image contenue dans chaque fichier et compté les pixels sombres, ceux de l'encre, dans la bande de la ligne IBAN.
| Version | Poids du PDF | Pixels d'encre de l'IBAN dans le fichier |
|---|---|---|
| Scan JPEG, d'origine | 131,6 Ko | 9 973 |
| Scan JPEG + rectangle par-dessus | 132,2 Ko | 9 973 (inchangé) |
| Scan JPEG + « Effacer une zone » | 94,9 Ko | 0 |
| Scan CCITT noir et blanc, d'origine | 7,5 Ko | 10 395 |
| Scan CCITT + rectangle par-dessus | 8,1 Ko | 10 395 (inchangé) |
| Scan CCITT + « Effacer une zone » | 12,3 Ko | 0 |
Avec le rectangle, l'image du fichier contient exactement autant d'encre qu'avant : l'IBAN est intact, il est seulement recouvert. Avec l'effacement de FileXvert, il ne reste plus un seul pixel d'encre dans la zone.
Ce que fait « Effacer une zone »
Vous tracez à la main la zone à effacer sur la page. À la création du PDF, FileXvert repère les images dessinées sous cette zone, en tenant compte de leur position, de leur échelle et de leur rotation. Il repeint ensuite, dans l'image elle-même, les pixels concernés de la couleur dominante autour de la zone, c'est-à-dire le fond du papier. Le texte que la page contiendrait aussi sous forme de caractères est retiré de la même zone.
La nouvelle image remplace l'ancienne, et l'ancienne est supprimée du fichier : elle ne subsiste pas comme objet caché. Le reste de la page n'est pas touché. Sur la version noir et blanc, tous les pixels situés hors de la zone sont identiques à l'original. Sur la version JPEG, l'image est réencodée par le navigateur : l'écart maximal hors de la zone est de 5 niveaux sur 255, invisible à l'œil, et la quantité d'encre hors zone varie de moins de 0,1 %.
Le poids change un peu, dans un sens ou dans l'autre. Le JPEG réencodé par le navigateur est ici plus léger que celui du scanner, et la version noir et blanc, stockée avec une compression plus générale que le CCITT, passe de 7,5 à 12,3 Ko. Sur notre machine de test, l'opération a pris moins d'une seconde et demie pour la page JPEG, et moins d'un tiers de seconde pour la page noir et blanc.
Formats pris en charge et limites
L'effacement fonctionne avec les formats d'image que l'on trouve dans la grande majorité des PDF : JPEG, JPEG 2000, images noir et blanc CCITT et JBIG2, et images non compressées ou compressées sans perte. Le masque de transparence d'une image est traité lui aussi, ainsi que les images placées dans un sous-objet de la page.
Quelques cas restent seulement masqués, sans être effacés de l'image : les très petites images écrites directement dans le contenu de la page, et les formats inhabituels. Pour une information très sensible, l'outil « Masquer » offre une garantie absolue : il transforme toute la page en image, aplats compris, au prix d'un texte qui n'est plus sélectionnable.
Vérifier avant d'envoyer
Quelle que soit la méthode, quelques contrôles rapides s'imposent :
- Tracez la zone avec une petite marge autour du texte : un reste de jambage ou d'accent peut suffire à deviner un chiffre.
- Ouvrez le PDF produit et zoomez fortement sur la zone effacée : elle doit être uniforme.
- Si le scan comporte une couche de texte reconnu (OCR), faites une recherche (Ctrl + F) sur l'information effacée : elle ne doit plus être trouvée.
- Pensez aux métadonnées : l'éditeur peut les effacer en même temps, pour qu'aucun nom d'auteur ou de logiciel ne reste dans le fichier.
L'éditeur PDF, et donc l'outil « Effacer une zone », est réservé aux abonnés Premium. Comme toutes les fonctions de FileXvert, il travaille dans votre navigateur : le document n'est envoyé sur aucun serveur, ce qui compte précisément quand il contient des informations que l'on veut protéger.