Pourquoi mon PDF n'a-t-il presque pas maigri ?
J'ai passé mon PDF dans un compresseur et il est passé de 4,1 MB à 4,0 MB. L'outil est cassé ?
Un PDF est un classeur à tiroirs
Le modèle mental qui cause la déception consiste à voir un PDF comme l'image d'un document. Ce n'en est pas une. Un PDF, tel que le définit la norme ISO 32000, est un conteneur d'objets numérotés : arbres de pages, flux de contenu remplis d'opérateurs de dessin, programmes de polices incorporés, XObjects d'image, champs de formulaire, annotations, signets, et une table de références croisées qui indique où commence chaque objet.
La plupart de ces objets sont déjà compressés. Les flux de contenu sont généralement encodés en Flate, c'est-à-dire le même algorithme qu'un fichier ZIP. Les photographies incorporées sont généralement stockées sous forme de flux DCT, autrement dit des données JPEG reprises telles quelles. Ainsi, quand un compresseur généraliste regarde un PDF, il regarde une boîte remplie de choses qui ont chacune déjà été compressées une fois.
Cherchez où sont les octets avant de compresser quoi que ce soit
Le diagnostic le plus utile consiste à savoir quel type de document vous avez entre les mains, car il prédit le résultat presque à coup sûr.
| Type de document | Où sont les octets | Ce que peut faire un enregistrement structurel |
|---|---|---|
| Rapport texte issu d'un traitement de texte | Programmes de polices incorporés et petits flux de contenu | Très peu ; le contenu est déjà dense |
| Pages numérisées | Une grande image par page | Presque rien sans toucher aux images |
| Export de présentation | Photographies incorporées et dégradés | Un peu, si des images sont dupliquées d'une diapositive à l'autre |
| Plan technique | Longs flux de contenu vectoriel | Un peu, en réencodant les flux et en supprimant les objets inutilisés |
| Formulaire avec pièces jointes | Fichiers incorporés, JavaScript, dictionnaires d'annotations | Beaucoup, si ces éléments supplémentaires peuvent être retirés |
Ce qu'un enregistrement structurel retire vraiment
Un enregistrement structurel réécrit le document sans changer l'aspect d'aucune page. Il peut supprimer les objets que plus rien ne référence, qui s'accumulent chaque fois qu'un document est modifié et enregistré de façon incrémentale. Il peut compresser la table de références croisées et regrouper les petits objets dans des flux d'objets. Il peut retirer les métadonnées du document, les vignettes et l'historique d'édition que certains producteurs laissent derrière eux.
Sur un document modifié et réenregistré de nombreuses fois, le gain peut être important. Sur un document exporté proprement, une seule fois, depuis un traitement de texte, il n'y a rien à ramasser : le fichier est déjà proche de sa forme la plus compacte, et cent kilooctets gagnés sur quatre mégaoctets sont exactement le résultat à attendre.
Pourquoi un document texte résiste
Dans un PDF texte, une grande part du fichier tient généralement aux polices incorporées. Un programme de police est un binaire compact contenant les contours des glyphes et les instructions de hinting, et il est là pour que le document s'affiche à l'identique sur une machine où cette typographie n'est pas installée. Impossible de le compresser sans le sous-ensembler davantage ou le supprimer, et le supprimer change l'aspect de la page.
Le texte lui-même est minuscule. Cent pages de prose représentent quelques centaines de kilooctets de caractères avant compression. Si votre PDF texte est volumineux, regardez du côté des polices et des images qui se cachent derrière le texte — un logo répété en en-tête, un filigrane de fond — plutôt que du côté des mots.
Pourquoi un scan s'effondre
Une page numérisée est une grande photographie d'une feuille de papier, souvent capturée à 300 points par pouce ou plus. Une page A4 à 300 DPI fait environ 2480 × 3508 pixels, soit près de neuf millions de pixels, pour une page dont le contenu informatif tient en quelques kilooctets de texte. C'est pourquoi les scans réagissent si spectaculairement à la compression rastérisée : réduire la résolution de rendu et réencoder les images de page s'attaque à la partie du fichier qui est réellement volumineuse.
C'est aussi pourquoi ce mode est destructeur. Une fois qu'une page est devenue une image, la couche de texte recherchable, les liens, les champs de formulaire, les annotations, la structure d'accessibilité balisée et toute signature numérique ont disparu. FileSlimmer traite la rastérisation comme un mode distinct, clairement identifié et assorti de cet avertissement, plutôt que comme un repli silencieux quand l'enregistrement structurel déçoit.
Pourquoi personne ne peut vous promettre un chiffre
Une taille cible pour un PDF est une recherche menée sur la résolution de rendu et la qualité des images, et cette recherche a un plancher : en dessous d'une certaine résolution, le texte d'un scan cesse d'être lisible. Qu'un document donné atteigne un budget donné au-dessus de ce plancher dépend du nombre de pages, du taux d'encrage, de la quantité de contenu photographique et du bruit du scanner. Deux documents comptant le même nombre de pages peuvent finir à des tailles très différentes.
Le comportement honnête consiste à s'arrêter au plancher et à indiquer où la recherche s'est arrêtée, ce que font les préréglages de taille cible pour PDF de FileSlimmer. Un outil qui atteint toujours le chiffre que vous avez saisi ment sur le chiffre ou détruit le document pour y parvenir.
Avant d'accuser l'outil
- Vérifiez si le PDF est un scan. Essayez de sélectionner une ligne de texte : si le curseur ne sélectionne rien, toutes les pages sont des images.
- Comparez le nombre de pages à la taille. Un fichier de 40 MB en trois pages est chargé d'images ; un fichier de 40 MB en 900 pages peut être tout à fait raisonnable.
- Vérifiez si le document est chiffré. Un PDF protégé par mot de passe ne peut pas être restructuré du tout tant qu'il n'est pas déverrouillé.
- Vérifiez s'il est signé. Réécrire un document signé invalide la signature, ce qui est généralement plus grave qu'un fichier volumineux.
- Vérifiez ce dont vous avez réellement besoin. Extraire les six pages que vous devez envoyer vaut souvent mieux que compresser les quatre-vingt-dix.
Outils pour cette tâche
Sources
- ISO 32000-2 — Document management, Portable Document Format
- Adobe — PDF 32000-1:2008, the freely published PDF 1.7 specification
- PDF Association — ISO 32000 and the PDF standards family