FileCarpenter
Pourquoi certains textes PDF sont modifiables et d’autres non
Un PDF est un format de description de page, pas un document Word. Deux pages visuellement identiques peuvent stocker leur texte de façons très différentes ; une modification fiable commence donc par l’analyse des objets de page.
Un PDF ne contient pas naturellement de « paragraphes »
Une page PDF décrit généralement l’endroit où chaque glyphe est peint. Certains logiciels conservent assez d’informations sur la police, les caractères et l’espacement ; d’autres découpent les mots en nombreux petits opérateurs ou réutilisent des codes de glyphes de manière inhabituelle.
Quand le remplacement structurel du texte est possible
Un texte sélectionnable avec un mappage de police exploitable peut souvent être modifié structurellement. FileCarpenter examine la séquence de texte, la police, l’espacement et les objets voisins. Si la structure est trop ambiguë, il vaut mieux refuser la modification ou utiliser un mode de compatibilité que détériorer silencieusement la page.
Les scans et les lettres converties en contours sont différents
Une page numérisée peut ne contenir que des pixels ; une couche OCR invisible peut rendre le texte sélectionnable sans correspondre exactement à l’image visible. Certains PDF graphiques transforment aussi les lettres en tracés vectoriels, qui sont des formes et non du texte ordinaire.
Que vérifier après une modification
Comparez les sauts de ligne, les polices, l’espacement, le rognage, les balises et les graphiques proches. Pour un document important, gardez l’original et rouvrez le PDF exporté dans le lecteur ou le système où il sera réellement utilisé.