Produit
Convertissez un PDF en document Word modifiable
Importez un PDF et téléchargez un vrai fichier .docx modifiable. Les PDF texte sont lus directement, les pages scannées passent par l'OCR. L'ordre des pages, le texte arabe et les paragraphes de droite à gauche sont préservés.
Comment ça marche
Deux sortes de PDF, un seul convertisseur
Un PDF exporté depuis un logiciel contient du vrai texte : les caractères sont dans le fichier et se lisent directement, ce qui est à la fois rapide et exact. Un PDF scanné ne contient aucun texte — chaque page est une image de papier et les mots doivent être reconnus à partir des pixels.
Ce convertisseur examine chaque page et choisit lui-même la bonne voie. Un document mixte, par exemple un contrat imprimé avec une page de signature scannée, est traité page par page.
Ce qui se retrouve dans le fichier Word
Les paragraphes sont reconstruits à partir des lignes de la page : une phrase répartie sur trois lignes devient un seul paragraphe modifiable. Les titres sont détectés d'après la taille des caractères, les listes à puces et numérotées conservent leur mise en forme, et les lignes partageant les mêmes colonnes deviennent un vrai tableau Word.
L'ordre des pages est préservé et chaque page source commence une nouvelle page dans le document.
Texte arabe et sens droite-à-gauche
Les paragraphes arabes sont marqués bidirectionnels et alignés à droite, ce qui les rend lisibles dans Word au lieu d'apparaître inversés lorsqu'une ligne mélange arabe et caractères latins.
Le sens est déterminé paragraphe par paragraphe d'après les caractères réellement présents.
Formats pris en charge
- PDF avec couche de texte — exporté depuis Word, un logiciel comptable ou un navigateur
- PDF scanné — pages qui sont des images de papier, lues par reconnaissance de texte
- Documents multipages, convertis dans l'ordre des pages
- Écritures latine, arabe et autres jeux Unicode
Ce qui peut ne pas être repris
- Les mises en page complexes — colonnes multiples, encadrés, texte habillant une image — sont converties en un seul ordre de lecture, pas reproduites visuellement.
- L'écriture manuscrite n'est pas reconnue de façon fiable et ne donne souvent rien d'exploitable.
- Éléments décoratifs, logos, images de fond, en-têtes et pieds de page, polices, couleurs et espacements exacts ne sont pas repris.
- La détection des tableaux repose sur l'alignement des colonnes. Un tableau sans colonnes régulières, ou avec cellules fusionnées, peut ressortir en paragraphes ordinaires.
- La précision de la reconnaissance dépend de la qualité du scan. Nous ne l'avons pas mesurée sur vos documents et ne publions aucun chiffre de précision.