Utilisez une image claire et bien éclairée pour une extraction de texte plus précise.
Une image à la fois. Le texte imprimé donne les meilleurs résultats. Les mises en page complexes, les tableaux et l’écriture manuscrite peuvent ne pas conserver leur structure d’origine.

Extraire le texte d'une image

Convertissez des images JPG, PNG et WebP en texte modifiable en quelques secondes.

Comment extraire du texte d’une image

  1. 01Choisissez une image JPG, PNG ou WebP depuis votre appareil.
  2. 02Sélectionnez la langue utilisée dans l’image et faites pivoter l’aperçu si nécessaire.
  3. 03Extrayez le texte, examinez-le, puis copiez-le ou téléchargez un fichier TXT.

Ce que cet outil OCR prend en charge

L’outil reconnaît le texte imprimé en anglais, vietnamien, allemand, néerlandais, chinois simplifié, japonais, coréen et arabe. Les scans et captures d’écran clairs donnent généralement de meilleurs résultats que des photos floues ou déformées.

Limites de l’OCR

L’ordre de lecture peut être imparfait dans les pages multi-colonnes, les tableaux, l’écriture manuscrite et les textes fortement incurvés.

Questions sur l’OCR d’image

Quelle qualité d’image donne de meilleurs résultats d’OCR ?

Le texte imprimé clair et à fort contraste donne les meilleurs résultats. Utilisez une source nette avec suffisamment de pixels pour les petits caractères, un éclairage uniforme, une compression limitée et une page photographiée aussi plate et droite que possible. Recadrez les arrière-plans sans rapport et faites pivoter le texte pour le redresser avant l’extraction. Une très basse résolution, un flou de mouvement, des reflets, des ombres, un papier texturé, des pages incurvées, des polices décoratives et une amélioration d’image agressive peuvent fusionner ou casser les formes des caractères. Agrandir une source réellement basse résolution peut aider la visibilité, mais ne peut pas recréer un détail qui n’a jamais été capturé.

Pourquoi le choix de la langue OCR est-il important ?

Le choix de la langue détermine le modèle de reconnaissance et les modèles de caractères attendus. Sélectionner l’anglais pour un texte en chinois, en japonais, en coréen, en arabe, en vietnamien ou en allemand peut produire des substitutions plausibles mais incorrectes, car l’alphabet, les accents, la direction et les modèles de mots attendus diffèrent. Choisissez la langue dominante visible dans l’image. Lorsqu’une image mélange plusieurs langues, extrayez la section la plus importante séparément avec sa langue correspondante et comparez attentivement les noms, les nombres, les dates et les termes techniques, car ils reçoivent moins d’aide des modèles linguistiques ordinaires.

Qu’est-ce qui peut affecter l’ordre de lecture détecté ?

L’OCR identifie les régions de texte, puis les ordonne en fonction de leurs positions. Les articles multi-colonnes, les tableaux, les encadrés, les formulaires, les légendes, les textes verticaux, les étiquettes incurvées, les tampons superposés et les notes manuscrites peuvent rendre la séquence prévue ambiguë. Recadrez les régions indépendantes et extrayez-les séparément lorsque l’ordre est important. Après l’extraction, comparez le résultat avec la source de haut en bas, rétablissez les sauts de paragraphe et vérifiez les titres, les lignes de tableau, les étiquettes, les notes de bas de page et le texte situé à côté d’images, plutôt que de supposer qu’une mise en page complète de document a été reconstruite.

L’OCR peut-elle préserver les tableaux et la mise en forme du document ?

Non. Cet outil renvoie un texte éditable et des régions détectées, pas une reconstitution de la mise en page d’origine sous forme de document Word, de tableur ou de PDF consultable. Les colonnes peuvent être lues dans un ordre inattendu, les cellules de tableau peuvent perdre les relations lignes-colonnes, et la police, la couleur, l’espacement, les bordures, les images et les éléments de page ne sont pas conservés en tant que mise en page correspondante. Utilisez le résultat pour éviter de ressaisir, puis reconstruisez la structure nécessaire dans l’application de destination et comparez les valeurs importantes avec la source avant de vous y fier.

Pourquoi le temps de traitement OCR peut-il varier ?

Le temps dépend des dimensions de l’image, du nombre et de la taille des régions de texte, de la complexité de la mise en page, de la langue sélectionnée, de la rotation et des ressources nécessaires pour préparer la reconnaissance. Une grande photo avec un petit document au centre peut nécessiter plus de travail tout en produisant un texte de moins bonne qualité qu’un scan soigneusement recadré. Utilisez la plus petite image claire qui conserve les caractères nécessaires, recadrez les zones sans intérêt et évitez d’agrandir à plusieurs reprises des sources déjà nettes. Laissez la page ouverte jusqu’à ce qu’un résultat ou une erreur utile apparaisse.

Comment vérifier le texte OCR extrait ?

Comparez les noms, les dates, les adresses, les totaux, les séparateurs décimaux, les numéros de compte, les identifiants, la ponctuation et tout caractère où une seule erreur change le sens. Les confusions courantes incluent zéro et O, un et le l minuscule, des ponctuations similaires, des lettres accentuées et des caractères visuellement proches dans les écritures CJK ou arabes. Vérifiez l’ordre des lignes et le texte manquant autour des images ou des tableaux. Pour les documents juridiques, financiers, médicaux, académiques ou d’archives, effectuez une deuxième vérification par rapport à l’image d’origine avant de copier le résultat dans un autre enregistrement.