Outils

OCR : image en texte

Extrayez le texte de captures d’écran, de scans et de photos en chinois, anglais, japonais, coréen, allemand ou français, sans rien téléverser.

S’exécute dans le navigateurOutils de développement IA38,7 k
Gratuit
Déposez vos fichiers ici

Ou choisissez-les. Les fichiers sont traités dans cet onglet et jamais téléversés sur un serveur.

Copier le texte d’une capture d’écran, d’un contrat scanné ou de la photo d’une diapositive ne devrait pas obliger à envoyer l’image sur le serveur de quelqu’un d’autre. Cet outil exécute Tesseract dans l’onglet grâce à naptha/tesseract.js, le portage WebAssembly du moteur : choisissez la langue, déposez une ou plusieurs images, et récupérez le texte avec le score de confiance du moteur. Le chinois simplifié plus l’anglais est proposé par défaut, les captures chinoises contenant très souvent des termes anglais ; pour un document en français, sélectionnez simplement le français.

Comment ça marche

  • La première exécution télécharge le worker tesseract.js, le cœur WASM et le modèle de langue depuis le CDN jsDelivr ; le navigateur les met en cache, et l’image elle-même ne quitte jamais l’onglet.
  • Plusieurs images sont reconnues l’une après l’autre avec un seul worker, et chaque résultat est étiqueté avec le nom de son fichier.
  • Tesseract insère des espaces entre les caractères chinois et japonais ; ils sont retirés là où les deux voisins sont CJK, si bien qu’un texte mixte comme GPU 显存 garde son espace.

Où vont vos données

Nulle part. Cet outil s’exécute entièrement dans votre navigateur : le texte collé est traité par la page, jamais transmis à un serveur ni consigné dans un journal.

Cet outil est gratuit et ne demande aucun compte. Ses résultats n’existent que dans la page ouverte et ne sont enregistrés nulle part.

Ce que ça coûte

Cet outil est gratuit, sans connexion ni points.

Questions fréquentes

Comment obtenir de meilleurs résultats ?
Tesseract fonctionne au mieux sur du texte net, imprimé et horizontal, avec des caractères d’au moins 20 pixels de haut environ. Recadrez sur le texte, utilisez une capture d’écran plutôt qu’une photo d’écran, et choisissez la langue exacte — du chinois traditionnel reconnu comme simplifié produit des substitutions. L’écriture manuscrite et les polices très stylisées dépassent ce que ce moteur sait bien faire.
Que signifie le chiffre de confiance ?
C’est la confiance moyenne par mot que Tesseract attribue à la page, de 0 à 100. Au-dessus d’environ 90, le texte est généralement juste ; entre 60 et 79, attendez-vous à des caractères erronés, surtout parmi les caractères chinois qui se ressemblent. Il mesure la certitude du moteur, pas l’exactitude : relisez toujours ce qui compte.
Pourquoi la première exécution est-elle lente ?
Le moteur et les données de langue sont téléchargés à la première utilisation, plusieurs mégaoctets pour le chinois, puis mis en cache. Si jsDelivr est lent ou bloqué sur votre réseau, le téléchargement se bloque et l’outil ne peut pas fonctionner ; après une exécution réussie, il fonctionne de nouveau depuis le cache.

L’open source derrière

Cet outil fonctionne grâce à naptha/tesseract.js, publié sous licence Apache-2.0. Si vous avez besoin du même comportement dans votre propre programme, c’est cette bibliothèque qu’il faut utiliser.

naptha/tesseract.js

Aussi appelé

  • ocr en ligne gratuit
  • image en texte
  • extraire texte d’une image
  • capture d’écran en texte
  • ocr français en ligne
  • tesseract en ligne