Outils

Calculateur de similarité de phrases

Comparez des phrases selon leur sens avec un modèle d’embedding multilingue dans votre navigateur et affichez une matrice de similarité cosinus.

S’exécute dans le navigateurOutils de développement IA16,3 k
Gratuit

Entrée

0 B

Résultat

Le résultat apparaîtra ici.

Les embeddings sont ce qui permet aux systèmes RAG, à la déduplication et à la recherche sémantique de décider que deux textes veulent dire la même chose, et il est utile de voir les chiffres avant de bâtir dessus. Saisissez une phrase par ligne : chacune est vectorisée par un petit modèle sentence-transformers via huggingface/transformers.js, puis chaque paire est comparée par similarité cosinus. Le modèle multilingue par défaut rapproche les paraphrases chinoises, anglaises ou françaises, ce qui permet de vérifier si une question et sa traduction tombent vraiment l’une près de l’autre.

Comment ça marche

  • Les phrases sont vectorisées avec un mean pooling et une normalisation L2, comme ces modèles sentence-transformers ont été entraînés à être utilisés.
  • La sortie liste les phrases, une matrice de similarité complète et les dix paires les plus proches, de la plus élevée à la plus faible.
  • Le modèle multilingue pèse environ 118 Mo et all-MiniLM-L6-v2, limité à l’anglais, environ 23 Mo ; les deux se téléchargent depuis Hugging Face à la première exécution, sans barre de progression pendant ce temps.

Où vont vos données

Nulle part. Cet outil s’exécute entièrement dans votre navigateur : le texte collé est traité par la page, jamais transmis à un serveur ni consigné dans un journal.

Cet outil est gratuit et ne demande aucun compte. Ses résultats n’existent que dans la page ouverte et ne sont enregistrés nulle part.

Ce que ça coûte

Cet outil est gratuit, sans connexion ni points.

Questions fréquentes

À partir de quel score deux phrases sont-elles similaires ?
Il n’existe pas de seuil universel. Avec ces modèles, les paraphrases obtiennent généralement un score nettement supérieur à celui des phrases sans rapport, et les questions liées au même sujet mais différentes se situent entre les deux. Calibrez sur vos propres données : mettez dans la zone quelques paires que vous savez être des doublons et quelques-unes qui n’en sont pas, et observez où passe la limite.
Pourquoi la première exécution semble-t-elle bloquée ?
Les outils texte de ce site ne peuvent pas afficher la progression du téléchargement, et la première exécution doit récupérer le modèle sur huggingface.co avant de pouvoir comparer quoi que ce soit. Le modèle multilingue prend un moment sur une connexion lente et peut ne pas se charger là où Hugging Face est bloqué. Les exécutions suivantes utilisent le modèle en cache et répondent en une ou deux secondes.
S’agit-il des mêmes embeddings que ceux de l’API d’OpenAI ou de Qwen ?
Non. Chaque modèle d’embedding possède son propre espace vectoriel, et les scores de l’un ne sont pas comparables à ceux d’un autre. Cet outil sert à explorer le comportement de la similarité sémantique et à faire de petites vérifications ; pour la recherche en production, mesurez avec le modèle d’embedding que votre système utilisera réellement.

L’open source derrière

Cet outil fonctionne grâce à huggingface/transformers.js, publié sous licence Apache-2.0. Si vous avez besoin du même comportement dans votre propre programme, c’est cette bibliothèque qu’il faut utiliser.

huggingface/transformers.js

Aussi appelé

  • similarité de phrases
  • similarité sémantique en ligne
  • calcul similarité cosinus
  • embedding texte en ligne
  • comparer deux phrases