Satzähnlichkeit prüfen
Vergleicht Sätze nach ihrer Bedeutung mit einem mehrsprachigen Embedding-Modell im Browser und zeigt eine Kosinus-Ähnlichkeitsmatrix.
Eingabe
Ergebnis
Das Ergebnis erscheint hier.Mit Embeddings entscheiden RAG-Systeme, Deduplizierung und semantische Suche, dass zwei Texte dasselbe bedeuten – und es hilft, die Zahlen zu sehen, bevor man darauf aufbaut. Geben Sie Sätze ein, einen pro Zeile; jeder wird von einem kleinen sentence-transformers-Modell über huggingface/transformers.js eingebettet, dann wird jedes Paar per Kosinus-Ähnlichkeit verglichen. Das mehrsprachige Standardmodell legt chinesische und englische Umschreibungen nah beieinander, sodass Sie prüfen können, ob eine Frage und ihre Übersetzung tatsächlich nebeneinander landen.
So arbeitet es
- Die Sätze werden mit Mean Pooling und L2-Normalisierung eingebettet – so, wie diese sentence-transformers-Modelle für den Einsatz trainiert wurden.
- Die Ausgabe listet die Sätze, eine vollständige Ähnlichkeitsmatrix und die zehn ähnlichsten Paare, das ähnlichste zuerst.
- Das mehrsprachige Modell ist etwa 118 MB groß, das rein englische all-MiniLM-L6-v2 etwa 23 MB; beide werden beim ersten Durchlauf von Hugging Face geladen, und währenddessen gibt es keinen Fortschrittsbalken.
Wohin Ihre Daten gehen
Nirgendwohin. Dieses Werkzeug läuft vollständig in Ihrem Browser: Der eingefügte Text wird von der Seite verarbeitet und weder an einen Server übertragen noch protokolliert.
Dieses Tool ist kostenlos und braucht kein Konto. Die Ergebnisse existieren nur in Ihrer geöffneten Seite und werden nirgends gespeichert.
Was es kostet
Dieses Werkzeug ist kostenlos, ohne Anmeldung und ohne Punkte.
Häufige Fragen
- Was gilt als ähnlich?
- Es gibt keinen universellen Schwellenwert. Mit diesen Modellen erzielen Umschreibungen meist deutlich höhere Werte als unzusammenhängende Sätze, und thematisch verwandte, aber verschiedene Fragen liegen dazwischen. Kalibrieren Sie mit Ihren eigenen Daten: Tragen Sie einige Paare ein, von denen Sie wissen, dass es Duplikate sind, und einige, die es nicht sind, und sehen Sie, wo die Grenze verläuft.
- Warum scheint der erste Durchlauf festzuhängen?
- Texttools auf dieser Website können keinen Download-Fortschritt anzeigen, und beim ersten Durchlauf muss das Modell erst von huggingface.co geladen werden, bevor irgendetwas verglichen werden kann. Das mehrsprachige Modell braucht bei langsamer Verbindung eine Weile und lädt womöglich gar nicht, wo Hugging Face gesperrt ist. Spätere Durchläufe nutzen das zwischengespeicherte Modell und liefern in ein bis zwei Sekunden.
- Sind das dieselben Embeddings wie bei der API von OpenAI oder Qwen?
- Nein. Jedes Embedding-Modell hat seinen eigenen Vektorraum, und Werte des einen sind mit denen eines anderen nicht vergleichbar. Dieses Tool dient dazu, das Verhalten semantischer Ähnlichkeit zu erkunden und kleine Prüfungen zu machen; für Retrieval in Produktion messen Sie mit dem Embedding-Modell, das Ihr System tatsächlich verwenden wird.
Das Open Source dahinter
Dieses Werkzeug läuft auf huggingface/transformers.js, veröffentlicht unter Apache-2.0. Wer dasselbe Verhalten im eigenen Programm braucht, greift zu dieser Bibliothek.
huggingface/transformers.jsAuch bekannt als
- satzähnlichkeit
- semantische ähnlichkeit online
- kosinus ähnlichkeit berechnen
- text embedding online
- zwei sätze vergleichen
- cosine similarity rechner