ツール
入力
結果
結果はここに表示されます。埋め込み(エンベディング)は、RAG システム、重複排除、セマンティック検索が「2 つのテキストが同じ意味だ」と判断するための仕組みで、その上に何かを作る前に実際の数値を見ておくと役立ちます。文章を 1 行に 1 つずつ入力すると、huggingface/transformers.js を通じて小さな sentence-transformers モデルがそれぞれを埋め込み、すべてのペアをコサイン類似度で比較します。既定の多言語モデルは中国語と英語の言い換えを近くに配置するので、質問とその翻訳が本当に近い位置に来るかどうかを確かめられます。
動作のしくみ
- 文章は平均プーリングと L2 正規化で埋め込みます。これらの sentence-transformers モデルが想定している使い方です。
- 出力には、文章の一覧、類似度の行列全体、そして類似度の高い上位 10 ペアが高い順に並びます。
- 多言語モデルは約 118 MB、英語専用の all-MiniLM-L6-v2 は約 23 MB で、どちらも初回実行時に Hugging Face からダウンロードされます。その間、進捗バーは表示されません。
データの行き先
どこにも行きません。このツールは完全にブラウザ内で動作します。貼り付けたテキストはページが処理し、サーバーに送信されることも、ログに記録されることもありません。
このツールは無料で登録不要です。結果は開いているページの中にだけあり、どこにも保存されません。
必要なポイント
このツールは無料です。ログインもポイントも必要ありません。
よくある質問
- どのくらいの値なら「似ている」と言えますか?
- 普遍的なしきい値はありません。これらのモデルでは、言い換えは通常、無関係な文章よりかなり高いスコアになり、話題は近いけれど異なる質問はその中間に入ります。自分のデータで調整してください。重複だと分かっているペアと、そうでないと分かっているペアをいくつか入力し、境界がどこにあるかを確認するのがおすすめです。
- 初回の実行が止まっているように見えるのはなぜですか?
- このサイトのテキスト系ツールはダウンロードの進捗を表示できず、初回は比較を始める前に huggingface.co からモデルを取得する必要があるからです。多言語モデルは低速な回線では時間がかかり、Hugging Face がブロックされている環境では読み込めないこともあります。2 回目以降はキャッシュ済みのモデルを使い、1〜2 秒で結果が返ります。
- OpenAI や Qwen の API の埋め込みと同じものですか?
- いいえ。埋め込みモデルはそれぞれ独自のベクトル空間を持っており、あるモデルのスコアを別のモデルのスコアと比べることはできません。このツールはセマンティック類似度のふるまいを探ったり、ちょっとした確認をしたりするためのものです。本番の検索では、実際にシステムで使う埋め込みモデルで測定してください。
背後にあるオープンソース
このツールは huggingface/transformers.js(Apache-2.0)の上で動作しています。同じ処理を自分のプログラムに組み込みたい場合は、そのライブラリを使ってください。
huggingface/transformers.js別の呼び方
- 文章 類似度
- 意味的類似度 オンライン
- コサイン類似度 計算
- テキスト 埋め込み オンライン
- 2つの文章 比較
- embedding 類似度