實用工具

文字語意相似度計算

在瀏覽器裡用多語言向量模型比較句子的意思,並顯示餘弦相似度矩陣。

瀏覽器本機執行AI 開發工具1.6萬
免費

輸入

0 B

結果

結果會顯示在這裡。

RAG 檢索、去除重複和語意搜尋判斷兩段文字是否同義,靠的都是向量(embedding),在拿它建構系統之前,先親眼看看這些數字很有幫助。每行輸入一句話,工具透過 huggingface/transformers.js 用一個小型 sentence-transformers 模型把每句轉成向量,再兩兩計算餘弦相似度。預設的多語言模型會把中英文的同義句放得很近,你可以直接驗證一個問題和它的英文翻譯是否真的落在一起。

它是怎麼運作的

  • 句子向量以平均池化加上 L2 正規化取得,這正是這些 sentence-transformers 模型訓練時設定的使用方式。
  • 輸出包括句子編號清單、完整的相似度矩陣,以及依分數由高到低排列的前十組最相似句子。
  • 多語言模型約 118 MB,只支援英文的 all-MiniLM-L6-v2 約 23 MB,第一次執行都要從 Hugging Face 下載,下載期間沒有進度列。

你的資料去了哪裡

哪也沒去。本工具完全在你的瀏覽器裡執行:你貼上的文字由頁面處理,不會傳輸到任何伺服器,也不會寫進任何紀錄。

本工具免費且免登入,執行結果只存在於你目前的頁面裡,不會被儲存到任何地方。

它要花多少

本工具完全免費,不需要登入,也不消耗點數。

常見問題

幾分才算相似?
沒有通用的門檻值。使用這些模型時,換句話說的同義句分數通常明顯高於無關的句子,主題相關但意思不同的問題則落在中間。請用你自己的資料校準:放幾組確定重複和幾組確定不重複的句子進去,看看分界線落在哪裡。
第一次執行為什麼好像當住了?
本站的文字類工具無法顯示下載進度,而第一次執行必須先從 huggingface.co 下載模型才能開始計算。網速慢時多語言模型要等上一陣子,在 Hugging Face 被封鎖的網路裡可能根本載入不了。之後的執行直接使用快取,一兩秒就能得到結果。
這和 OpenAI 或通義千問的 embedding API 結果一樣嗎?
不一樣。每個向量模型都有自己的向量空間,不同模型之間的分數無法相互比較。這個工具適合用來理解語意相似度的表現和做小規模檢查;正式環境的檢索效果,要用你系統裡實際使用的那個向量模型來衡量。

背後的開源專案

本工具執行在 huggingface/transformers.js 之上,以 Apache-2.0 授權發布。如果你需要在自己的程式裡實作同樣的能力,直接用這個函式庫。

huggingface/transformers.js

也常被稱作

  • 文字相似度
  • 句子相似度計算
  • 餘弦相似度線上計算
  • 語意相似度
  • embedding 線上測試
  • 比較兩個句子