實用工具
輸入
結果
結果會顯示在這裡。RAG 檢索、去除重複和語意搜尋判斷兩段文字是否同義,靠的都是向量(embedding),在拿它建構系統之前,先親眼看看這些數字很有幫助。每行輸入一句話,工具透過 huggingface/transformers.js 用一個小型 sentence-transformers 模型把每句轉成向量,再兩兩計算餘弦相似度。預設的多語言模型會把中英文的同義句放得很近,你可以直接驗證一個問題和它的英文翻譯是否真的落在一起。
它是怎麼運作的
- 句子向量以平均池化加上 L2 正規化取得,這正是這些 sentence-transformers 模型訓練時設定的使用方式。
- 輸出包括句子編號清單、完整的相似度矩陣,以及依分數由高到低排列的前十組最相似句子。
- 多語言模型約 118 MB,只支援英文的 all-MiniLM-L6-v2 約 23 MB,第一次執行都要從 Hugging Face 下載,下載期間沒有進度列。
你的資料去了哪裡
哪也沒去。本工具完全在你的瀏覽器裡執行:你貼上的文字由頁面處理,不會傳輸到任何伺服器,也不會寫進任何紀錄。
本工具免費且免登入,執行結果只存在於你目前的頁面裡,不會被儲存到任何地方。
它要花多少
本工具完全免費,不需要登入,也不消耗點數。
常見問題
- 幾分才算相似?
- 沒有通用的門檻值。使用這些模型時,換句話說的同義句分數通常明顯高於無關的句子,主題相關但意思不同的問題則落在中間。請用你自己的資料校準:放幾組確定重複和幾組確定不重複的句子進去,看看分界線落在哪裡。
- 第一次執行為什麼好像當住了?
- 本站的文字類工具無法顯示下載進度,而第一次執行必須先從 huggingface.co 下載模型才能開始計算。網速慢時多語言模型要等上一陣子,在 Hugging Face 被封鎖的網路裡可能根本載入不了。之後的執行直接使用快取,一兩秒就能得到結果。
- 這和 OpenAI 或通義千問的 embedding API 結果一樣嗎?
- 不一樣。每個向量模型都有自己的向量空間,不同模型之間的分數無法相互比較。這個工具適合用來理解語意相似度的表現和做小規模檢查;正式環境的檢索效果,要用你系統裡實際使用的那個向量模型來衡量。
背後的開源專案
本工具執行在 huggingface/transformers.js 之上,以 Apache-2.0 授權發布。如果你需要在自己的程式裡實作同樣的能力,直接用這個函式庫。
huggingface/transformers.js也常被稱作
- 文字相似度
- 句子相似度計算
- 餘弦相似度線上計算
- 語意相似度
- embedding 線上測試
- 比較兩個句子