实用工具

文本语义相似度计算

在浏览器里用多语言向量模型比较句子的意思,给出余弦相似度矩阵。

浏览器本地运行AI 开发工具1.6万
免费

输入

0 B

结果

结果会显示在这里。

RAG 检索、去重和语义搜索判断两段文字是否同义,靠的都是向量(embedding),在拿它搭系统之前先亲眼看看这些数字很有帮助。每行输入一句话,工具通过 huggingface/transformers.js 用一个小型 sentence-transformers 模型把每句转成向量,再两两计算余弦相似度。默认的多语言模型会把中英文的同义句放得很近,你可以直接验证一个问题和它的英文翻译是否真的落在一起。

它是怎么工作的

  • 句子向量用平均池化加 L2 归一化得到,这正是这些 sentence-transformers 模型训练时设定的用法。
  • 输出包括句子编号列表、完整的相似度矩阵,以及按分数从高到低排列的前十对最相似句子。
  • 多语言模型约 118 MB,只支持英文的 all-MiniLM-L6-v2 约 23 MB,首次运行都要从 Hugging Face 下载,下载期间没有进度条。

你的数据去了哪里

哪也没去。本工具完全在你的浏览器里运行:你粘贴的文本由页面处理,不会传输到任何服务器,也不会写进任何日志。

本工具免费且无需登录,运行结果只存在于你当前的页面里,不会被保存到任何地方。

它要花多少

本工具完全免费,不需要登录,也不消耗积分。

常见问题

多少分算相似?
没有通用阈值。用这些模型时,同义改写的分数通常明显高于无关句子,话题相关但意思不同的问题落在中间。请用你自己的数据校准:放几对确定重复的和几对确定不重复的句子进去,看看分界线落在哪里。
第一次运行为什么像卡住了?
本站的文本类工具无法显示下载进度,而第一次运行必须先从 huggingface.co 下载模型才能开始计算。网速慢时多语言模型要等一阵,Hugging Face 被拦截的网络里可能根本加载不了。之后的运行直接用缓存,一两秒就能出结果。
这和 OpenAI 或通义千问的 embedding 接口结果一样吗?
不一样。每个向量模型都有自己的向量空间,不同模型之间的分数没有可比性。这个工具适合用来理解语义相似度的表现和做小规模检查;生产环境的检索效果,要用你系统里实际使用的那个向量模型来衡量。

背后的开源项目

本工具运行在 huggingface/transformers.js 之上,以 Apache-2.0 许可发布。如果你需要在自己的程序里实现同样的能力,直接用这个库。

huggingface/transformers.js

也常被称作

  • 文本相似度
  • 句子相似度计算
  • 余弦相似度在线计算
  • 语义相似度
  • embedding在线测试