实用工具

AI 文本转 JSON 提取器

从邮件、发票、笔记里按你的 Schema 提取结构化 JSON,文中没有的字段一律填 null。

自带 Key 或官方托管AI 助手1.4万
去哪里获取 Key

Key 只在你的浏览器里。Key 由浏览器直接发送给服务商,不经过我们的服务器,我们不记录也不保存。建议使用专门创建、设了额度上限的 Key,用完及时到服务商后台删除。

输入

结果

结果会显示在这里。

邮件正文里的发票、简历、工单、会议纪要——需要的信息都在里面,只是程序读不了。把文本贴进来,在旁边的框里填一份 JSON Schema,或者干脆列出字段名,模型就只返回 JSON:你要的键、你声明的类型,文中没提到的一律是 null。最后这条最要紧:你让模型找一个文中根本没有的截止日期,它会很乐意给你编一个,除非明确告诉它“看得见的 null 比像模像样的猜测更好”。Schema 框留空时,模型会把文中找到的事实整理成一个扁平对象,拿来给一类新文档起草 Schema 很方便。

它是怎么工作的

  • Schema 框接受两种写法:JSON Schema——发送前先在本地解析并格式化,语法错误在这里就会报出来,不会把模型搞糊涂;或者每行一个字段,比如 “total: number”、“due_date: date”。
  • 数字去掉货币符号和千分位,日期统一成 ISO 8601,文本值按原文照抄、不做翻译;选“多条记录”时返回数组,每张发票、每位候选人、每个工单各占一个对象。
  • 567-labs/instructor 是开发者在自己代码里做同样事情的常用库,基于 Pydantic 模型校验并自动重试;本页只靠提示词来贯彻同样的纪律。
  • 这类文档常带个人信息,它和你的 Key 一起从页面直达服务商;单独开一个额度很低的 Key、用完删掉,万一泄露损失也有限。

你的数据去了哪里

使用自带 Key 时,你输入的内容和 Key 由浏览器直接发送给你选择的 AI 服务商,不经过 hysenlabs 的服务器。使用官方托管时,内容经我们的服务器转发给我们的服务商(DeepSeek),按 credits 计费;我们只记录每次运行的 Token 数和成本用于计费,从不保存你输入的内容和返回的结果。服务商如何处理这些内容,以它自己的隐私政策为准。

本工具会接触密钥和凭证,因此任何一次运行都不会被保存,连你自己的历史里也不会有。

关于你的 API Key

我们承诺不会收集、存储或泄露你的 Key:它只保存在当前页面的内存里(除非你勾选“在本标签页记住”),关闭页面即消失。但任何 Key 一旦在网页里用过,都值得多一分小心——建议专门为这里创建一个设了额度上限的 Key,用完后及时到服务商后台删除或轮换。

它要花多少

本工具完全免费,不需要登录,也不消耗积分。

常见问题

输出一定能通过我的 Schema 校验吗?
任何提示词都保证不了,干活的是模型。能力强的模型对 Schema 的遵循相当可靠,但在依赖结果之前还是要校验一遍,比如用 JSON Schema 校验器跑一下。在自己的代码里,instructor 或服务商原生的结构化输出模式能在此之上再加校验和重试。
为什么一个必填字段是 null?
因为文中根本没给出这个值,而工具被要求宁可填 null 也不编造。如果 Schema 把它标成必填的 string,输出就过不了严格校验——这恰恰是诚实的结果。要么在 Schema 里允许 null("type": ["string", "null"]),要么给模型含有这个值的文本。
结果外面包了一层 ```json 代码块,怎么回事?
有些模型即使被明确要求也会加上 Markdown 代码块,小模型尤其常见。删掉首尾两行,中间的 JSON 就能直接用。如果反复出现,换同一服务商更大的模型试试。
能直接读 PDF 或扫描件吗?
只能读文本。先把文字弄出来——从 PDF 里复制,或者把扫描件过一遍 OCR——再贴到这里。排版不需要保留,表格贴成参差不齐的几行,模型通常也能看懂。

背后的开源项目

本工具是独立实现,并未打包第三方库。567-labs/instructor(MIT)在代码层面做的是同一件事——如果你需要在自己的程序里实现它,从那里开始,而不是调用一个网页。

567-labs/instructor

也常被称作

  • 文本转json
  • ai信息提取
  • 结构化数据提取
  • json schema提取
  • 大模型结构化输出
  • 发票信息提取