实用工具

微调数据 JSONL 校验工具

上传前逐行检查 OpenAI 对话微调数据文件,并给出 Token 统计和训练将计费的 Token 数。

浏览器本地运行AI 开发工具7.6万
免费

输入

0 B

结果

结果会显示在这里。

OpenAI 微调任务如果没通过校验,或者在悄悄出错的样本上训练,浪费的是时间和钱。这个工具把 OpenAI 官方数据准备 notebook(openai/openai-cookbook,MIT)里的检查逐一应用到你的 JSONL 文件上——每行一个对话样本——并补上了 notebook 出现之后格式新增的部分:工具调用、图片内容片段和按消息设置的 weight。你会得到每个错误及其行号、notebook 同款的 Token 统计、API 默认会选择的训练轮数,以及训练将计费的 Token 数。

它是怎么工作的

  • 每行必须是一个带 messages 数组的 JSON 对象;角色只能是 system、user、assistant、tool 或 function,每个样本至少要有一条 assistant 消息可供学习。
  • 它会检查上传校验会拒绝的问题:未知字段、空内容、weight 不是 0 或 1 或者出现在非 assistant 消息上、工具调用缺少 id、name 或 JSON 格式的参数,以及 tool_call_id 对应不上任何前面调用的工具回复。
  • 它还能认出整体格式就不对的文件——旧版 prompt/completion 格式和偏好(DPO)数据——并直接说明,而不是报出几百条错误。
  • Token 按 notebook 的公式基于 o200k_base 计算;超过 Token 上限的样本会被标出,因为训练时会被截断;计费 Token 数是截断后的总数乘以默认轮数。

你的数据去了哪里

哪也没去。本工具完全在你的浏览器里运行:你粘贴的文本由页面处理,不会传输到任何服务器,也不会写进任何日志。

本工具免费且无需登录,运行结果只存在于你当前的页面里,不会被保存到任何地方。

它要花多少

本工具完全免费,不需要登录,也不消耗积分。

常见问题

需要多少条样本?
少于 10 条 API 会直接拒绝。OpenAI 建议先用 50–100 条精心挑选的样本,只有效果确实提升时再加量。默认训练轮数会随文件大小调整:大多数文件是 3 轮,很小的文件更多(最多 25 轮),很大的文件更少,本工具用的就是这条规则。
“单条 Token 上限”这个设置有什么用?
它是基础模型能训练的最长样本;OpenAI 为 gpt-4o 和 gpt-4o-mini 公布的是 65,536 个 Token,这里默认也用这个值。更长的样本在训练时会被截断到上限,结尾部分——往往正是 assistant 的回答——就丢了。请按你所选模型公布的上限设置。
我的 Token 数会和 OpenAI 算的完全一样吗?
很接近,但不一定完全一样:notebook 公式里每条消息的额外开销是个近似值,工具定义则按其 JSON 文本计数。用它来找出超长样本、估算费用就好;最终以任务自己报告的 trained tokens 为准。
能检查 DPO 或强化微调的数据吗?
不能,它校验的是监督式对话格式。带 preferred_output 和 non_preferred_output 的偏好数据会被识别出来并如实报告,让你知道为什么每一行都不通过,但不会检查它自身的结构。

背后的开源项目

本工具是独立实现,并未打包第三方库。openai/openai-cookbook(MIT)在代码层面做的是同一件事——如果你需要在自己的程序里实现它,从那里开始,而不是调用一个网页。

openai/openai-cookbook

也常被称作

  • 微调数据格式校验
  • jsonl 校验
  • openai 微调 数据格式
  • fine-tuning jsonl
  • 微调 token 计算
  • 训练数据检查