实用工具
输入
结果
结果会显示在这里。OpenAI 微调任务如果没通过校验,或者在悄悄出错的样本上训练,浪费的是时间和钱。这个工具把 OpenAI 官方数据准备 notebook(openai/openai-cookbook,MIT)里的检查逐一应用到你的 JSONL 文件上——每行一个对话样本——并补上了 notebook 出现之后格式新增的部分:工具调用、图片内容片段和按消息设置的 weight。你会得到每个错误及其行号、notebook 同款的 Token 统计、API 默认会选择的训练轮数,以及训练将计费的 Token 数。
它是怎么工作的
- 每行必须是一个带 messages 数组的 JSON 对象;角色只能是 system、user、assistant、tool 或 function,每个样本至少要有一条 assistant 消息可供学习。
- 它会检查上传校验会拒绝的问题:未知字段、空内容、weight 不是 0 或 1 或者出现在非 assistant 消息上、工具调用缺少 id、name 或 JSON 格式的参数,以及 tool_call_id 对应不上任何前面调用的工具回复。
- 它还能认出整体格式就不对的文件——旧版 prompt/completion 格式和偏好(DPO)数据——并直接说明,而不是报出几百条错误。
- Token 按 notebook 的公式基于 o200k_base 计算;超过 Token 上限的样本会被标出,因为训练时会被截断;计费 Token 数是截断后的总数乘以默认轮数。
你的数据去了哪里
哪也没去。本工具完全在你的浏览器里运行:你粘贴的文本由页面处理,不会传输到任何服务器,也不会写进任何日志。
本工具免费且无需登录,运行结果只存在于你当前的页面里,不会被保存到任何地方。
它要花多少
本工具完全免费,不需要登录,也不消耗积分。
常见问题
- 需要多少条样本?
- 少于 10 条 API 会直接拒绝。OpenAI 建议先用 50–100 条精心挑选的样本,只有效果确实提升时再加量。默认训练轮数会随文件大小调整:大多数文件是 3 轮,很小的文件更多(最多 25 轮),很大的文件更少,本工具用的就是这条规则。
- “单条 Token 上限”这个设置有什么用?
- 它是基础模型能训练的最长样本;OpenAI 为 gpt-4o 和 gpt-4o-mini 公布的是 65,536 个 Token,这里默认也用这个值。更长的样本在训练时会被截断到上限,结尾部分——往往正是 assistant 的回答——就丢了。请按你所选模型公布的上限设置。
- 我的 Token 数会和 OpenAI 算的完全一样吗?
- 很接近,但不一定完全一样:notebook 公式里每条消息的额外开销是个近似值,工具定义则按其 JSON 文本计数。用它来找出超长样本、估算费用就好;最终以任务自己报告的 trained tokens 为准。
- 能检查 DPO 或强化微调的数据吗?
- 不能,它校验的是监督式对话格式。带 preferred_output 和 non_preferred_output 的偏好数据会被识别出来并如实报告,让你知道为什么每一行都不通过,但不会检查它自身的结构。
背后的开源项目
本工具是独立实现,并未打包第三方库。openai/openai-cookbook(MIT)在代码层面做的是同一件事——如果你需要在自己的程序里实现它,从那里开始,而不是调用一个网页。
openai/openai-cookbook也常被称作
- 微调数据格式校验
- jsonl 校验
- openai 微调 数据格式
- fine-tuning jsonl
- 微调 token 计算
- 训练数据检查