Werkzeuge

Fine-Tuning-JSONL-Validator

Prüfen Sie eine Chat-Fine-Tuning-Datei für OpenAI Zeile für Zeile vor dem Hochladen und sehen Sie ihre Token-Zahlen und was das Training abrechnet.

Läuft im BrowserKI-Entwicklertools75.994
Kostenlos

Eingabe

0 B

Ergebnis

Das Ergebnis erscheint hier.

Ein Fine-Tuning-Job bei OpenAI, der an der Validierung scheitert oder unbemerkt auf fehlerhaften Beispielen trainiert, kostet Zeit und Geld. Dieses Tool führt die Prüfungen aus dem Datenaufbereitungs-Notebook von OpenAI (openai/openai-cookbook, MIT) auf Ihrer JSONL-Datei aus – ein Chat-Beispiel pro Zeile – und erweitert sie um die Teile des Formats, die jünger sind als das Notebook: Tool-Aufrufe, Bild-Inhaltsteile und Gewichte pro Nachricht. Sie erhalten jeden Fehler mit Zeilennummer, die Token-Statistik des Notebooks, die Zahl der Epochen, die die API standardmäßig wählt, und wie viele Tokens das Training abrechnet.

So arbeitet es

  • Jede Zeile muss ein JSON-Objekt mit einem messages-Array sein; Rollen müssen system, user, assistant, tool oder function lauten, und jedes Beispiel braucht mindestens eine assistant-Nachricht, aus der gelernt werden kann.
  • Geprüft wird, was die Upload-Validierung ablehnt: unbekannte Schlüssel, leerer Inhalt, weight ungleich 0 oder 1 oder auf einer Nicht-assistant-Nachricht, Tool-Aufrufe ohne id, name oder JSON-Argumente sowie Tool-Antworten, deren tool_call_id zu keinem früheren Aufruf passt.
  • Es erkennt außerdem Dateien im völlig falschen Format – das veraltete prompt/completion-Schema und Präferenzdaten (DPO) – und sagt das, statt Hunderte Fehler aufzulisten.
  • Tokens werden mit der Formel des Notebooks über o200k_base gezählt; Beispiele über dem Token-Limit werden markiert, weil das Training sie abschneidet, und abgerechnete Tokens sind die gekürzte Summe mal Standard-Epochen.

Wohin Ihre Daten gehen

Nirgendwohin. Dieses Werkzeug läuft vollständig in Ihrem Browser: Der eingefügte Text wird von der Seite verarbeitet und weder an einen Server übertragen noch protokolliert.

Dieses Tool ist kostenlos und braucht kein Konto. Die Ergebnisse existieren nur in Ihrer geöffneten Seite und werden nirgends gespeichert.

Was es kostet

Dieses Werkzeug ist kostenlos, ohne Anmeldung und ohne Punkte.

Häufige Fragen

Wie viele Beispiele brauche ich?
Die API lehnt weniger als 10 ab. OpenAI empfiehlt, mit 50 bis 100 sorgfältig ausgewählten Beispielen zu beginnen und nur dann mehr hinzuzufügen, wenn sich die Ergebnisse verbessern. Die Standardzahl der Epochen passt sich der Dateigröße an: 3 für die meisten Dateien, mehr für sehr kleine (bis 25) und weniger für sehr große – genau diese Regel wendet das Tool an.
Was bewirkt die Einstellung für das Token-Limit?
Sie ist das längste Beispiel, auf dem das Basismodell trainieren kann; OpenAI dokumentiert 65.536 Tokens für gpt-4o und gpt-4o-mini, und das ist hier der Standardwert. Längere Beispiele werden beim Training auf das Limit gekürzt, ihr Ende – oft die Antwort des Assistenten – geht also verloren. Stellen Sie das Limit ein, das Ihr gewähltes Modell dokumentiert.
Stimmt meine Token-Zahl genau mit der von OpenAI überein?
Annähernd, aber nicht immer exakt: Der Aufschlag pro Nachricht in der Formel des Notebooks ist eine Näherung, und Tool-Definitionen werden als ihr JSON-Text gezählt. Nutzen Sie sie, um zu lange Beispiele zu finden und die Kosten abzuschätzen; maßgeblich ist die Zahl der trainierten Tokens, die der Job selbst meldet.
Prüft es DPO- oder Reinforcement-Fine-Tuning-Dateien?
Nein. Es validiert das überwachte Chat-Format. Eine Präferenzdatei mit preferred_output und non_preferred_output wird als solche erkannt und gemeldet, damit Sie wissen, warum jede Zeile scheitert, ihre eigene Struktur wird aber nicht geprüft.

Das Open Source dahinter

Dieses Werkzeug ist eine eigenständige Implementierung ohne fremde Bibliothek. openai/openai-cookbook (MIT) erledigt dieselbe Aufgabe als Bibliothek — wer sie im eigenen Programm braucht, fängt dort an, statt eine Webseite aufzurufen.

openai/openai-cookbook

Auch bekannt als

  • JSONL Validator
  • OpenAI Fine-Tuning Daten prüfen
  • Fine-Tuning Datenformat
  • Trainingsdaten validieren
  • Chat Fine-Tuning JSONL
  • Fine-Tuning Tokens berechnen