Validateur JSONL pour fine-tuning
Vérifiez ligne par ligne un fichier de fine-tuning chat OpenAI avant de l’envoyer, et voyez ses nombres de tokens et ce que l’entraînement facturera.
Entrée
Résultat
Le résultat apparaîtra ici.Un job de fine-tuning OpenAI qui échoue à la validation, ou qui s’entraîne sur des exemples discrètement cassés, coûte du temps et de l’argent. Cet outil applique à votre fichier JSONL — un exemple de chat par ligne — les vérifications du notebook de préparation des données d’OpenAI lui-même (openai/openai-cookbook, MIT), et les étend aux parties du format apparues après ce notebook : appels d’outils, contenus image et poids par message. Vous obtenez chaque erreur avec son numéro de ligne, les statistiques de tokens du notebook, le nombre d’epochs que l’API choisira par défaut et le nombre de tokens que l’entraînement facturera.
Comment ça marche
- Chaque ligne doit être un objet JSON contenant un tableau messages ; les rôles doivent être system, user, assistant, tool ou function, et chaque exemple a besoin d’au moins un message assistant dont apprendre.
- Il vérifie ce que la validation à l’envoi rejette : clés inconnues, contenu vide, weight différent de 0 ou 1 ou placé sur un message non assistant, appels d’outils sans id, sans nom ou sans arguments JSON, et réponses d’outil dont le tool_call_id ne répond à aucun appel précédent.
- Il reconnaît aussi les fichiers qui sont carrément au mauvais format — l’ancienne structure prompt/completion et les données de préférence (DPO) — et le dit au lieu d’aligner des centaines d’erreurs.
- Les tokens sont comptés avec la formule du notebook sur o200k_base ; les exemples qui dépassent la limite de tokens sont signalés car l’entraînement les tronque, et les tokens facturés sont le total tronqué multiplié par le nombre d’epochs par défaut.
Où vont vos données
Nulle part. Cet outil s’exécute entièrement dans votre navigateur : le texte collé est traité par la page, jamais transmis à un serveur ni consigné dans un journal.
Cet outil est gratuit et ne demande aucun compte. Ses résultats n’existent que dans la page ouverte et ne sont enregistrés nulle part.
Ce que ça coûte
Cet outil est gratuit, sans connexion ni points.
Questions fréquentes
- Combien d’exemples me faut-il ?
- L’API refuse moins de 10 exemples. OpenAI conseille de commencer avec 50 à 100 exemples bien choisis et de n’en ajouter que si les résultats s’améliorent. Le nombre d’epochs par défaut s’adapte à la taille du fichier : 3 pour la plupart des fichiers, davantage pour les très petits (jusqu’à 25) et moins pour les très gros, et c’est la règle qu’applique cet outil.
- À quoi sert le réglage de limite de tokens ?
- C’est la longueur maximale d’un exemple sur lequel le modèle de base peut s’entraîner ; OpenAI indique 65 536 tokens pour gpt-4o et gpt-4o-mini, la valeur par défaut ici. Les exemples plus longs sont coupés à la limite pendant l’entraînement, et leur fin, souvent la réponse de l’assistant, est perdue. Indiquez la limite documentée pour le modèle que vous avez choisi.
- Mon nombre de tokens correspondra-t-il exactement à celui d’OpenAI ?
- De près, mais pas toujours exactement : le surcoût par message de la formule du notebook est une approximation, et les définitions d’outils sont comptées d’après leur texte JSON. Servez-vous-en pour repérer les exemples trop longs et estimer le coût ; le nombre de tokens entraînés annoncé par le job lui-même fait foi.
- Vérifie-t-il les fichiers de DPO ou de fine-tuning par renforcement ?
- Non. Il valide le format chat supervisé. Un fichier de préférences avec preferred_output et non_preferred_output est détecté et signalé comme tel, pour que vous sachiez pourquoi chaque ligne échoue, mais sa propre structure n’est pas vérifiée.
L’open source derrière
Cet outil est une implémentation autonome, sans bibliothèque tierce. openai/openai-cookbook (MIT) fait le même travail sous forme de bibliothèque : pour l’intégrer à votre programme, commencez par là plutôt que d’appeler une page web.
openai/openai-cookbookAussi appelé
- validateur JSONL
- valider fichier fine-tuning OpenAI
- format données fine-tuning
- JSONL fine-tuning chat
- vérifier données d’entraînement
- tokens fine-tuning OpenAI