Alignment Handbook: Trainingsrezepte von Continued Pretraining bis ORPO
Robust recipes to align language models with human and AI preferences
Auf einen Blick
- Was ist das?
- Das Repository von Hugging Face bündelt Skripte und YAML-Rezepte für die vollständige Post-Training-Pipeline von Sprachmodellen. Der Nutzen liegt weniger im Code als in den dokumentierten Parametern, die Zephyr, SmolLM und StarChat2 reproduzierbar machen.
- Für wen ist es gedacht?
- Wer eine dokumentierte Referenz für SFT, DPO oder ORPO sucht und bereit ist, die Rezepte an eigene Hardware und Daten anzupassen, findet hier einen konkreten Ausgangspunkt. Wer eine Bibliothek mit stabilem API-Vertrag für eigene Trainingspipelines braucht, sollte zuerst die Abhängigkeiten in pyproject.toml und die Skripte unter scripts/ prüfen, bevor er sich auf dieses Repository festlegt.
- Darf ich es kommerziell nutzen?
- Ja. Apache-2.0 ist eine freizügige Lizenz: Sie dürfen darauf aufbauende Software nutzen, verändern und verkaufen, solange Sie die Urheberrechts- und Lizenzhinweise beibehalten.
- Wird es noch gepflegt?
- Ja. Die letzten Commits kamen vor 113 Tagen.
- In welcher Sprache ist es geschrieben?
- Hauptsächlich Python, laut der Sprachstatistik von GitHub.
Die Antworten beruhen auf den GitHub-Daten des Projekts (zuletzt abgeglichen am 15. September 2026) und auf unserer Analyse. Sie sind keine Rechtsberatung.
TIEFGEHENDE OPEN-SOURCE-ANALYSE
Welche Lücke das Repository schließt
Supervised Fine-Tuning ist der Standardweg, um Sprachmodelle Anweisungen befolgen zu lassen. Die InstructGPT- und Llama2-Arbeiten zeigen laut README, dass sich Hilfsbereitschaft und Sicherheit weiter verbessern lassen, wenn man SFT um menschliche oder KI-Präferenzen ergänzt. Genau dort klafft eine Lücke: Präferenzoptimierung ist jung, und öffentliche Ressourcen zu Trainingsdaten, Hyperparametern und Auswertungsmetriken sind dünn gesät. Das Alignment Handbook adressiert dieses Problem nicht mit einer neuen Methode, sondern mit nachvollziehbaren Konfigurationen. Die Zielgruppe sind ML-Ingenieure und Forschende, die ein Basismodell auf eigene Daten ausrichten wollen und dabei nicht bei Null anfangen möchten. Wer dagegen nur Inference mit einem fertigen Instruct-Modell betreibt, braucht dieses Repository nicht.
Skripte, Rezepte und der Datenfluss
Der Aufbau ist bewusst schlicht und besteht laut README aus zwei Teilen. Unter scripts/ liegen Trainings- und Evaluierungsskripte für vier Stufen: Continued Pretraining, SFT für Chat, Präferenzausrichtung mit DPO und ORPO, das SFT und Präferenzausrichtung in einem Schritt verbindet. Jedes Skript unterstützt verteiltes Training der vollen Gewichte mit DeepSpeed ZeRO-3 sowie LoRA und QLoRA für parameter-effizientes Fine-Tuning. Unter recipes/ liegt pro Trainingslauf eine YAML-Datei mit allen zugehörigen Parametern. Der Datenfluss ist damit Datei-getrieben: Ein Rezept beschreibt einen Lauf, das Skript liest die Konfiguration und stößt das Training an. Ein gpt2-nl-Rezept illustriert den Fall der Sprach- oder Domänenanpassung, bei dem Continued Pretraining, SFT und DPO aufeinander folgen. Diese Trennung von Konfiguration und Code ist der eigentliche Wert des Projekts, weil sie Läufe vergleichbar macht.
Installation mit uv, PyTorch 2.6.0 und Flash Attention
Die Installationsanleitung ist ungewöhnlich versionsgenau. Zuerst wird eine virtuelle Umgebung erstellt:
uv venv handbook --python 3.11 && source handbook/bin/activate && uv pip install --upgrade pip
Danach folgt PyTorch in einer festen Version, wobei das README ausdrücklich betont, dass die genaue Version für Reproduzierbarkeit wichtig ist:
uv pip install torch==2.6.0 --index-url https://download.pytorch.org/whl/cu126
Die übrigen Abhängigkeiten kommen über uv pip install . aus der Projektkonfiguration. Zusätzlich ist Flash Attention 2 erforderlich, installiert mit:
uv pip install "flash-attn==2.7.4.post1" --no-build-isolation
Für den Upload von Modellen auf den Hub sind huggingface-cli login und git-lfs nötig. Auffällig ist die Kopplung an CUDA 12.6 im Index-URL. Wer eine andere CUDA-Version fährt, muss den Befehl anpassen; das README verweist dafür auf die PyTorch-Installationsseite. Der Einstieg ist also nicht plattformneutral, sondern auf eine bestimmte Umgebung zugeschnitten.
Was die Rezepte abdecken und was nicht
Die Inhaltsliste nennt Continued Pretraining, Supervised Fine-Tuning, Reward Modeling, Rejection Sampling, DPO und ORPO. Das ist eine breite Abdeckung, aber die Tiefe ist ungleich. Zu DPO, KTO und IPO gibt es laut README eine Vergleichsstudie im Rezept pref_align_scan. Constitutional AI ist als eigenes Rezept vorhanden. Die News-Einträge zeigen, dass das Projekt an konkrete Modellveröffentlichungen gekoppelt ist: Zephyr 7B, StarChat2 15B, SmolLM2-Instruct und zuletzt SmolLM3-3B im Juli 2025. Das bedeutet auch, dass Rezepte historisch gewachsen sind. Ein Rezept für ein Modell aus 2023 und eines aus 2025 können unterschiedliche Konventionen verwenden. Wer ein Rezept als Vorlage kopiert, sollte deshalb nicht annehmen, dass alle Rezepte denselben Stand teilen. Das README macht dazu keine explizite Zusage.
Wo das Repository an Grenzen stößt
Es gibt keine abrufbaren Releases, und das README verweist für Details auf die Rezept-READMEs sowie auf scripts/README.md für das Format eigener Datensätze. Das ist ein Hinweis auf die eigentliche Schwachstelle: Die Dokumentation ist über viele Dateien verteilt, und der Einstieg führt über das Nachbauen von Zephyr-7b-beta. Wer ein eigenes Modell ausrichten will, muss die Datensatzformatierung eigenständig nachvollziehen. Ein weiterer Punkt ist die Hardware. DeepSpeed ZeRO-3 für volle Gewichte setzt eine Multi-GPU-Umgebung voraus; LoRA und QLoRA senken diese Hürde, ändern aber das Trainingsverhalten. Das falsche Werkzeug ist dieses Repository, wenn man ein fertiges Modell nur evaluieren oder in eine Anwendung einbinden möchte. Ebenso ungeeignet ist es als stabile Bibliothek mit garantiertem API-Vertrag, denn die Skripte sind Trainingscode, kein Produkt.
TRL als Alternative mit anderem Zuschnitt
Die naheliegende Alternative ist TRL aus demselben Haus, das als Topic des Repositories genannt wird. Der Unterschied liegt im Ansatz: TRL stellt Trainer-Klassen bereit, die man in eigenen Python-Code importiert und mit eigenen Datenströmen versorgt. Das Alignment Handbook liefert dagegen vollständige Läufe als YAML plus Kommandozeilenskripte, die man ausführt statt importiert. Wer eine Pipeline in eine bestehende Trainingsinfrastruktur einbetten will, ist mit TRL besser bedient, weil dort der Code die Schnittstelle ist. Wer einen bekannten Lauf reproduzieren und dessen Parameter als Ausgangspunkt nehmen will, profitiert von den Rezepten. Die beiden schließen sich nicht aus: Die Rezepte im Handbook bauen auf denselben Verfahren auf, die TRL implementiert. Die Wahl ist also eine Frage dessen, ob man Konfiguration oder Code als primäres Artefakt möchte.
Wartung, Lizenz und Kosten
Der letzte Push liegt im Mai 2026, das Repository ist nicht archiviert. Die News-Einträge enden im Juli 2025 mit der SmolLM3-3B-Rezeptur. Ein Update-Zyklus ist damit an Modellveröffentlichungen gekoppelt, was für Nutzer bedeutet, dass Rezepte mit neuen Basismodellen ergänzt werden, ohne dass ältere verschwinden. Upgrade-Kosten entstehen vor allem durch die feste PyTorch-Version und die Flash-Attention-Abhängigkeit: Ein Sprung auf eine neuere PyTorch-Version erfordert Anpassungen an der Umgebung, und das README warnt, dass die genaue Version für Reproduzierbarkeit zählt. Die Lizenz ist Apache-2.0, was kommerzielle Nutzung und Modifikation erlaubt, solange Lizenz- und Urheberrechtshinweise erhalten bleiben. Das ist eine technische Einordnung, keine Rechtsberatung; wer die trainierten Modellgewichte weiterverbreitet, muss die Bedingungen der jeweiligen Basismodelle separat prüfen.
Redaktionelles Fazit
Wer eine dokumentierte Referenz für SFT, DPO oder ORPO sucht und bereit ist, die Rezepte an eigene Hardware und Daten anzupassen, findet hier einen konkreten Ausgangspunkt. Wer eine Bibliothek mit stabilem API-Vertrag für eigene Trainingspipelines braucht, sollte zuerst die Abhängigkeiten in pyproject.toml und die Skripte unter scripts/ prüfen, bevor er sich auf dieses Repository festlegt.
Community-Notizen