Open-Source-Projekt
kyegomez/OpenMythos avatar
kyegomez/OpenMythos

OpenMythos: A theoretical reconstruction of the Claude Mythos architecture, built from first principles using the available research literature.

Eine theoretische Rekonstruktion der Claude-Mythos-Architektur, basierend auf ersten Prinzipien und unter Verwendung der verfügbaren Forschungsliteratur.

14.895 Sterne3.295 ForksPythonMIT

Auf einen Blick

Was ist das?
Eine auf öffentlicher Forschung basierende Implementierung eines rekurrenten Tiefen-Transformers mit umschaltbarer MLA/GQA-Aufmerksamkeit und sparsamer Expertenmischung.
Für wen ist es gedacht?
OpenMythos passt zu Anwendern, die Eine auf öffentlicher Forschung basierende Implementierung eines rekurrenten Tiefen-Transformers mit umschaltbarer MLA/GQA-Aufmerksamkeit und sparsamer Expertenmischung. benötigen. Vor einer dauerhaften Nutzung zuerst python training/3b_fine_web_edu.py und die Konfiguration MythosConfig mit den eigenen Daten ausführen und dabei Ergebnis, Logs sowie die erzeugten Dateien prüfen.
Darf ich es kommerziell nutzen?
Ja. MIT ist eine freizügige Lizenz: Sie dürfen darauf aufbauende Software nutzen, verändern und verkaufen, solange Sie die Urheberrechts- und Lizenzhinweise beibehalten.
Wird es noch gepflegt?
Ja. Die letzten Commits kamen vor 115 Tagen.
In welcher Sprache ist es geschrieben?
Hauptsächlich Python, laut der Sprachstatistik von GitHub.

Die Antworten beruhen auf den GitHub-Daten des Projekts (zuletzt abgeglichen am 15. September 2026) und auf unserer Analyse. Sie sind keine Rechtsberatung.

TIEFGEHENDE OPEN-SOURCE-ANALYSE

Vom README-Zweck zum tatsächlichen Ablauf · kyegomez openmythos

kyegomez/OpenMythos ordnet sich als A theoretical reconstruction of the Claude Mythos architecture, built from first principles using the available research literature. ein. Die README beschreibt den konkreten Zweck, die verwendeten Bausteine und den vorgesehenen Einstieg. Daraus ergibt sich ein klarer Schwerpunkt: Das Projekt will Eine auf öffentlicher Forschung basierende Implementierung eines rekurrenten Tiefen-Transformers mit umschaltbarer MLA/GQA-Aufmerksamkeit und sparsamer Expertenmischung. und richtet sich damit an Anwender, die genau diesen Ablauf abbilden möchten. Aussagen über Reichweite oder Reife bleiben an die Repository-Dokumentation gebunden; eine unabhängige Leistungsprüfung ist dort nicht belegt.

A theoretical reconstruction of the Claude Mythos architecture, built from first principles using the available research literature.. Eine theoretische Rekonstruktion von Claude Mythos: OpenMythos ist eine theoretische Rekonstruktion des Claude-Mythos-Modells, die auf öffentlicher Forschung basiert und nicht auf proprietärem Anthropic-Code. Die README sagt ausdrücklich, dass es nicht mit Anthropic verbunden, gebilligt oder in Verbindung steht. Die Implementierung ist ein Rekurrenter Tiefen-Transformer (RDT) mit drei Stufen: einem Prelude aus Transformer-Blöcken, einem geloopten Recurrent Block, der bis zu max_loop_iters Mal läuft, und einer Coda. Die Aufmerksamkeit kann entweder MLA oder GQA sein, und das Feed-Forward nutzt eine sparsame Expertenmischung mit gerouteten und gemeinsamen Experten. Das Projekt ist als Open-Source-Implementierung zur Erkundung rechnungsadaptiver, tiefenvariabler Argumentation positioniert. Installation und Umschalten der Aufmerksamkeitsmodi: Die Installation erfolgt über pip: `pip install open-mythos`, mit optionalem Zusatz `pip install open-mythos[flash]`, um Flash Attention 2 in GQAttention zu aktivieren, wenn CUDA und Build-Tools vorhanden sind. Das Verwendungsbeispiel erstellt eine MythosConfig mit entweder `attn_type="mla"` oder `"gqa"`. Der GQA-Pfad fügt n_kv_heads hinzu, während MLA kv_lora_rank, q_lora_rank, qk_rope_head_dim, qk_nope_head_dim und v_head_dim hinzufügt.

Die benannten Bausteine im Zusammenspiel · kyegomez openmythos

Technisch wichtig ist die Trennung zwischen dem sichtbaren Einstieg und den Teilen, die bei der eigenen Umgebung liegen. Die dokumentierten Namen, Pfade, Befehle und Konfigurationswerte sind deshalb mehr als Beispieltext: Sie zeigen, welche Voraussetzungen das Projekt erwartet. Wer kyegomez/OpenMythos einsetzen will, sollte diese Kette in derselben Reihenfolge nachvollziehen und dabei Ausgaben, Fehlermeldungen und erzeugte Dateien festhalten.

Das Verwendungsbeispiel erstellt eine MythosConfig mit entweder `attn_type="mla"` oder `"gqa"`. Der GQA-Pfad fügt n_kv_heads hinzu, während MLA kv_lora_rank, q_lora_rank, qk_rope_head_dim, qk_nope_head_dim und v_head_dim hinzufügt. Nach der Modellerstellung gibt das Skript die Parameteranzahl aus, führt einen Vorwärtsdurchlauf aus, generiert Tokens und prüft den Spektralradius der Injektionsmatrix A, der laut README kleiner als 1 sein muss. Andere Befehle sind nicht dokumentiert. Vorkonfigurierte Größen und das 3B-Trainingsskript: Das Repository enthält Konfigurations-Builder für sieben Größen: mythos_1b, mythos_3b, mythos_10b, mythos_50b, mythos_100b, mythos_500b und mythos_1t. Die README-Tabelle listet für jede Größe dim, Anzahl der Experten, expert_dim, Schleifeniterationen, Kontextlänge und maximale Ausgabe auf. Es gibt auch ein Trainingsskript unter training/3b_fine_web_edu.py für das 3B-Modell auf FineWeb-Edu. Es verwendet AdamW, den Tokenizer openai/gpt-oss-20b über MythosTokenizer, PyTorch DDP, bfloat16 auf H100/A100 und einen linearen Warmup von 2000 Schritten gefolgt von Kosinus-Abklingung. Das Standard-Dataset ist HuggingFaceFW/fineweb-edu sample-10BT, mit sample-100BT oder default als Alternativen.

Wo die Dokumentation Grenzen setzt · kyegomez openmythos

Die Stärken liegen dort, wo die README konkrete Abläufe beschreibt. Gleichzeitig bleiben Grenzen bestehen. Abhängigkeiten, Hardware, externe Konten und Versionsstände können das Ergebnis verändern. Die Dokumentation nennt nicht für jede Kombination einen Testfall. Das spricht für einen kleinen, reproduzierbaren Versuch mit den eigenen Eingaben, bevor das Projekt in einen dauerhaften Prozess gelangt.

Es verwendet AdamW, den Tokenizer openai/gpt-oss-20b über MythosTokenizer, PyTorch DDP, bfloat16 auf H100/A100 und einen linearen Warmup von 2000 Schritten gefolgt von Kosinus-Abklingung. Das Standard-Dataset ist HuggingFaceFW/fineweb-edu sample-10BT, mit sample-100BT oder default als Alternativen. Das angegebene Ziel sind 30B Tokens. Das Design des rekursiven Tiefen-Transformers: Die Architektur ist ein geloopter Transformer mit drei funktionalen Blöcken. Eingabe durchläuft ein Prelude, dann einen Recurrent Block, der T-mal läuft, und dann eine Coda. Die rekursive Aktualisierungsregel lautet h_{t+1} = A·h_t + B·e + Transformer(h_t, e), wobei e die in jeder Schleife injizierte codierte Eingabe ist. A und B sind gelernte Injektionsparameter. Die README sagt, diese Injektion verhindere Drift. Die Aufmerksamkeitsschicht ist umschaltbar: GQAttention implementiert Grouped Query Attention mit optionalem Flash Attention 2, und MLAttention implementiert Multi-Latent Attention mit einem komprimierten KV-Latent.

Lizenz, Abhängigkeiten und Betriebsrahmen · kyegomez openmythos

Für die Einordnung zählt auch die Betriebsform. MIT erlaubt die Nutzung im Rahmen der Lizenzbedingungen, ersetzt aber keine Prüfung der Abhängigkeiten oder der Datenflüsse. Bei kyegomez/OpenMythos sollte besonders geklärt werden, welche Teile lokal laufen, welche Dienste angesprochen werden und welche Rechte ein Token, Container oder Prozess erhält. Diese Fragen sind aus dem jeweiligen README-Aufbau abzuleiten, nicht aus allgemeinen Versprechen.

Die README sagt, diese Injektion verhindere Drift. Die Aufmerksamkeitsschicht ist umschaltbar: GQAttention implementiert Grouped Query Attention mit optionalem Flash Attention 2, und MLAttention implementiert Multi-Latent Attention mit einem komprimierten KV-Latent. RoPE wird vor dem Caching auf Q und K angewendet. Die Behauptungen, warum ein geloopter Transformer zu Mythos passt: Die README präsentiert vier Argumente, warum ein geloopter Transformer Mythos erklären könnte. Erstens entsteht systematische Generalisierung durch einen dreistufigen Grokking-Prozess. Zweitens Tiefenextrapolation: Training mit 5-Hop-Schlussfolgerungen und Testen mit 10-Hop funktioniert, weil mehr Inferenzschleifen Tiefe hinzufügen. Drittens wirken latente Gedanken als implizite Gedankenkette, und ein formaler Beweis wird zitiert (Saunshi et al., 2025). Viertens Parametereffizienz: Ein k-Schichten-gelooptes Modell, das L-mal läuft, approximiert ein kL-Schichten-Modell mit nur k Schichten Parametern. Die README stellt auch fest, dass Looping das Gedächtnis beeinträchtigen kann, was sie mit der Beobachtung verbindet, dass Mythos gut argumentiert, aber inkonsistentes Faktenabrufverhalten hat.

Ein projektspezifischer Prüfpfad · kyegomez openmythos

Der praktische Prüfpunkt liegt bei python training/3b_fine_web_edu.py und die Konfiguration MythosConfig. Dabei sollte man auf einen erfolgreichen Exit-Code, die in der README erwarteten Artefakte und den Umgang mit ungültigen Eingaben achten. Bei einem Dienst gehören auch Logs, Ports, Authentifizierung und ein zweiter Lauf mit identischem Input zur Prüfung. Bei einem Modell oder Build sind Speicherbedarf, Laufzeit und die tatsächliche Ausgabe zu protokollieren.

Viertens Parametereffizienz: Ein k-Schichten-gelooptes Modell, das L-mal läuft, approximiert ein kL-Schichten-Modell mit nur k Schichten Parametern. Die README stellt auch fest, dass Looping das Gedächtnis beeinträchtigen kann, was sie mit der Beobachtung verbindet, dass Mythos gut argumentiert, aber inkonsistentes Faktenabrufverhalten hat. Stabilität, Skalierungsgesetze und offene Designfragen: Das Training geloopter Modelle ist instabil, mit Residuenexplosion und Verlustspitzen. Die README betrachtet Looping als diskretes LTI-System und sagt, Stabilität erfordere einen Spektralradius von A unter 1. Der vorgeschlagene Fix parametrisiert A als kontinuierliche negative Diagonalmatrix und diskretisiert sie, wodurch rho(A) < 1 konstruktionsbedingt sichergestellt wird. Dies wird der Parcae-Architektur zugeschrieben. Parcae liefert auch Skalierungsgesetze: Bei festem FLOP-Budget senkt eine Erhöhung der mittleren Rekurrenz und eine Verringerung der Tokenanzahl den Verlust. Die README berichtet, dass bei 770M Parametern ein gelooptes Modell einem 1.3B-Transformer mit fester Tiefe entspricht. Weitere offene Fragen umfassen Schleifenindex-Einbettungen, adaptive Berechnungszeit zur Vermeidung von Überdenken und die Verwendung von MoE für Breite.

Für welchen Einsatz die Einordnung trägt · kyegomez openmythos

Damit ist kyegomez/OpenMythos vor allem für Nutzer interessant, deren Arbeitsablauf mit den dokumentierten Schnittstellen übereinstimmt. Weniger passend ist das Projekt für Umgebungen, die eine fertige Hochverfügbarkeitslösung, vollständig garantierte Kompatibilität oder eine ausführliche Supportstruktur verlangen, sofern die README dies nicht zusichert. Ein begrenzter Versuch mit den konkreten Eingaben schafft die belastbare Grundlage für die Entscheidung.

Die README berichtet, dass bei 770M Parametern ein gelooptes Modell einem 1.3B-Transformer mit fester Tiefe entspricht. Weitere offene Fragen umfassen Schleifenindex-Einbettungen, adaptive Berechnungszeit zur Vermeidung von Überdenken und die Verwendung von MoE für Breite. Dokumentation und Lizenzgrenzen: Es werden zwei Dokumentationsseiten aufgeführt: docs/open_mythos.md ist die API-Referenz für die OpenMythos-Klasse, und docs/datasets.md behandelt empfohlene Trainingsdatensätze. Die Lizenz ist MIT, Copyright 2026 Kye Gomez. Der MIT-Text gewährt das Recht zur Nutzung, Vervielfältigung, Änderung, Zusammenführung, Veröffentlichung, Verteilung, Unterlizenzierung und zum Verkauf von Kopien und besagt, dass die Software ohne Gewährleistung bereitgestellt wird. Es wird nichts über Sicherheitsgarantien, Support oder Produktionsreife gesagt. Die README dokumentiert keine externen Integrationen außer PyTorch und optionalem Flash Attention.

Redaktionelles Fazit

OpenMythos passt zu Anwendern, die Eine auf öffentlicher Forschung basierende Implementierung eines rekurrenten Tiefen-Transformers mit umschaltbarer MLA/GQA-Aufmerksamkeit und sparsamer Expertenmischung. benötigen. Vor einer dauerhaften Nutzung zuerst python training/3b_fine_web_edu.py und die Konfiguration MythosConfig mit den eigenen Daten ausführen und dabei Ergebnis, Logs sowie die erzeugten Dateien prüfen.

Offizielle Quellen

  1. Official documentation
  2. Official README
  3. Project repository
Community-Notizen

Community-Notizen