OpenMythos:對 Claude Mythos 架構的理論重構
克勞德神話架構的理論重建,是利用現有的研究文獻根據第一原理建構的。
秒懂
- 它是什麼?
- 基於公開研究建構的循環深度 Transformer 實作,支援 MLA/GQA 注意力切換和稀疏混合專家。
- 適合誰用?
- OpenMythos 是一個 MIT 許可的研究實作,封裝了循環 Transformer 設計、訓練腳本以及對 Claude Mythos 模型的一組假設。README 明確聲明這不是 Anthropic 的官方發布,許可證也不提供任何保固或支援保證。
- 可以商用嗎?
- 可以。MIT 是寬鬆授權:你可以使用、修改並販售以它為基礎的軟體,只需保留著作權與授權聲明。
- 還在維護嗎?
- 有在維護。儲存庫最近一次提交在 115 天前。
- 用什麼語言寫的?
- 主要是 Python(依據 GitHub 的語言統計)。
以上回答依據專案的 GitHub 資料(最近同步於 2026年9月15日)與我們的分析,不構成法律意見。
開源專案深度解析
OpenMythos:對 Claude Mythos 的理論重構
OpenMythos 是基於公開研究而非 Anthropic 專有程式碼建構的 Claude Mythos 理論重構。README 明確表示它與 Anthropic 無關聯、無背書、無連接。實作是一個循環深度 Transformer(RDT),包含三個階段:Prelude 的 transformer 塊、最多運行 max_loop_iters 次的循環 Recurrent Block,以及 Coda。注意力可在 MLA 和 GQA 之間切換,前饋網路使用帶路由專家和共享專家的稀疏混合專家。專案定位為探索計算自適應、深度可變推理的開源實作。
第 1 項:在 OpenMythos 的 README 中,專案定位、使用入口與限制是同一個判讀單位。這代表讀者不能只看星數或首頁描述,而要把文件列出的 API、資料夾、命令和輸出逐項對照。對這個專案而言,最有價值的資訊不是抽象口號,而是它實際提供的檔案與可執行入口。 驗證時可先執行 pip install open-mythos[flash],分別以 attn_type="mla" 和 attn_type="gqa" 建構 MythosConfig,記錄參數量、前向輸出及注入矩陣 A 的譜半徑。 這一檢查針對 OpenMythos 的實際入口,不延伸為 README 沒有提出的承諾。
OpenMythos:安裝與切換注意力模式
透過 pip 安裝:`pip install open-mythos`,可選擴充 `pip install open-mythos[flash]` 在 GQAttention 中啟用 Flash Attention 2(需要 CUDA 和建構工具)。用法範例建構 MythosConfig,設定 `attn_type="mla"` 或 `"gqa"`。GQA 路徑新增 n_kv_heads,而 MLA 新增 kv_lora_rank、q_lora_rank、qk_rope_head_dim、qk_nope_head_dim 和 v_head_dim。建構模型後,腳本列印參數數量,執行前向傳播,生成 token,並檢查注入矩陣 A 的譜半徑,README 要求其小於 1。未記錄其他命令。
第 2 項:採用 OpenMythos 前,應先把 README 指出的最小流程放進隔離的測試環境,保留輸入、終端輸出與錯誤訊息。若流程需要特定平台、資料集、GPU、Docker 或外部服務,這些條件會直接影響結果,不能以另一套環境的成功經驗代替。 驗證時可先執行 pip install open-mythos[flash],分別以 attn_type="mla" 和 attn_type="gqa" 建構 MythosConfig,記錄參數量、前向輸出及注入矩陣 A 的譜半徑。 這一檢查針對 OpenMythos 的實際入口,不延伸為 README 沒有提出的承諾。
OpenMythos:預配置規模與 3B 訓練腳本
倉庫包含七個規模的配置建構器:mythos_1b、mythos_3b、mythos_10b、mythos_50b、mythos_100b、mythos_500b 和 mythos_1t。README 表格列出了每個規模的 dim、專家數、expert_dim、循環迭代次數、上下文長度和最大輸出。還有位於 training/3b_fine_web_edu.py 的 3B 模型在 FineWeb-Edu 上的訓練腳本。它使用 AdamW、透過 MythosTokenizer 的 openai/gpt-oss-20b tokenizer、PyTorch DDP、H100/A100 上的 bfloat16,以及 2000 步線性預熱後接餘弦衰減。預設資料集是 HuggingFaceFW/fineweb-edu sample-10BT,可選擇 sample-100BT 或 default。目標標記數為 30B。
第 3 項:從維護角度看,OpenMythos 的可靠程度要分成程式碼能否執行、文件是否足夠,以及專案是否仍在更新三件事。素材只支持 README 已明確說出的能力;沒有列出性能數字、相容版本或服務保證的地方,本文保留為未說明,不把推測寫成承諾。 驗證時可先執行 pip install open-mythos[flash],分別以 attn_type="mla" 和 attn_type="gqa" 建構 MythosConfig,記錄參數量、前向輸出及注入矩陣 A 的譜半徑。 這一檢查針對 OpenMythos 的實際入口,不延伸為 README 沒有提出的承諾。
OpenMythos:循環深度 Transformer 設計
架構是一個循環 transformer,包含三個功能塊。輸入先經過 Prelude,然後進入循環 Recurrent Block 運行 T 次,最後經過 Coda。循環更新規則為 h_{t+1} = A·h_t + B·e + Transformer(h_t, e),其中 e 是每一步注入的編碼輸入。A 和 B 是學習的注入參數。README 稱這種注入防止了漂移。注意力層可切換:GQAttention 實作分組查詢注意力,可選 Flash Attention 2;MLAttention 實作多潛在注意力,使用壓縮的 KV 潛在狀態。RoPE 在快取前應用於 Q 和 K。
第 4 項:授權與技術能力是兩個不同問題。OpenMythos 的授權條款決定你能否修改、再散布或放進產品,也決定發布時要保留哪些聲明;它不會替專案補上安全稽核、支援回應時間或生產環境保證。 驗證時可先執行 pip install open-mythos[flash],分別以 attn_type="mla" 和 attn_type="gqa" 建構 MythosConfig,記錄參數量、前向輸出及注入矩陣 A 的譜半徑。 這一檢查針對 OpenMythos 的實際入口,不延伸為 README 沒有提出的承諾。
OpenMythos:關於循環模型為何適合 Mythos 的論斷
README 提出了四個論點說明循環 transformer 為何能解釋 Mythos。第一,系統泛化透過三個階段的湧現過程出現。第二,深度外推:在 5 跳推理上訓練,在 10 跳上測試,因為更多推理時循環增加了深度。第三,潛在思想充當隱式思維鏈,引用了形式證明(Saunshi 等,2025)。第四,參數效率:k 層循環模型運行 L 次近似於 kL 層模型,但只有 k 層參數。README 還指出循環可能損害記憶,並將其對應到 Mythos 推理好但事實回憶不一致的觀察。
第 5 項:實作評估可以從 OpenMythos 的專案入口開始:先閱讀 README,再對照官方文件或指定路徑,最後檢查實際輸出是否符合文件描述。測試結果應記下使用的版本、命令、設定鍵與平台,因為這些因素可能改變行為。 驗證時可先執行 pip install open-mythos[flash],分別以 attn_type="mla" 和 attn_type="gqa" 建構 MythosConfig,記錄參數量、前向輸出及注入矩陣 A 的譜半徑。 這一檢查針對 OpenMythos 的實際入口,不延伸為 README 沒有提出的承諾。
OpenMythos:穩定性、縮放定律與開放設計問題
訓練循環模型不穩定,會出現殘差爆炸和損失尖峰。README 將循環視為離散 LTI 系統,並稱穩定性要求 A 的譜半徑小於 1。提出的修復方法將 A 參數化為連續負對角矩陣並離散化,從而保證 rho(A) < 1。這歸功於 Parcae 架構。Parcae 還提供了縮放定律:在固定 FLOP 預算下,增加平均循環次數並減少 token 數會降低損失。README 報告在 770M 參數下,循環模型可匹敵 1.3B 固定深度 transformer。其他開放問題包括循環索引嵌入、避免過度思考的自適應計算時間,以及使用 MoE 增加廣度。
第 6 項:在 OpenMythos 的 README 中,專案定位、使用入口與限制是同一個判讀單位。這代表讀者不能只看星數或首頁描述,而要把文件列出的 API、資料夾、命令和輸出逐項對照。對這個專案而言,最有價值的資訊不是抽象口號,而是它實際提供的檔案與可執行入口。 驗證時可先執行 pip install open-mythos[flash],分別以 attn_type="mla" 和 attn_type="gqa" 建構 MythosConfig,記錄參數量、前向輸出及注入矩陣 A 的譜半徑。 這一檢查針對 OpenMythos 的實際入口,不延伸為 README 沒有提出的承諾。
OpenMythos:文件與許可證邊界
列出的兩個文件頁面:docs/open_mythos.md 是 OpenMythos 類別的 API 參考,docs/datasets.md 涵蓋推薦的訓練資料集。許可證為 MIT,版權歸 Kye Gomez(2026)。MIT 文字授予使用、複製、修改、合併、發布、分發、再許可和銷售副本的權利,並聲明軟體按「原樣」提供,不附帶任何擔保。它沒有說明安全保證、支援或生產就緒性。README 沒有記錄除 PyTorch 和可選 Flash Attention 之外的外部整合。
第 7 項:採用 OpenMythos 前,應先把 README 指出的最小流程放進隔離的測試環境,保留輸入、終端輸出與錯誤訊息。若流程需要特定平台、資料集、GPU、Docker 或外部服務,這些條件會直接影響結果,不能以另一套環境的成功經驗代替。 驗證時可先執行 pip install open-mythos[flash],分別以 attn_type="mla" 和 attn_type="gqa" 建構 MythosConfig,記錄參數量、前向輸出及注入矩陣 A 的譜半徑。 這一檢查針對 OpenMythos 的實際入口,不延伸為 README 沒有提出的承諾。
編輯結論
OpenMythos 是一個 MIT 許可的研究實作,封裝了循環 Transformer 設計、訓練腳本以及對 Claude Mythos 模型的一組假設。README 明確聲明這不是 Anthropic 的官方發布,許可證也不提供任何保固或支援保證。
社群筆記