my-neuro:把 Live2D 桌面夥伴拆成可自行組裝的工作台
This project lets you create your own AI desktop companion with customizable characters and voice conversations that respond in just 1 second. Features include long-term memory, visual recognition, voice cloning and LLM training. Compatible with various Live2D customizations.
秒懂
- 它是什麼?
- my-neuro 用 JavaScript 串起 LLM、TTS、視覺與 Live2D,讓開發者自行拼出一個有記憶、能打斷、可替換形象的桌面 AI 角色。它的價值在模組拼裝,代價也來自同一件事。
- 適合誰用?
- 如果你願意自己跑 LLM 與 GPT-SoVITS、接受用官網與 QQ 群文件補齊文件缺口,my-neuro 是少見把 Live2D 形象、聲音訓練、記憶與視覺放進同一個工作台的專案,MIT 授權也讓改造沒有額外顧慮。若你只想開箱即用、不打算碰模型部署,這個專案會消耗你大量時間在整合而非使用;純文字對話需求用一般 LLM 客戶端即可,不需要背這套依賴。
- 可以商用嗎?
- 可以。MIT 是寬鬆授權:你可以使用、修改並販售以它為基礎的軟體,只需保留著作權與授權聲明。
- 還在維護嗎?
- 有在維護。儲存庫最近一次提交在 2 天前。
- 用什麼語言寫的?
- 主要是 JavaScript(依據 GitHub 的語言統計)。
以上回答依據專案的 GitHub 資料(最近同步於 2026年9月15日)與我們的分析,不構成法律意見。
開源專案深度解析
my-neuro 想解決的是拼裝問題,不是對話問題
要做一個會說話、有表情、記得住你的桌面角色,難的不是呼叫 LLM。難的是把語音辨識、語言模型、語音合成、Live2D 動作、長期記憶這幾條管線接起來,還要讓延遲低到對話不尷尬。my-neuro 的定位就是把這些環節包成一個工作台,README 寫得很直白:本項目更像是一個工作台。
它的目標客群分成兩層。一層是想從零塑造角色的人:自己訓練聲音、自己定性格、自己換 Live2D 形象,README 的比喻是像橡皮泥。另一層是不想折騰的人,直接解壓官方打包的肥牛角色,設定為腹黑、傲嬌、搞笑、有小脾氣。兩層客群的需求其實衝突,前者要可替換的模組,後者要一個能跑的成品,專案目前同時服務兩邊。
值得注意的是 README 自己承認肥牛是抄襲 neuro sama 的角色,專案名稱也明說蹭熱度。這種坦白在開源專案裡不常見,對採用者反而是有用的訊號:作者知道自己在做什麼,也知道邊界在哪。
雙模型路線與 1 秒延遲的實際代價
README 的計劃清單把模型支援分成兩條:開源模型可微調、本地部署;閉源模型可接入。這條分岔決定了整個專案的效能上限與硬體門檻。走本地路線的人要進 LLM-studio 資料夾,裡面放的是本地模型的推理與微調指導;走 API 路線的人則把推理外包出去。
核心功能第一條寫的是超低延遲:全本地推理,對話延遲在 1 秒以下。這個數字有明確前提,就是全本地。一旦你把 LLM 換成第三方 API,延遲就由網路與供應商決定,README 沒有給出這種配置下的數字。反過來說,要拿到 1 秒以下,你得同時在本機跑 LLM 與 TTS 兩套模型,README 沒有列出顯卡型號或記憶體需求,這是評估時最需要自己實測的一項。
延遲鏈路上還有一個容易被忽略的設計:實時打斷。支援語音與鍵盤打斷 AI 說話,意味著播放與生成必須能中斷,而不是等整段合成完才播。字幕與語音同步輸出也是同一類要求。這兩個功能讓管線比單純的請求回應複雜,也讓本地推理的資源佔用更難預估。
記憶、視覺與意圖判斷怎麼串
長期記憶在 README 的描述是讓模型記住你的關鍵資訊、個性與脾氣。致謝清單列出了記憶系統使用 MemTensor 的 MemOS,這是整個堆疊裡唯一能追溯到具體上游的記憶實作。專案本身沒有描述記憶的檢索策略或儲存格式。
視覺能力的觸發方式比較有意思:整合視覺能力,支援圖像識別,並透過語言意圖判斷何時啟動視覺功能。也就是說不是持續截圖送模型,而是先由語言判斷要不要看。這個設計省算力,代價是判斷錯誤時模型會錯過畫面內容,而 README 沒有說明誤判時使用者能否手動強制觸發。
MCP 支援與桌面控制是另外兩條外掛路線。桌面控制可以語音開軟體;MCP 工具則讓模型呼叫外部能力,致謝裡列出的 playwright-mcp 就是網頁操作那一塊。玩遊戲的部分接的是 mindcraft,README 標註目前接入我的世界與 galgame,其他如你畫我猜、大富翁列在實驗階段。這些整合的穩定度取決於上游專案,不在 my-neuro 的控制範圍內。
安裝路徑與官方教學的現實
README 沒有把安裝指令寫在倉庫裡,而是把部署流程指向官網 mynewbot.com/tutorials。倉庫內能直接看到的取得方式是肥牛部署新人整合包,連結指向百度網盤,作者在說明裡加了一個硬性限制:文件路徑不能有中文空格括號等字符。這條限制通常來自 Python 或模型載入路徑的處理方式,是實際部署時最先撞到的坑。
版本節奏可以從 release 看出:v6.7.2 與 v6.7.1 相隔兩天,另外還有獨立的安裝包版本 exe3.0。版本號推進快,代表功能在動,也代表你跟著升級時要有心理準備。倉庫主語言是 JavaScript,但 TTS 走 GPT-SoVITS、遊戲走 mindcraft,實際執行時是多語言、多執行環境混在一起,這在除錯時會放大難度。
需要明講的是,本文沒有實際安裝或執行過這個專案,上述路徑與限制都來自 README 與 release 資訊。真正的依賴清單、Python 版本、模型檔案大小,都要以官網教學與整合包內附教程為準。
語音訓練與形象替換的取捨
聲音模型訓練預設使用 GPT-SoVITS,這是開源專案,README 在致謝中明確引用。要做出貼近某個聲線的 TTS,你得準備對應的語音資料並跑訓練流程,這部分的時間成本與硬體成本都不低,README 沒有給出資料量門檻。
形象替換標示為支援各類 Live2D 模型,這是相對輕量的一環,換模型不需要重訓。專案同時提供字幕顯示中文、音訊播放外語的選項,並可自由開關,理由是適用於 TTS 模型本身就是外語的角色。這個設計說明作者預期使用者會混搭語言,而不是全部在地化。
唱歌功能由社群成員資金贊助開發,README 特別致謝。這類由贊助驅動的功能在維護上通常不如核心管線穩定,採用前值得先確認它在當前版本的實際狀態。
與單純 LLM 客戶端的差別在哪
如果你只要文字對話,任何 LLM 客戶端都更省事,不需要 Live2D、不需要 TTS、不需要處理模型路徑。my-neuro 的差異在於它把角色當成一個有形象、有聲音、會被語音打斷的實體,並且把長期記憶與視覺觸發接進同一條管線。這是它願意承擔多語言執行環境與多上游依賴的原因。
另一類替代做法是自己用現成框架拼:LLM 接一個、TTS 接一個、Live2D 用現成渲染庫。這樣每塊都能挑最新最好的,代價是整合工作全落在你身上,而 my-neuro 已經把打斷、字幕同步、意圖觸發視覺這些細節處理過。要不要用這個專案,本質上是在問你比較不想寫整合程式碼,還是比較不想接受別人的整合決策。
直播與手機 App 是它相對少見的延伸。README 標示可在嗶哩嗶哩直播,安卓手機 App 也已列出,國外直播平台接入則尚未完成。這些功能的成熟度在 README 裡只有勾選狀態,沒有細節,評估時應視為待驗證項。
授權、維護與升級的實際成本
倉庫授權是 MIT,對修改與再散布的限制很少。要留意的是它引用的上游:GPT-SoVITS、mindcraft、playwright-mcp、MemOS 各自有自己的授權,這些條款不會因為 my-neuro 是 MIT 就一併放寬。若你要把成品對外發布或商用,應逐一確認上游授權,這裡不構成法律意見。
維護成本主要來自兩處。一是版本推進快,v6.7.1 到 v6.7.2 只隔兩天,跟著升級需要重複驗證自己的設定與模型是否仍相容。二是依賴多,任何一個上游專案改動 API 或模型格式,都可能讓對應功能失效,而你未必能從 my-neuro 的 release note 立刻看出原因。
README 自述目前完成度接近 30%,並列出多項未勾選項目,包括真實情感、國外直播平台接入,以及作者自己列在待定考慮的變色與自由走動。這代表介面與行為在可預見的時間內還會變動。打算長期使用的人,應該把設定與角色資料備份在倉庫之外,而不是只依賴專案目錄。
編輯結論
如果你願意自己跑 LLM 與 GPT-SoVITS、接受用官網與 QQ 群文件補齊文件缺口,my-neuro 是少見把 Live2D 形象、聲音訓練、記憶與視覺放進同一個工作台的專案,MIT 授權也讓改造沒有額外顧慮。若你只想開箱即用、不打算碰模型部署,這個專案會消耗你大量時間在整合而非使用;純文字對話需求用一般 LLM 客戶端即可,不需要背這套依賴。動手前請先確認三件事:官網部署教學是否涵蓋你的顯卡與系統、肥牛整合包解壓路徑是否完全不含中文與空格、以及你要接的 MCP 工具或遊戲模組是否已在 README 的已完成清單內。
社群筆記