my-neuro:把 Live2D 角色、TTS 微调与长期记忆拼成一个桌面 AI 工作台
This project lets you create your own AI desktop companion with customizable characters and voice conversations that respond in just 1 second. Features include long-term memory, visual recognition, voice cloning and LLM training. Compatible with various Live2D customizations.
秒懂
- 它是什么?
- 这是一个用 JavaScript 串起 LLM、GPT-SoVITS、Live2D 与 MemOS 的桌面伴侣项目,README 把它定位成工作台而非成品。本文只看仓库里能核实的东西:它拼了哪些模块、怎么跑起来、哪些承诺还停留在计划清单里。
- 适合谁用?
- 适合愿意自己折腾模型权重和 Python 环境的人:你要的如果是可换音色、可换 Live2D 形象、能接本地 LLM 的桌面角色,my-neuro 提供的是现成模块和接线图。不适合只想双击安装就得到一个稳定陪伴产品的人,README 自己写明当前完成度约 30%,情绪状态、国外直播平台接入仍是未勾选项。
- 能商用吗?
- 可以。MIT 是宽松许可证:你可以使用、修改并销售基于它的软件,只需保留版权和许可证声明。
- 还在维护吗?
- 在维护。仓库最近一次提交在 2 天前。
- 用什么语言写的?
- 主要是 JavaScript(依据 GitHub 的语言统计)。
以上回答依据项目的 GitHub 数据(最近同步于 2026年9月15日)和我们的分析,不构成法律意见。
开源项目深度解析
它解决的是拼装问题,不是模型问题
桌面 AI 伴侣这类需求,难点从来不在单个模型。语音合成有 GPT-SoVITS,记忆有 MemOS,Live2D 有现成的模型文件,LLM 有本地推理和闭源 API 两条路。真正费时间的是让这些部件在同一台机器上按同一条时间线跑:麦克风输入进来,语音识别转文字,LLM 生成回复,TTS 出声,同时字幕和 Live2D 口型跟上,中途还要能被用户打断。my-neuro 把自己称为工作台,README 里那句「利用打包好的工具,一步步亲手描绘并实现心中理想的 AI 形象」说的就是这层定位。它的目标用户是愿意训练自己声音模型、替换自己 Live2D 形象的人,而不是找一个开箱即用的角色。README 也直接承认打包了一个叫肥牛的角色,并说明它参考了 neuro-sama,个性设定为腹黑、傲娇、有小脾气。
数据流:从麦克风到 Live2D 口型的那条链路
README 里放了一张 runtime-flow-dark-tech-cn.svg 的流程图,但没有把节点文字展开,所以只能从功能清单反推链路。可确认的环节包括:语音输入与键盘输入并存,语音和字幕同步输出,TTS 默认使用 GPT-SoVITS,视觉能力被单独列出并强调「通过语言意图判断何时启动视觉功能」,也就是说图像识别不是每轮都跑,而是由模型先判断当前对话是否需要看图。实时打断支持语音和键盘两种方式,这意味着播放音频的进程必须可被中断,而不是等整段合成播完。长期记忆交给 MemOS,README 在致谢部分把它列为引用的开源项目。MCP 工具接入和 playwright-mcp 也在引用列表里,对应桌面控制和网页操作。整体看,这是一个把多个独立进程编排在一起的架构,JavaScript 是主语言,但 TTS 训练和本地 LLM 推理那部分落在 LLM-studio 文件夹,README 说明那里有本地模型的推理与微调指导。
部署:官网教程加整合包,两条路
README 没有在仓库内写完整安装步骤,而是指向官网 mynewbot.com/tutorials,这一点需要在动手前注意,因为仓库文档和官网教程可能不同步。第二条路是百度网盘上的新人整合包,README 给了一个明确的约束:文件路径不能有中文、空格、括号等字符。这个限制通常来自 Python 环境和某些依赖对路径的解析方式,属于实际部署中最早会踩到的坑。想要全本地推理的人,README 指向 LLM-studio 文件夹,里面是本地大语言模型的推理和微调指导。语音定制方面,项目支持男声、女声和不同角色声线切换,默认 TTS 是 GPT-SoVITS,训练支持也在功能清单里勾选。发布记录显示 v6.7.2 是 2026 年 9 月的正式版,另有一个 exe3.0 安装包,说明作者在维护打包分发这条线。
一秒延迟这个数字,取决于你放哪块模型
功能清单里写着「超低延迟:全本地推理,对话延迟在1秒以下」。这个前提条件很关键,它绑定的是全本地推理这条路径。一旦把 LLM 换成闭源 API,网络往返就会叠加上去,延迟不再由项目控制。反过来,全本地推理意味着你需要一块能同时承载语音识别、LLM 和 TTS 的显卡,而 GPT-SoVITS 的训练又是另一档资源需求。README 没有给出显存下限或推荐配置,这一点在仓库材料里查不到,只能按各上游项目自己的要求去核对。另一个容易被忽略的约束是语言:功能清单里有一条「字幕显示中文,音频播放是外语,可自由开启关闭」,这条是为 TTS 模型本身就是外语的角色准备的,说明字幕和音频走的是两条独立的语言通道。
未勾选的那几项,才是这个项目真正想做的事
计划清单里未完成的项目很能说明作者的意图:真实情感,即模拟真人的情绪变化状态,有自己的情绪状态;超吊的人机体验;国外直播平台的接入;以及模型自己想要的功能里的变色和自由走动。README 结尾部分写当前实现了将近 30% 的功能,并提到会围绕持续的情绪状态开发,同时给出过 6 月 1 日达到 60% 完成度的说法。这里需要区分两件事:已经勾选的长期记忆、主动对话、游戏陪玩是能用的,而情绪状态是一个尚未落地的设计目标。主动对话在 README 里被标注为 V1,这个版本号本身就是一种提醒,说明它的上下文触发逻辑还在早期。把这两类功能混在一起看,容易对项目成熟度产生误判。
和直接写一个 Discord 机器人相比,差别在哪
如果目标只是让一个 LLM 在聊天窗口里回话,Python 里几十行就能接一个 API,完全不需要这个项目。my-neuro 的差异在于它把角色表现层做成了可替换的部件:Live2D 模型可以换,音色可以训练,表情和动作根据对话内容触发,音效库由模型自己决定播放哪一段,还能在哔哩哔哩直播、讲一堂课、陪你玩我的世界或 galgame。这些能力各自都有独立的上游项目,比如玩我的世界用的是 mindcraft-bots/mindcraft,网页操作走 microsoft/playwright-mcp。my-neuro 做的是把它们接到同一个角色身上,让记忆和人格在不同场景之间保持连续。代价是这套东西的调试面比一个聊天机器人宽得多,任何一环出问题,表现上都是角色不说话或者反应不对。
MIT 许可覆盖的是代码,不覆盖你训练出来的东西
仓库标注的许可是 MIT,这意味着代码本身可以修改、分发、商用,保留版权声明即可。但项目引用的上游各有各的许可:GPT-SoVITS、MemOS、mindcraft、playwright-mcp 都不在 MIT 之下,其中语音克隆还牵涉声音来源的授权问题。你自己训练的音色模型、你使用的 Live2D 模型文件,其权利状态由素材来源决定,和 my-neuro 的 MIT 无关。README 里提到肥牛这个角色是对 neuro-sama 的模仿,这类角色形象的使用边界同样不在代码许可的讨论范围内。这些不是法律意见,只是提醒在把项目用于公开直播或商业场景前,需要单独核对每一层素材的来源。
维护节奏与升级时要留意的点
从发布记录看,v6.7.1 到 v6.7.2 相隔两天,exe3.0 安装包与 v6.7.2 在同一天发布,说明作者在密集迭代,同时维护源码版和打包版两条分发线。这种节奏对使用者是双面的:修 bug 快,但版本之间行为变化的可能性也高,尤其是 TTS 和记忆这类依赖上游项目的模块。项目没有在仓库里提供迁移文档,升级时能依靠的是官网教程和 release note。README 提到 web 网页界面已经做好近期会接入,安卓手机应用也在清单里,这两项如果落地,部署形态会从纯桌面扩展到多端,届时配置项的分布方式可能变化。想跟版本的人,建议在升级前把当前的模型权重和配置文件单独留一份,因为语音训练成果通常不在 git 管理范围内。
编辑结论
适合愿意自己折腾模型权重和 Python 环境的人:你要的如果是可换音色、可换 Live2D 形象、能接本地 LLM 的桌面角色,my-neuro 提供的是现成模块和接线图。不适合只想双击安装就得到一个稳定陪伴产品的人,README 自己写明当前完成度约 30%,情绪状态、国外直播平台接入仍是未勾选项。动手前先确认三件事:官网 mynewbot.com/tutorials 的部署流程是否仍与 v6.7.2 对应,GPT-SoVITS 训练所需显卡显存是否够,以及你能否接受角色人格与声音都由自己训练这一前提。
社区笔记