模型 / 数据集
wanshuiyin/Auto-claude-code-research-in-sleep avatar
wanshuiyin/Auto-claude-code-research-in-sleep

ARIS:用 Markdown 技能包把 ML 研究交给 LLM 自动跑,不绑定任何框架

ARIS(睡眠中自动研究),用于自主 ML 研究的轻量级 Markdown 技能:跨模型审查循环、想法发现和实验自动化。无框架,无锁定,可与 Claude Code、Codex、OpenClaw 或任何 LLM 代理一起使用。

16,160 个 Star1,383 个 ForkPythonMIT
GitHub

秒懂

它是什么?
ARIS 是一套纯 Markdown 的技能集合,为 Claude Code、Codex 等代理提供跨模型评审、想法发现和实验自动化。它刻意不做成平台,但代价是你要自己组装工作流。
适合谁用?
ARIS 适合已经用 Claude Code 或 Codex 跑日常研究脚本、但受够单模型自说自话的工程师。它不适合想要开箱即用研究平台的人,因为 82 个技能全是 Markdown 文本,没有调度器、没有状态管理,你要自己把评审循环接进现有代理。
能商用吗?
可以。MIT 是宽松许可证:你可以使用、修改并销售基于它的软件,只需保留版权和许可证声明。
还在维护吗?
在维护。仓库最近一次提交在 1 天前。
用什么语言写的?
主要是 Python(依据 GitHub 的语言统计)。

以上回答依据项目的 GitHub 数据(最近同步于 2026年9月15日)和我们的分析,不构成法律意见。

开源项目深度解析

它解决的是单模型自评的信任问题

自动 ML 研究最常见的翻车点是:同一个模型既做实验又写报告,它倾向于把自己的输出说得比实际好。README 里举的例子很直白,一个运行报告 +6.2,实际只动了 +1.4。ARIS 的核心思路是拆开这两个角色,让一个模型做研究,另一个模型独立评审,再把评审结果写回 Markdown 文件。它不检测 AI 文本,也不声称能抓住所有造假,它只是把流程变成可审计的循环。这个项目针对的是已经信任 LLM 能跑实验、但不信任它自我评估的人。

82 个 Markdown 技能,没有运行时

ARIS 不是软件,是一堆 SKILL.md 文件。仓库里按技能目录组织,每个技能就是一份 Markdown 指令,告诉代理该做什么、按什么顺序做。README 说共有 82 个技能,涵盖想法发现、实验自动化、跨模型评审。没有 Python 包要装,没有守护进程要起,代理直接读文件就能执行。这种设计的优点是零依赖,缺点是所有逻辑都藏在提示词里。你无法用单元测试验证一个技能是否可靠,只能靠跑完整流程看结果。对追求可复现的团队,这可能是硬伤。

跨模型评审是怎么转起来的

文档描述的工作流是:主模型产出一份研究笔记,然后另一个模型(比如 Codex)作为独立评审者读这份笔记,挑出逻辑漏洞、数据不一致或过度声称。评审意见再喂回主模型,让它修订。这个循环被封装成技能,代理按 SKILL.md 的步骤执行。关键点是评审模型必须真的独立,如果两个模型共享上下文或系统提示,评审就退化成自说自话。ARIS 没有强制隔离机制,它靠的是调用不同代理的 CLI,比如 Claude Code 和 Codex 各跑各的。这意味着你要手动管理两个代理的会话,ARIS 只提供指令文本。

安装与接入:从零到跑通的实际命令

最直接的用法是把它当技能目录拷进你的代理配置。以 Claude Code 为例,你把 skills/ 下的目录放进项目的 .claude/skills/,代理就能通过 /skill-name 调用。对 Codex CLI,仓库里有 skills/skills-codex/ 的适配版。若你用 DeepSeek Harness,安装是一条命令:dsh plugin --profile web add dsh-aris,它会从 npm 拉包,但要求 pnpm 在 PATH 里。ARIS 还带一个极简监视器 ARIS-Monitor,在 aris-monitor 目录下跑 ./run.sh 就能弹出一个置顶小窗,显示哪些会话在等你审批。这个工具不是必需的,但能省去来回切终端的麻烦。

没有框架,意味着你要自己管状态

ARIS 的卖点是 no lock-in,但代价是它不提供任何状态管理。研究笔记、评审意见、修订记录全是你自己的 Markdown 文件,ARIS 不追踪版本,不保证一致性。如果两个技能同时写同一个文件,冲突由你解决。README 提到它用 research-wiki 做记忆,但那是给 ARIS-Movie-Director 的,不是这个仓库的默认组件。对于单次研究任务,这没问题。但如果你指望它跑一周的自动化实验,中间断掉要恢复,ARIS 帮不上忙,你得自己写脚本检查哪个步骤完成了。

维护成本与许可证边界

项目用 MIT 许可证,你可以随意复制、修改、商用。但注意,仓库里关联了多个周边项目,比如 Anti-Autoresearch 和 HERO,它们各自独立维护。ARIS 本身最近一次更新是 2026 年 8 月,v0.4.24 和 v0.4.23 相隔一周,说明迭代活跃。但活跃不代表稳定,技能文件没有版本锁定,你更新仓库后,代理的行为可能变化。如果 fork 了自己改,上游更新不会自动合并,你需要手动对比 SKILL.md 的改动。对长期使用,建议把用到的技能复制进自己的仓库,而不是直接依赖这个仓库的 main 分支。

替代方案:用现成的 Agent 框架还是裸提示词

如果你想自动跑研究,另一个路线是用 LangGraph 或 CrewAI 这类框架,它们把多代理协作写成代码,有显式的状态图、重试逻辑和可测试的节点。ARIS 的差别在于它把同样的逻辑压进 Markdown,让代理自己解释执行。框架给你确定性,但绑定 Python 生态和抽象层;ARIS 给你灵活性,但把可靠性押在 LLM 的指令遵循能力上。如果你的团队已经有成熟的代理编排,ARIS 的跨模型评审思路可以借鉴,但没必要迁移。如果你只是一个人用 Claude Code,ARIS 的零依赖设计反而更轻。

编辑结论

ARIS 适合已经用 Claude Code 或 Codex 跑日常研究脚本、但受够单模型自说自话的工程师。它不适合想要开箱即用研究平台的人,因为 82 个技能全是 Markdown 文本,没有调度器、没有状态管理,你要自己把评审循环接进现有代理。采用前先验证三件事:你的代理能否稳定执行 SKILL.md 里的多步指令;跨模型评审时,评审模型是否真的独立于主模型;以及你能否接受输出质量依赖提示词而非代码约束。ARIS 的 MIT 许可证让你随便改,但改完的维护成本落在你身上,上游只保证自己的分支能跑。若你只想要一个能自动写论文摘要的工具,ARIS 是杀鸡用牛刀,直接让代理读你的 README 更快。

官方来源

  1. Official README
  2. Project repository
  3. Release notes
社区笔记

社区笔记