Decepticon:把红队作战纪律写进自主 Agent 的尝试
Autonomous Hacking Agent for Red Team
秒懂
- 它是什么?
- Decepticon 是一个自称专业级自主红队 Agent 的开源项目,强调在 RoE、ConOps、Deconfliction Plan 和 OPPLAN 的约束下执行完整攻击链。本文基于仓库材料分析其架构、运行方式、局限与适用场景。
- 适合谁用?
- Decepticon 适合有明确授权范围、愿意投入 Docker 与 LLM 基础设施的成熟红队或安全研究团队,用于在受控靶场或授权环境中演练完整攻击链。不适合把 nmap 输出当报告就能交差的初级用户,也不适合没有法律授权就运行任何渗透工具的个人。
- 能商用吗?
- 可以。Apache-2.0 是宽松许可证:你可以使用、修改并销售基于它的软件,只需保留版权和许可证声明。
- 还在维护吗?
- 在维护。仓库最近一次提交在 16 天前。
- 用什么语言写的?
- 主要是 Python(依据 GitHub 的语言统计)。
以上回答依据项目的 GitHub 数据(最近同步于 2026年9月15日)和我们的分析,不构成法律意见。
开源项目深度解析
一个宣称不是扫描器的红队 Agent
Decepticon 的 README 用一句自嘲开场,说市面上很多 AI 黑客工具不过是跑个 nmap 再写报告。它想把自己定位成专业级自主红队 Agent,能执行侦察、利用、提权、横向移动、C2 这样的完整攻击链,而不是逐项扫描。这个定位针对的是那些需要模拟真实对手的渗透测试团队,而不是想省事的脚本小子。项目主页和文档站都指向 decepticon.red,仓库里还有比较文档,列出与 Strix、PentestGPT、MAPTA 等同类工具的差异。但仓库材料没有给出这些对比的具体内容,所以这里只能确认它存在,无法评价其优劣。
RoE 与 OPPLAN:先定规则再发包
Decepticon 最核心的设计主张是,任何攻击动作发生之前,它先生成一套完整的交战包,包括 RoE(交战规则)、ConOps(行动概念)、Deconfliction Plan(冲突消解计划)和带 MITRE ATT&CK 映射的 OPPLAN。按 README 的说法,每个动作都运行在这些定义的规则之内。这等于把红队项目里先写授权书和行动计划的做法搬进了 Agent 的工作流。实际效果取决于这些规则如何被强制,仓库只给了概念,没有展示规则违反时系统如何中断。这一点值得潜在用户在部署后专门测试,因为声明和实现之间常有距离。
架构:LangGraph 编排,Neo4j 存知识图谱
从安装说明可以看出,Decepticon 的核心管理平面包含 LiteLLM、PostgreSQL、Neo4j、Skillogy、LangGraph 和一个 sandbox。其中 LangGraph 负责编排 Agent 的工作流,Neo4j 作为知识图谱存储攻击链相关信息。仓库提到可以通过 pip 安装 SDK,并选择安装 neo4j 扩展来使用知识图谱攻击链工具。SDK 本身只包含 agent 工厂、中间件、工具和技能,真正的 LLM 调用和沙箱执行通过 HTTP 路由到运行时服务,环境变量包括 DECEPTICON_LLM__PROXY_URL 和 SANDBOX_URL。这个设计意味着 Decepticon 不是一个单体内置模型的应用,它依赖外部服务来跑模型和隔离命令,这既是灵活性也是部署负担。
部署:一行脚本拉起一堆容器
官方推荐的安装方式是 Docker Compose v2,支持 macOS、Linux 和 Windows。macOS 或 Linux 用户执行 curl -fsSL https://decepticon.red/install | bash,然后运行 decepticon onboard 做交互式配置,选择 provider、API key 和模型 profile,最后输入 decepticon 启动核心栈并进入终端 CLI。默认启动会拉起的组件包括 LiteLLM、PostgreSQL、Neo4j、Skillogy、LangGraph 和 sandbox。像 BloodHound CE、Sliver C2、Ghidra MCP 这类专用负载按需启动,编排器通过 ops_start("ad") 之类的命令生成,Web 仪表盘则要在 CLI 里用 /web 调出。Windows 原生用户用 PowerShell 执行 irm https://decepticon.red/install.ps1 | iex,流程相同。整个部署明显面向愿意管理多容器环境的人,不是开箱即用的小工具。
作为库使用:SDK 与运行时分离
除了 Docker 整套部署,Decepticon 也发布到 PyPI,可以用 pip install decepticon 安装核心 SDK,或用 pip install "decepticon[neo4j]" 额外获得知识图谱工具。但这个 SDK 只是客户端,它把 LLM 调用和沙箱执行转发到远程服务,所以即便只写几行代码,你仍然需要跑起 Docker 栈或自己提供兼容的运行时。README 提到可以通过工厂覆盖和声明式 PluginBundle 插件来定制 agent,还有一道 safety gate,但没有具体说明 safety gate 的机制。这种库与运行时分离的模式适合想构建自己编排器的研究项目,但如果你只想快速跑一个演示,直接走 Docker 可能更省事。
基准数据:98% 通过率背后的样本问题
仓库展示了一份 XBOW validation-benchmarks 的通过率表格,总成绩 102/104,约 98.08%。分难度看,Easy 级别 45/45 满分,Medium 50/51,Hard 只有 7/8。这个数据的问题在于样本量极小,Hard 级别只有 8 道题,少一道就掉 12.5 个百分点。而且这些基准是仓库自己链接的 xbow-validation-benchmarks,没法确认是否与商业 XBOW 的评测完全一致。README 还提到有 LangSmith traces 和与 Strix、PentestGPT 等工具的对比文档,但那些文档的具体内容不在本次材料里。读者不应把 98% 当作真实攻防能力的证明,它更像是特定题目集上的一个参考点。
许可证与维护成本
项目采用 Apache-2.0 许可证,这对商业使用相对友好,但要注意它不提供任何担保,自主攻击代码的后果由使用者承担。仓库最后推送时间是 2026 年 8 月,近期发布频繁,v1.1.38 到 v1.1.40 间隔只有两周左右,说明项目处于活跃迭代期。频繁更新意味着升级成本不低,特别是 Docker 栈涉及 LiteLLM、Neo4j 等多个组件,每次版本跳跃可能需要重新验证配置兼容性。项目还提供托管云版本 app.decepticon.red,不想自己维护基础设施的人可以直接用浏览器跑,但这又带来数据安全和授权范围的问题,红队操作日志放在第三方服务上是否合规,需要用户自己判断。
替代方案与定位判断
README 里提到的同类工具包括 Strix、PentestGPT、MAPTA 和 Cyber-AutoAgent,以及商业版 XBOW。虽然具体对比内容不在材料里,但从命名可以推断,PentestGPT 这类项目更偏向对话式辅助,把 LLM 当作建议生成器,而 Decepticon 想做成自主执行 Agent。XBOW 商业产品可能更强调闭环验证,但它是闭源的。Decepticon 的差异点在于把红队交战规则文档化并纳入执行流程,这是多数开源 pentest agent 不做的。如果你的需求只是生成测试建议或报告,PentestGPT 这类轻量工具可能更合适,而 Decepticon 的容器栈和规则系统对你就是过度设计。反过来,如果你要模拟真实横向移动和 C2,扫描器加报告的模式确实不够。
编辑结论
Decepticon 适合有明确授权范围、愿意投入 Docker 与 LLM 基础设施的成熟红队或安全研究团队,用于在受控靶场或授权环境中演练完整攻击链。不适合把 nmap 输出当报告就能交差的初级用户,也不适合没有法律授权就运行任何渗透工具的个人。采用前应先在隔离靶场验证其 RoE 与 Deconfliction Plan 是否真的能阻止越界动作,并检查自身 LLM 服务与 sandbox 的兼容性。根据仓库材料,其 XBOW 基准通过率看似亮眼,但样本量小且难度分布不均,不能作为真实对抗能力的唯一依据。
社区笔记