自动化与运维 autonomous-pentestingred-teamingattack-chain-orchestrationkali-linuxlanggraphneo4jinteractive-shellssandbox-isolation

Decepticon 自主红队代理

在授权范围内自主规划并执行完整红队攻击链。

FollowAgents 评估 · FARS-2.1
谨慎使用
65/ 100 五分制 3.3 / 5
1 2 3 4 5 6
1信任安全14 / 29 · 2.4/5

证据显示管理面与作业网络分离、专用工作负载按需启动、CI 默认仅有 contents:read 权限,并要求书面授权、RoE、ConOps、去冲突计划和 OPPLAN;这支持适度的最小权限与外部影响治理。扣分原因是代理仍可执行侦察、利用、提权、横向移动和 C2,且通过 Docker socket 管理沙箱,未提供逐项高风险操作确认机制或 RoE 强制执行代码。架构说明了 LiteLLM、PostgreSQL、Neo4j、沙箱及 HTTP 服务流向,但云托管的数据保留、遥测和第三方传输未说明。仅看到凭据配置和安全报告范围,没有密钥存储、脱敏、日志过滤或轮换细节。依赖方面有锁定安装、固定提交的 Actions、MITRE 文件校验、覆盖版本和发布镜像摘要,但未展示漏洞扫描或关键依赖处置结果。没有发现回滚、补偿操作或攻击后恢复机制,因此 rollback 为零。仓库组织、许可证、贡献者入口和安全联系提供了来源线索,但发布者身份仍未经企业注册验证。

2可靠稳定8 / 14 · 2.9/5

README、工作区配置、CI 和所示回归测试在包拆分、网络架构、知识图谱契约及测试流程上基本一致;但大量产品能力只由说明文字支持,未给出相应实现文件。依赖可用性通过 Docker/Compose 前置条件、uv 锁定同步、模型后备链、跨平台矩阵及镜像摘要得到一定保障;扣分在于系统依赖多个运行服务、容器和远程安装端点,且未提供离线或降级运行证据。测试断言包含具体错误信息,安全报告也提供备用联系渠道,但未展示面向终端用户的运行时故障诊断、重试和恢复消息。

3适用触发15 / 18 · 4.2/5

材料清楚覆盖自托管、云端、SDK、研究集成、自定义编排、开发和 CI 场景,并区分 macOS、Linux、Windows、WSL2及多种模型提供商,因此受众与环境适配证据充分。SDK与完整运行栈的边界、核心包禁止引入重型运行依赖的契约也较清楚;但具体工具权限和不支持场景未完整列出。专用组件由 ops_start、/web 或编排器按需触发,并受 engagement 文档约束;由于未提供触发器实现、目标验证和误触防护代码,未给满分。

4规范维护14 / 18 · 3.9/5

README的信息结构、文档索引、快速安装、平台前置条件、SDK说明和贡献入口都很完整。知识图谱枚举、关系类型和技术键格式有明确回归测试,可防止静默重命名,支持命名稳定性满分。示例和链接较多,但没有实际提供 FAQ 内容。已说明授权要求、SDK仍需外部服务及部分平台测试范围,不过缺少集中、完整的已知限制清单。Apache-2.0全文与元数据一致,许可证充分。SECURITY.md仅说明1.0.x支持状态,材料中没有版本发布策略或 changelog,所以版本记录较弱。维护邮箱、私密漏洞报告入口、响应时限和贡献指南明确,但责任主体的人员或治理结构不清晰,且发布者身份未知。

5有效结果9 / 13 · 3.5/5

材料描述可直接使用的 CLI、Web、SDK、交付文档、知识图谱和防御简报结构,说明输出具备操作价值;但未提供实际输出样本或独立质量证据。相较普通扫描器,持久交互会话、攻击链编排和防御闭环具有潜在增量价值,且列出了102/104的基准结果;扣分是基准由项目自身呈现,当前材料不足以核验比较方法及现实任务泛化。按需容器、eco/max/test模型档位和凭据后备链体现成本控制,但没有资源消耗、模型费用、部署负担或收益测量。

6证据核验5 / 8 · 3.1/5

主要能力可追溯到命名文档、架构说明、CI配置和少量具体回归测试,基准还指向逐题索引与追踪记录;但这些被引用文件和追踪内容未包含在证据中,无法确认多数宣传性主张。README、pyproject、CI和测试对包边界、平台支持及知识图谱契约形成一定交叉印证,不过仍全部来自同一仓库,缺乏独立来源。材料明确把 Offensive Vaccine 标为计划内容,并区分SDK和运行服务需求,事实与未来设想有一定分离;但“专业”“强化沙箱”和现实攻击能力等表述没有在给定源码中完整证明。

证据充分度: 评估于 2026年8月16日 审查版本 6cc09514d0dd
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
源码中未见的安全控制:回滚或恢复路径
使用前请注意
  • 这是可执行利用、提权、横向移动和 C2 的自主攻击工具;仅应在目标、时间窗口、允许技术和停止条件均有书面授权的隔离环境中使用。
  • Docker socket 控制与双网络 Neo4j 连接形成高影响信任边界;部署前应独立审查容器权限、网络路由、密钥挂载和沙箱逃逸面。
  • 不要把 README 中的102/104基准或“强化沙箱”描述视为独立验证;本评估未运行软件,也未获得被引用的逐题结果、追踪或完整实现证据。
  • 通过 curl|bash 或 PowerShell irm|iex 安装会直接执行远程内容;高保证环境应固定版本、先审查安装脚本,并使用发布摘要或签名验证制品。
  • 材料未展示攻击操作的逐步确认、回滚或恢复路径;应在部署层增加人工批准、强制范围校验、终止开关、审计日志和恢复预案。
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Decepticon 是面向专业红队工作的自主攻击代理,覆盖侦察、漏洞利用、权限提升、横向移动和 C2,而非只执行扫描并生成报告。系统由 16 个按攻击链阶段划分的专用代理组成,使用 LangGraph 编排,并为每个目标提供新的上下文窗口。开始行动前,它会生成 RoE、ConOps、Deconfliction Plan 和带 MITRE ATT&CK 映射的 OPPLAN,随后在这些规则内执行操作。命令运行在独立 operational network 上的 Kali Linux 沙箱中,交互式工具通过持久 tmux 会话和提示符检测进行控制;管理面包含 LiteLLM、PostgreSQL、Neo4j、Skillogy 和 LangGraph。用户可以通过终端 CLI、按需启动的 Web 控制台或 Python 客户端 SDK 使用它,但实际运行代理仍需要模型代理与沙箱等后端服务。

完整流程从 decepticon onboard 配置模型提供商、API 密钥和模型档位开始。执行红队任务时,系统先建立 RoE、ConOps、Deconfliction Plan 和带 MITRE ATT&CK 映射的 OPPLAN,再由编排代理按目标调用侦察、利用、后渗透、漏洞研究以及 AD、云、智能合约、逆向和分析等专用代理。代理在 Kali Linux 沙箱内运行命令,并通过持久 tmux 会话操作 msfconsolesliver-clientevil-winrm 等交互式程序。需要专用能力时,编排器可调用 ops_start("ad") 等操作动态启动 BloodHound CE、Sliver C2 或 Ghidra MCP;Neo4j 用于保存攻击链发现。默认 decepticon 命令启动核心管理面并进入终端 CLI,CLI 内的 /web 可按需启动 Web 控制台。作为库使用时,decepticon SDK 提供代理工厂、中间件、工具、技能、PluginBundle 插件接口和安全门,并通过 DECEPTICON_LLM__PROXY_URLSANDBOX_URL 将模型调用和命令执行发送给运行时服务。

  1. 拥有目标所有者书面授权的企业红队,希望让代理依据正式 OPPLAN 自动推进多阶段内网攻击。
  2. 渗透测试团队需要连续操作 msfconsolesliver-clientevil-winrm 等交互式工具,而不是只运行一次性扫描命令。
  3. 安全研究团队希望在隔离的 Kali Linux operational network 中评估自主攻击链,并把发现写入 Neo4j。
  4. Active Directory、云、智能合约或逆向工程人员需要按任务动态启动 BloodHound CE、Sliver C2 或 Ghidra MCP 等专用工作负载。
  5. 产品或研究团队希望通过 PyPI SDK复用代理工厂、中间件、工具和技能,并接入自有模型代理与沙箱服务。
  6. 团队希望用 XBOW validation-benchmarks 及其逐题结果、攻击类别矩阵和 LangSmith traces 检查项目公布的基准表现。

这个 Agent 有哪些优点和局限?

优点
  • 不仅执行扫描,还明确覆盖侦察、利用、权限提升、横向移动与 C2,并能按 OPPLAN 调整攻击路径。
  • 在发出网络流量前生成 RoE、ConOps、Deconfliction Plan 和 MITRE ATT&CK 映射 OPPLAN,为自主操作提供治理边界。
  • 持久 tmux 会话和自动提示符检测可直接处理常见红队交互式工具。
  • 管理网络与沙箱 operational network 分离,专用服务按需启动,降低所有组件长期常驻的需求。
  • 支持 Anthropic、OpenAI、Gemini、MiniMax、DeepSeek、xAI、Mistral、OpenRouter、Nvidia NIM 和本地 Ollama,并提供按凭据优先级构建的回退链。
  • 同时提供自托管 CLI、按需 Web 控制台、云端应用和带扩展接口的 Python SDK。
局限
  • 自托管需要 Docker、Docker Compose v2,以及 LiteLLM、数据库、知识图谱、LangGraph 和 Kali 沙箱等多项服务,运维面较大。
  • PyPI 包只是客户端 SDK;没有模型代理和沙箱运行时服务时,代理无法独立运行。
  • 模型调用依赖外部提供商凭据、订阅 OAuth 或本地 Ollama,实际成本、速率限制和能力会随所选提供商而变化。
  • 自主利用、横向移动和 C2 具有高风险,只适用于获得明确书面授权并建立严格范围控制的环境。
  • README 公布了 XBOW 基准的 102/104 通过结果,但没有在所给材料中提供真实企业网络中的误报率、稳定性或长期运行数据。
  • 部分专用能力依赖 BloodHound CE、Sliver C2 或 Ghidra MCP 等动态工作负载,会增加资源占用和部署复杂度。

如何安装或部署这个 Agent?

前置条件是 Docker 和 Docker Compose v2,并准备至少一种受支持模型提供商的凭据或受支持订阅的 OAuth 登录。macOS、Linux 或 WSL2 执行:

curl -fsSL https://decepticon.red/install | bash
decepticon onboard
decepticon

Windows 原生 PowerShell 执行:

irm https://decepticon.red/install.ps1 | iex
decepticon onboard
decepticon

支持 macOS Apple Silicon/Intel、Linux amd64/arm64,以及 Windows amd64/arm64(原生 PowerShell 或 Ubuntu/Kali WSL2)。仅安装客户端 SDK 可执行 pip install decepticon;如需知识图谱攻击链工具则执行 pip install "decepticon[neo4j]"。SDK 本身不包含完整运行环境,仍须部署 Docker 栈,或通过 DECEPTICON_LLM__PROXY_URLSANDBOX_URL 指向等价服务。

如何使用这个 Agent?

首次运行 decepticon onboard,在交互式向导中选择提供商、填写 API 密钥并选择模型档位。然后运行 decepticon:它会启动 LiteLLM、PostgreSQL、Neo4j、Skillogy、LangGraph 和沙箱等核心服务,并进入终端 CLI。需要 Web 界面时在 CLI 中输入 /web;BloodHound CE、Sliver C2、Ghidra MCP 等专用服务由编排器按需通过 ops_start(...) 启动。模型档位可选默认的 eco、全部代理使用 HIGH 层的 max,以及全部使用 LOW 层的 test。所有测试与攻击活动都必须限定在获得系统所有者明确书面授权的系统和网络内。

这个 Agent 与同类方案有什么区别?

项目提供了与 Strix、PentestGPT、MAPTA、Cyber-AutoAgent 和商业版 XBOW 等 AI 渗透测试代理的比较文档。其自述差异重点是执行完整攻击链、控制真实交互式 shell、先生成正式交战文件,以及在隔离网络中运行命令;所给材料未列出这些竞品的逐项比较数据。

常见问题

可以在没有云端模型 API 的情况下运行吗?
支持 Ollama 本地模型,但代理仍需要 LiteLLM 代理和沙箱执行等运行时服务;SDK 包本身不能单独完成运行。
模型失败或凭据不可用时如何处理?
系统根据已配置凭据的优先顺序,为每个模型层建立 primary-to-fallback 链;具体回退范围取决于实际配置的提供商。
它是否适合未经授权的公开目标测试?
不适合。项目明确要求在系统所有者给予书面授权后才能对系统或网络使用,用户需自行承担误用责任。
是否必须一直运行所有安全工具?
不必。核心管理面和沙箱持续运行,而 BloodHound CE、Sliver C2、Ghidra MCP 与 Web 控制台等工作负载按需启动。
公布的基准成绩是什么?
在 XBOW validation-benchmarks 上,项目报告 Easy 45/45、Medium 50/51、Hard 7/8,总计 102/104(98.08%)。这些数字是所给项目材料中的公布结果。

相关 Agents