Rogue — AI 智能体测评与红队平台
在攻击者之前对你的 AI 智能体进行压力测试,自动化评估与红队演练。
证据显示:CLI 支持认证类型(API_KEY、BEARER_TOKEN、BASIC_AUTH),但未明确最小权限原则;用户确认机制缺失(无交互式确认步骤);数据流透明度部分体现(README 描述架构和协议,但未详细说明数据流向);敏感数据处理有 SecretStr 类型和凭据校验,但未说明存储和传输安全;依赖安全有版本锁定和 CI 构建,但未提及漏洞扫描;外部影响有网络请求和文件输出,但未明确副作用;回滚机制未提及;来源归属有版权和许可声明,但发布者未验证。扣分原因:缺少用户确认、回滚机制,数据流和敏感数据处理细节不足。
证据显示:README 与 pyproject.toml 一致,测试文件存在,但未提供测试结果;依赖版本部分锁定,但未说明可用性保障;失败消息未在文档中明确。扣分原因:依赖可用性和失败消息缺乏证据。
证据显示:README 明确目标用户(开发者和安全团队)和场景(自动评估和红队);能力边界通过扫描类型和协议说明;触发精度通过 CLI 选项和配置说明;环境适配支持多种协议和 Python 版本。扣分原因:未明确限制和边界条件。
证据显示:README 结构清晰,有快速开始和文档链接;安装说明通过 uvx 提供;命名稳定(rogue-ai);有示例和 FAQ 链接;已知限制未明确;许可证为 MIT 加 Commons Clause,但元数据为 NOASSERTION;版本和变更日志未提供;维护责任有安全政策但未明确。扣分原因:许可证元数据不一致,版本和变更日志缺失。
证据显示:输出报告支持 Markdown、CSV、JSON,可用性高;边际价值在于提供自动评估和红队功能;成本效益未明确,但依赖较多。扣分原因:成本效益缺乏证据。
证据显示:README 声明功能,但未提供测试结果或独立验证;跨来源佐证有限;事实和推断未明确区分。扣分原因:声明缺乏可追溯性。
- 许可证元数据为 NOASSERTION,但 LICENSE.md 为 MIT 加 Commons Clause,需确认实际许可。
- 发布者未验证,身份未知,需谨慎评估。
- 依赖较多且部分版本锁定,需检查供应链安全。
- 未提供用户确认机制,可能自动执行外部操作。
- 未提供回滚机制,操作可能不可逆。
这个 Agent 能做什么,适合哪些场景?
Rogue 是一个用于 AI 智能体评估与红队演练的平台,提供两种模式:自动评估和红队攻击。自动评估可依据业务策略验证智能体行为,红队模式则模拟对抗攻击(含 75+ 漏洞、12 个安全类别、20+ 攻击技术)。架构采用客户端-服务器模式,支持 TUI(Go + Bubble Tea)和 CLI 两种界面,协议支持 A2A、MCP 和直接的 Python 函数调用。用户可通过 uvx 快速启动,并配置 judge LLM 进行智能体交互评估。评分基于 CVSS,生成可复现的报告(Markdown/CSV/JSON)。许可证为商业许可证,个人和内部使用免费,商用需授权。
Rogue 从用户提供的业务上下文和场景文件中读取配置,通过 TUI 或 CLI 连接被测智能体(如 --evaluated-agent-url),使用 judge LLM(如 openai/gpt-4o-mini)对对话进行评估。红队模式按攻击类别(编码、社交工程、注入、语义、技术)发起攻击,统计漏洞并计算 CVSS 风险评分(0-10)。支持 --random-seed 以确保可复现性。运行完成后导出 Markdown/CSV/JSON 报告。CLI 命令如 'uvx rogue-ai cli --protocol python --python-entrypoint-file ./my_agent.py --judge-llm openai/gpt-4o-mini',TUI 提供实时对话监控。
- DevOps 工程师在 CI/CD 流水线中使用 CLI 模式对智能体进行回归测试,确保策略合规。
- 安全审计员实施红队演练,使用 OWASP、MITRE 等框架评估 AI 系统漏洞。
- 开发者快速评估自建 Python 智能体,通过 --protocol python 直接测试函数。
- 产品团队在发布前验证新版本智能体是否符合业务策略。
- 合规团队按照 GDPR、EU AI Act 要求生成漏洞报告。
这个 Agent 有哪些优点和局限?
- 双模式:自动评估和红队攻击一体化。
- 支持多种协议(A2A、MCP、Python),易于集成不同智能体。
- 基于 CVSS 的风险评分,可复现扫描(随机种子)。
- 提供 TUI 实时监控对话和多种报告导出格式。
- 商业许可证,商用托管需付费,个人内部使用免费但限制多。
- 需要配置外部 LLM(OpenAI/Anthropic/Google),产生 API 费用。
- 未明确支持本地模型,依赖平台 API。
- 红队全扫描可能耗时较长(30-45 分钟)。
如何安装或部署这个 Agent?
需要 Python 3.10+ 和 uvx(安装 uv 后获得)。通过 uvx 运行:'uvx rogue-ai' 启动 TUI,或 'uvx rogue-ai cli' 用于 CLI。无需显式安装,uvx 会按需获取。需配置 LLM API 密钥(OPENAI_API_KEY、ANTHROPIC_API_KEY 或 GOOGLE_API_KEY)。
如何使用这个 Agent?
- 启动被测智能体(例如示例 T 恤商店:'uvx rogue-ai --example=tshirt_store')。2. 在 TUI 中配置 Agent URL(如 http://localhost:10001)和模式(自动评估或红队)。3. 对于 CLI:执行 'uvx rogue-ai cli --evaluated-agent-url http://localhost:10001 --judge-llm openai/gpt-4o-mini --business-context-file ./.rogue/business_context.md'。4. 查看生成的报告(默认输出到当前目录)。