自动化与运维 llm-securityred-teamingvulnerability-scanningguardrailspythoncli

DeepTeam - LLM红队测试框架

对LLM和AI智能体进行安全渗透测试的开源框架,模拟越狱、提示注入等多轮攻击,提供生产级防护栏。

FollowAgents 评估 · FARS-2.1
不推荐
29/ 100 五分制 1.5 / 5
1 2 3 4 5 6
1信任安全0 / 29 · 0.0/5

证据显示仓库未提供权限管理、用户确认、数据流透明性、敏感数据处理、依赖安全、外部影响、回滚或来源归属的说明。所有信任相关标准均未得到满足,因此评分为0。

2可靠稳定3 / 14 · 1.1/5

自一致性:README和pyproject.toml中的版本号一致(1.0.8),但未提供内部一致性证据,如API文档与代码的一致性。依赖可用性:依赖列表明确,但未提供锁定文件或版本范围验证。失败消息:未提供错误处理或失败消息的文档。

3适用触发8 / 18 · 2.2/5

受众与场景:README明确面向LLM安全工程师,提供了多种漏洞和攻击场景。能力边界:未明确说明框架的局限性或适用边界。触发精度:未提供详细的配置选项或触发条件。环境适配:支持Python 3.9-3.14,但未说明操作系统或硬件要求。

4规范维护8 / 18 · 2.2/5

信息架构:README结构清晰,包含快速入门、功能列表等。安装说明:提供了pip安装命令。命名稳定性:未提供命名约定或API稳定性说明。示例与FAQ:提供了多个代码示例,但无FAQ。已知限制:未提及。许可证:Apache-2.0许可证文件完整。版本与变更日志:pyproject.toml中有版本号,但无变更日志。维护责任:作者信息明确,但未说明维护政策。

5有效结果7 / 13 · 2.7/5

输出可用性:提供了风险评估结果的数据框和JSON保存方式。边际价值:提供了50+漏洞和20+攻击,具有明显价值。成本效益:未提供性能或成本数据。

6证据核验3 / 8 · 1.9/5

声明可追溯性:README中的功能声明未提供测试或证据支持。跨来源佐证:未提供外部验证。事实与推断分离:未明确区分事实和推断。

证据充分度: 评估于 2026年8月9日 审查版本 2a5588c88837
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
源码中未见的安全控制:最小权限约束、执行前用户确认、数据流向说明、敏感信息处理、依赖安全审查、外部影响披露、回滚或恢复路径、来源归属可核验
使用前请注意
  • 未提供权限管理或用户确认机制,可能默认执行高权限操作。
  • 依赖未锁定版本,存在供应链风险。
  • 未说明敏感数据处理方式,可能泄露数据。
  • 未提供回滚机制,错误操作难以恢复。
评估证据 [1][2][3][4][5][6][7]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

DeepTeam是一个开源的红队测试框架,用于评估和加固LLM系统、AI智能体、RAG流水线和聊天机器人。它通过50多种现成的漏洞检测(如偏见、PII泄露、SQL注入)和20多种研究支持的对抗性攻击方法(如提示注入、Crescendo越狱)来模拟真实攻击。所有评估均在本地运行,利用LLM-as-a-Judge指标生成二进制的通过/失败评分,并附有推理过程。它还提供7种生产级防护栏,用于实时监控LLM输入和输出,并可对接OWASP、NIST、MITRE等安全框架。DeepTeam支持通过Python API或CLI使用,基于DeepEval构建,且可集成Confident AI平台以管理和监控风险。

DeepTeam接收一个模型回调函数(model_callback),该函数封装了待测的LLM系统。它会根据指定的漏洞(如Bias、Toxicity)和攻击方法(如PromptInjection、Crescendo Jailbreak)动态生成对抗性输入,模拟攻击。然后利用LLM-as-a-Judge指标(如BiasMetric)对模型输出进行二分评分(0或1),计算出漏洞的通过率。所有过程均在本地进行,无需预设数据集。此外,用户可通过CLI(YAML配置)或Python编程方式运行红队测试。它还提供Guardrails类,支持输入和输出安全保护,例如PromptInjectionGuard、PrivacyGuard。最终生成风险评估报告,可保存为JSON格式,并可上传到Confident AI平台进行管理和监控。

  1. 安全工程师评估内部LLM应用对提示注入和越狱攻击的抵抗力,利用CLI或Python API快速扫描漏洞。
  2. AI开发者在部署前对RAG流水线进行红队测试,检测PII泄露和提示泄露等数据隐私风险。
  3. 企业安全团队对照OWASP Top 10或NIST AI RMF框架,确保模型符合行业安全标准。
  4. 需要生产环境实时防护的团队,通过Guardrails API对LLM输入和输出进行实时分类和拦截。
  5. 智能体开发者利用Agentic漏洞(如Goal Theft、Excessive Agency)检测多代理系统的安全性。
  6. 希望集中管理红队测试结果和监控生产环境漏洞的团队,集成Confident AI平台。

这个 Agent 有哪些优点和局限?

优点
  • 本地运行,无需外部服务,保护数据隐私
  • 50+漏洞库和20+攻击方法,覆盖全面
  • 与OWASP、NIST等安全框架直接映射
  • 提供生产级防护栏,可实时拦截风险
  • 支持CLI和Python API,集成灵活
局限
  • 依赖LLM作为评判者,评估准确性受模型质量影响
  • 需要编写model_callback来集成待测系统,并非开箱即用
  • 多轮攻击方法可能消耗较多计算资源和时间
  • 部分高级功能(如Confident AI平台)需要额外注册和付费

如何安装或部署这个 Agent?

使用pip安装:pip install -U deepteam。需要设置OPENAI_API_KEY环境变量(或使用DeepEval支持的自定义模型)。

如何使用这个 Agent?

  1. 导入模块:from deepteam import red_team; from deepteam.vulnerabilities import Bias; from deepteam.attacks.single_turn import PromptInjection。2. 定义异步model_callback函数,接收字符串输入并返回字符串输出。3. 调用red_team(model_callback=..., vulnerabilities=[Bias(types=["race"])], attacks=[PromptInjection()])。4. 运行脚本,即可在本地生成风险评估结果。

常见问题

DeepTeam支持哪些LLM作为评判者?
DeepTeam使用任何LLM(如OpenAI)作为评判者,也支持DeepEval支持的自定义模型。
我可以测试自己的漏洞类型吗?
是的,DeepTeam提供自定义漏洞类,可以定义自己的评判标准和测试逻辑。
DeepTeam是否能够在生产环境中使用?
可以,它提供7种防护栏API(如PromptInjectionGuard、ToxicityGuard),可以集成到生产流水线中实时检测和拦截风险。
我的LLM系统没有API接口,能用DeepTeam测试吗?
你需要将系统封装成一个函数(model_callback),该函数接受字符串输入并返回字符串输出,之后就可以测试。

相关 Agents