效率与协作 task-planningdocker-composeweb-browserpython-notebookfile-editorshell-executionrapidapi

XAgent

通过规划、执行工具与人工协作处理复杂多步骤任务的自托管实验性系统。

FollowAgents 评估 · FARS-2.1
不推荐
42/ 100 五分制 2.1 / 5
1 2 3 4 5 6
按维度查看评分与理由
1信任安全8 / 29 · 1.4/5

证据显示:README声称所有操作限制在docker容器内,但未提供具体权限配置或最小权限原则的说明;有AskForHumanHelp工具,但未说明用户确认机制;数据流透明度仅提及记录运行信息,未详细说明数据流向;敏感信息处理方面,README声称从记录中移除API密钥,但未说明其他敏感数据处理;依赖安全未提及漏洞扫描或版本锁定;外部影响方面,有shell工具可执行任意命令,但未说明限制;回滚方面,有记录可复现,但未说明回滚机制;来源归属方面,有贡献者列表和引用,但未验证。扣分原因:缺乏具体安全配置和权限管理细节。

2可靠稳定6 / 14 · 2.1/5

证据显示:README和代码结构一致,但未提供完整的错误处理文档;依赖列表存在,但未说明版本兼容性;失败消息方面,未提供用户可理解的错误提示。扣分原因:依赖可用性未验证,失败消息不明确。

3适用触发10 / 18 · 2.8/5

证据显示:README描述了多种应用场景,如数据分析、推荐、模型训练;能力边界有说明,如支持的工具列表;触发精度方面,任务描述由用户提供,但未说明如何精确触发;环境适配方面,要求Python>=3.10和docker,但未说明其他环境要求。扣分原因:触发精度和边界条件不够明确。

4规范维护8 / 18 · 2.2/5

证据显示:README结构清晰,有快速开始、演示、评估等章节;安装说明详细,包括docker和pip安装;命名稳定性方面,项目名称和主要组件名称一致,但未提供版本历史;示例和FAQ有演示案例,但无FAQ;已知限制未明确列出;许可证为Apache-2.0,但未提供版本变更日志;维护责任方面,有贡献者列表,但未明确维护者。扣分原因:缺少版本变更日志和明确的已知限制。

5有效结果7 / 13 · 2.7/5

证据显示:输出可用性方面,有本地工作区和运行记录,但未说明输出格式;边际价值方面,与AutoGPT对比显示优势,但未提供具体数据;成本效益方面,需要OpenAI API密钥,但未说明成本。扣分原因:成本效益未量化。

6证据核验3 / 8 · 1.9/5

证据显示:README中的声明如'总胜率'未提供具体数据或链接;跨来源验证方面,有外部链接如博客和文档,但未提供独立验证;事实与推断分离方面,README将性能声明与描述混合,未明确区分。扣分原因:声明缺乏可追溯性。

证据充分度: 评估于 2026年8月9日 审查版本 0dea79924347
源码中未见的安全控制:依赖安全审查
使用前请注意
  • 未提供具体的安全配置和权限管理细节,建议审查docker配置和工具权限。
  • 依赖列表未锁定版本,存在供应链风险。
  • 性能声明缺乏具体数据和可复现性,建议谨慎对待。
评估证据 [1][2][3][4][5]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

XAgent 是一个开源、实验性的 LLM 驱动自主任务系统,目标是自动解决多种复杂任务。它由 Dispatcher、Planner 和 Actor 组成:前者动态实例化并分派任务,Planner 将任务拆成子任务和里程碑,Actor 借助工具完成子任务或向人类求助。实际执行发生在 Docker 化的 ToolServer 中,提供文件编辑、Python Notebook、网页浏览、Shell 和 Rapid API 能力。用户可通过 `python run.py` 命令行提交任务,也可访问运行在 5173 端口的 Web GUI;运行产物、状态、工具调用和模型输入输出会保存到本地记录目录。该项目要求配置 OpenAI API 密钥,并明确建议使用 `gpt-4-32k` 或 `gpt-4`,将 `gpt-3.5-turbo-16k` 作为备用模型。

用户先在 assets/config.yml 中配置 OpenAI API 密钥,然后用 python run.py --task "put your task here" --config-file "assets/config.yml" 提交任务,也可用 --upload-files 提交初始文件。Dispatcher 为任务分派不同 Agent,Planner 生成和修正计划、子任务与里程碑,Actor 在 ToolServerNode 中执行工作。ToolServer 可读取、写入和修改文件,在 Python Notebook 中运行 Python 代码,使用 Web Browser 搜索和访问网页,通过 Shell 执行 Bash 命令、安装程序或托管服务,并通过 Rapid API 检索和调用 API。执行期间产生的文件位于 local_workspace;完成后 ToolServerNode 的整个 workspace 会复制到 running_records,其中还记录任务状态、模型输入输出、所用工具和代码执行状态。设置 record_dir 后,可从既有记录重现一次运行。

  1. 数据分析人员上传 iris.zip,让系统检查数据和 Python 环境、编写分析代码,并根据执行结果生成分析报告。
  2. 需要安排聚餐的用户先提出餐厅推荐请求;当地点、预算、菜系或饮食限制不足时,系统可通过 AskForHumanHelp 请求补充信息。
  3. 机器学习实践者需要分析电影评论时,可让系统下载 IMDB 数据集、训练 BERT 模型并输出情感预测。
  4. 需要完成多阶段网页检索、文件处理和命令行操作的个人,可将任务交给 Planner 拆分为子任务和里程碑后执行。
  5. 希望审计或复现一次自动化任务运行的团队,可检查 running_records 中的配置、查询、工具使用、模型交互和执行状态。

这个 Agent 有哪些优点和局限?

优点
  • 将动态任务分派、计划生成与修正、工具执行明确拆分为 Dispatcher、Planner 和 Actor 三个组件,适合需要分阶段完成的任务。
  • ToolServer 将文件编辑、交互式 Python、浏览器、Bash 和 Rapid API 集合在 Docker 容器中,覆盖数据处理、网页检索和环境操作等执行环节。
  • 提供 CLI 与本地 Web GUI 两种入口,并保存工作区、任务状态、模型输入输出、工具使用和代码执行状态,便于复查与复现。
  • 支持在信息不足时通过 AskForHumanHelp 向用户追问,使任务执行可纳入人工协作。
局限
  • 运行依赖 Docker、Docker Compose、Python 3.10+ 和 OpenAI API 密钥;文档没有给出其他模型提供商的支持路径。
  • 项目自称仍处于早期实验阶段,采用前应自行评估稳定性、维护成本和任务适配程度。
  • Shell 能执行 Bash 命令、安装程序和托管服务;虽然 README 表示操作受 Docker 容器约束,使用者仍需审查容器配置和任务输入。
  • README 不建议以 gpt-3.5-turbo 运行,并建议使用 gpt-4-32kgpt-4,模型可用性和成本可能影响部署。

如何安装或部署这个 Agent?

先安装 Docker 和 Docker Compose。随后在项目目录运行 docker compose up 拉取并启动 ToolServer,或运行 docker compose build 后再运行 docker compose up 从本地源码构建;后台运行可使用 docker compose up -d。安装 Python 依赖:pip install -r requirements.txt,运行环境要求 Python 3.10 或更高版本。在 assets/config.yml 中至少配置一个 OpenAI API 密钥;若修改 XAgentServer 的配置文件路径,修改 .env 中的 CONFIG_FILE 并重启容器。

如何使用这个 Agent?

ToolServer 启动后,运行 python run.py --task "put your task here" --config-file "assets/config.yml" 执行第一个任务。可额外传入 --upload-files 选择初始提交文件。Web 界面可访问 http://localhost:5173,README 给出的默认凭据为用户名 guest、密码 xagent。执行后的生成文件在 local_workspace,完整运行记录在 running_records;如需从记录复现,将配置中的 record_dir 设为相应记录目录。

这个 Agent 与同类方案有什么区别?

README 描述了在 50 多个真实世界复杂任务上的人工偏好评估,并称 XAgent 相比 AutoGPT 获得总体胜出;所给材料未提供具体胜率或实验细节。

常见问题

运行 XAgent 需要哪些凭据?
必须在 assets/config.yml 中至少提供一个 OpenAI API 密钥。README 建议使用 gpt-4-32kgpt-4,并要求至少提供一个 gpt-3.5-turbo-16k 密钥作为备用。
它会在宿主机直接执行命令吗?
README 将 ToolServer 描述为 Docker 容器,并表示行动受容器约束。该容器中的 Shell 可执行 Bash 命令、安装程序和托管服务。
任务运行后能否审计或复现?
可以。running_records 保存任务状态、模型输入输出、所用工具和代码执行状态;设置 record_dir 可从一份记录重现既有运行。
能否通过网页使用,而不只使用命令行?
可以。XAgent-Server 提供监听 5173 端口的 Web 界面,可通过 http://localhost:5173 访问;默认用户名和密码分别为 guestxagent

相关 Agents