效率与协作 desktop-assistantragllamaindexmcpspeech-recognitionimage-generationcomputer-useollama

PyGPT 桌面智能助手

在本地桌面整合多模型对话、文件检索、自动化与多模态创作。

FollowAgents 评估 · FARS-2.0
待评估
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

PyGPT 是一款用 Python 编写的 Linux、Windows 与 Mac 桌面 AI 助手,提供 Chat、Chat with Files、Assistants、Agents、Computer use、图像和视频生成等工作模式。它可通过 OpenAI、Anthropic、Google GenAI 与 xAI 的原生 SDK,以及 LlamaIndex、Ollama 和 OpenAI 兼容端点连接多类模型。应用把对话上下文保存到工作目录中的 SQLite 数据库和文本文件,并提供预设、配置档、日历、便签及附件管理界面。其文件能力涵盖本地 data 目录、LlamaIndex 向量索引和临时附件索引;启用插件后,模型还可执行 Python、系统命令和自定义命令。它适合希望在本机统一管理多家模型、个人文件与可选自动化工具的个人用户,而不是一个只面向单一云端模型的网页聊天客户端。

用户在桌面界面选择模型、模式、预设和已启用的插件后,PyGPT 通过 Responses API、ChatCompletions API 或提供商原生 SDK 发送请求。在 Chat with Files 模式中,它用 LlamaIndex 读取 txt、pdf、csv、docx、xlsx、网页、GitHub Repository 等内容,生成嵌入并写入所选向量存储,再将检索结果加入查询;附件也可采用 Full context、RAG 或 Summary。Files I/O 插件管理工作目录的 data 文件,Code Interpreter 插件可运行 Python,其他插件可执行系统命令、网页搜索或 MCP 命令。Agent (LlamaIndex) 会把活动插件命令即时转换为工具,并可自动加入索引读取工具;Agent (OpenAI) 使用 openai-agents 工作流,例如 Planner、Research bot、Supervisor + Worker。输出包括模型回复、生成的图像或视频、下载或生成的文件、语音输入转写及语音合成结果。

  1. 需要在 Windows、Linux 或 Mac 上用同一桌面程序切换 OpenAI、Claude、Gemini、Grok、Perplexity 或 Ollama 本地模型的个人用户。
  2. 需要把 PDF、表格、Word 文档、网页或 GitHub 仓库建立索引,并在 Chat with Files 中查询资料的研究人员。
  3. 希望让模型在受控的本地 data 目录读写文件、运行 Python 或调用自定义命令的开发与自动化用户。
  4. 需要语音输入、语音合成、相机视觉分析和图像生成整合在一个桌面工作流中的辅助使用者。
  5. 希望用 Planner、Research bot、专家协作或 Supervisor + Worker 预设组织多步任务的高级用户。

这个 Agent 有哪些优点和局限?

优点
  • 同一桌面界面同时覆盖原生 OpenAI、Anthropic、Google GenAI 与 xAI SDK,并提供 LlamaIndex、Ollama 和 OpenAI 兼容端点路径。
  • Chat with Files 支持多种本地文件和外部内容加载器、自动嵌入,以及 Chroma、Elasticsearch、Qdrant、Redis 等向量存储选项。
  • 插件可把文件 I/O、Python Code Interpreter、系统命令、网页搜索和 MCP 接入对话及代理工作流。
  • 除文本聊天外,还整合实时音频、语音识别、语音合成、相机视觉、图像生成和视频生成模式。
局限
  • 多数云端模型和网络搜索依赖互联网及各提供商的 API 密钥;索引内容会调用嵌入模型并消耗 token。
  • Mac 没有已编译二进制版本,必须通过 PyPI 或源码运行;Linux 二进制包要求 GLIBC >=2.35。
  • 文件、Python 和系统命令能力需要启用相应插件与 + Tools,自动代理与插件组合可能产生意外结果。
  • 部分功能存在明确限制:Chat with Audio 标为 beta,且 Agent (LlamaIndex) 当前仅支持文本;Computer use 的沙盒模式还需要安装 Playwright 浏览器。

如何安装或部署这个 Agent?

运行环境为 Python >=3.10 且 <3.14。安装 PyPI 版本:
python3 -m venv venv
source venv/bin/activate
pip install pygpt-net
pygpt

从源码运行:
git clone https://github.com/szczyglis-dev/py-gpt.git
cd py-gpt
python3 -m venv venv
source venv/bin/activate
pip install -r requirements.txt
python3 run.py

也可使用 Linux/Windows 64 位二进制包、Linux AppImage、Snap 或 Windows Microsoft Store。Mac 没有二进制包,应使用 PyPI 或源码。Linux 二进制包要求 GLIBC >=2.35。

如何使用这个 Agent?

首次启动后,在 Config -> Settings -> API Keys 中填写所需提供商的密钥;使用 GPT 模型需要 OpenAI 账户和 API key,本地模型不需要 OpenAI key。选择 Chat 开始普通对话,或在 Chat with Files 中把文件放入 data 目录后点击 Index all,再查询索引内容。若要允许本地文件操作、Python 执行或命令执行,启用相应插件并打开 + Tools。使用 Assistant 模式时可配置 OpenAI Assistants API;使用 Agent (OpenAI) 时选择预设工作流和可用的远程或本地工具。

常见问题

使用 PyGPT 一定要付费或提供 OpenAI 密钥吗?
使用 GPT 模型需要注册 OpenAI 账户并提供自己的 API key。README 说明本地模型不需要 OpenAI 账户或 API key;其他云端提供商可能需要各自的密钥和访问权限。
我的文件会如何被处理?
文件可放在 data 目录中建立长期索引,或作为仅用于当前对话的附件。附件可使用 Full context、RAG 或 Summary;RAG 会将内容索引到临时向量存储。
它能直接控制电脑和执行命令吗?
可以,但需要相应模式或插件。Computer use 使用 Computer use remote tool 与 Mouse and Keyboard 插件;文件、Python 和系统命令能力由插件提供,文档提示自治模式与插件组合应谨慎使用。
能在没有网络的情况下使用吗?
云端 API 功能需要网络连接。README 明确指出本地模型可不使用 API key,但未说明所有桌面功能都能离线运行。

相关 Agents