PaperBanana —— 自动化学术图表生成框架
面向 AI 研究者的自动化学术插图工具,通过多智能体流程从论文文本生成出版级图表和统计图。
证据显示:项目使用API密钥,但文档明确警告不要提交.env文件,且.gitignore已排除。用户确认方面,CLI提供--continue和--feedback,但未强制确认。数据流透明度:README描述了多代理流程,但未详细说明数据如何传输至外部API。敏感数据处理:API密钥存储于.env,有安全政策。依赖安全:使用Dependabot监控,但未提供具体漏洞信息。外部影响:生成图像和代码,但未明确限制。回滚:支持--continue-run,但无正式回滚机制。来源归属:明确声明非官方实现,并引用arXiv论文。扣分原因:缺乏详细的权限最小化、用户确认机制、数据流细节、敏感数据加密、依赖漏洞详情、外部影响控制、回滚机制和来源验证。
证据显示:README和代码结构一致,测试覆盖了关键解析功能。依赖在pyproject.toml中列出,但未验证可用性。失败消息:测试显示解析失败时返回空结果,但未提供用户友好的错误提示。扣分原因:未验证依赖可用性,失败消息不够详细。
证据显示:面向AI科学家,提供多种使用场景(CLI、API、MCP、Studio)。能力边界:明确列出支持的提供商和模型。触发精度:CLI命令和参数定义清晰。环境适配:支持Python 3.10+,提供Docker和Colab。扣分原因:未详细说明不同环境下的限制。
证据显示:README结构清晰,安装说明详细。命名稳定:版本号在pyproject.toml中定义。示例和FAQ:提供多个示例。已知限制:未明确列出。许可证:MIT。版本变更日志:未提供。维护责任:未明确。扣分原因:缺少已知限制、变更日志和维护责任说明。
证据显示:输出为PNG等格式,可直接使用。边际价值:提供自动化图表生成,节省时间。成本效益:提供免费Gemini选项,但未详细分析成本。扣分原因:未提供成本效益分析。
证据显示:README引用arXiv论文,但未提供具体实现细节。交叉验证:未提供。事实与推断分离:未明确。扣分原因:缺乏可追溯性、交叉验证和事实/推断分离。
- API密钥管理需谨慎,确保.env文件不被提交。
- 生成的代码(如matplotlib)可能包含恶意内容,执行前需审查。
- MCP服务器不应暴露到不受信任的网络。
这个 Agent 能做什么,适合哪些场景?
PaperBanana 是一个非官方的开源实现,基于 Google Research 的论文《PaperBanana: Automating Academic Illustration for AI Scientists》,由 llmsresearch 社区维护。该项目提供了一个多智能体管道,包含输入优化、检索、规划、风格化、可视化与批判等最多 7 个专用智能体,能够从论文方法描述生成出版级图表,并支持统计绘图。它支持 OpenAI、Azure OpenAI、Google Gemini 和 Atlas Cloud 等多种大模型与图像生成提供商,并提供了 CLI、Python API、MCP 服务器和本地 Web UI(PaperBanana Studio)等多种交互方式,方便集成到 IDE 或自动化工作流中。
PaperBanana 读取论文方法文本或 PDF,通过 CLI 命令如 paperbanana generate 生成方法学图表,paperbanana plot 生成统计图,支持批量生成、Sweep 对比、评估与优化等。其多智能体管道包括:Phase 0 输入优化(上下文丰富器和标题锐化器),Phase 1 的检索器、规划器、风格器,Phase 2 的可视化器和批判器,循环迭代直至满足要求。它还提供 paperbanana evaluate 进行质量评估,paperbanana polish 优化现有图表,paperbanana orchestrate 从整篇论文生成图表包。通过 MCP 服务器可集成到 Claude Code、Cursor 等工具。
- AI 研究者:从论文方法文本自动生成用于 NeurIPS 等会议论文的架构图。
- 数据科学家:利用
paperbanana plot根据 CSV/JSON 数据生成统计图表。 - 写作者:使用
paperbanana orchestrate从论文源文件生成一组完整的图表及 LaTeX 代码。 - 开发人员:通过 Python API 将图表生成集成到自动化持续集成/持续部署管道中。
- 使用 Claude Code 的研究者:通过 MCP 服务器或 Skills 直接在编辑器中生成图表。
- 需要批量生成图表的团队:通过 manifest 文件一次生成多张图表或进行参数扫描。
这个 Agent 有哪些优点和局限?
- 高度自动化:从文本到出版级图表全流程自动化,包含多智能体迭代优化。
- 多提供商支持:兼容 OpenAI、Azure、Gemini、Atlas Cloud 和 OpenRouter,降低供应商锁定风险。
- 集成丰富:提供 CLI、Python API、MCP 服务器、GitHub Action、PaperBanana Studio 等多种接口。
- 可扩展性:支持批量生成、Sweep 参数扫描、自定义 venue 风格包,适配不同会议要求。
- 非官方实现:基于论文的社区实现,可能与原系统存在差异,且不受原作者的认可。
- 依赖 API 密钥和外部服务:需要使用 OpenAI、Gemini 或 Atlas Cloud 的 API,产生成本。
- 安装配置较复杂:需要 Python 环境,涉及多个依赖和提供商的配置。
- 输出质量依赖模型能力:生成效果依赖于所选 VLM 和图像生成模型的性能。
如何安装或部署这个 Agent?
使用 pip install paperbanana 安装。对于开发或附加功能,可克隆仓库并执行 pip install -e ".[dev,openai,google]"。安装后,复制 .env.example 到 .env 并添加 API 密钥(OPENAI_API_KEY 或 GOOGLE_API_KEY),或运行 paperbanana setup 交互式配置。支持 Docker:构建镜像并以环境变量传递密钥。
如何使用这个 Agent?
首先确保已配置 API 密钥。然后运行如 paperbanana generate --input method.txt --caption "Overview of our framework" --optimize --auto 生成方法图,或 paperbanana plot --data results.csv --intent "Bar chart comparing accuracy" 生成统计图。更多用法如批量生成、评估、MCP 集成等,请参考文档。