效率与协作 document-to-slidespresentation-generationragpdf-processingposter-generationcheckpoint-resume

Paper2Slides:一键从论文生成演示文稿

将研究论文、报告和文档在几分钟内自动转化为专业幻灯片和海报,支持多种文件格式与自定义风格。

FollowAgents 评估 · FARS-2.1
不推荐
44/ 100 五分制 2.2 / 5
1 2 3 4 5 6
1信任安全7 / 29 · 1.2/5

证据显示:CLI 需要用户提供 API 密钥(.env),但未明确最小权限原则;没有用户确认机制;数据流在 README 中有描述(RAG 索引、检查点),但未说明数据如何传输至外部 API;敏感数据处理(API 密钥)有 .env.example 提示,但未说明加密或保护措施;依赖固定版本较少,未提及安全审计;外部效果包括生成文件、调用外部 API,但未说明副作用;有检查点机制支持恢复,但未明确回滚;来源归属有 MIT 许可证和 HKUDS 版权,但未验证发布者。扣分原因:缺少用户确认、最小权限说明不足、依赖安全未提及。

2可靠稳定6 / 14 · 2.1/5

证据显示:README 描述一致,CLI 选项与文档匹配;依赖列表存在,但未固定所有版本,可能影响可复现性;失败消息未在文档中说明。扣分原因:依赖版本未完全固定,失败处理文档缺失。

3适用触发12 / 18 · 3.3/5

证据显示:明确目标用户(研究人员、报告制作者),场景多样(论文、报告、多格式);能力边界通过 CLI 选项和模式(fast/normal)说明;触发精度通过 CLI 参数和 --from-stage 控制;环境适配有 conda 和 pip 安装说明,但未提及操作系统兼容性。扣分原因:环境适配信息不完整。

4规范维护9 / 18 · 2.5/5

证据显示:README 结构清晰,有目录;安装步骤详细;命名稳定(CLI 选项一致);有示例和 FAQ(通过 COMMUNICATION.md 链接);已知限制未明确列出;MIT 许可证明确;版本变更记录在 News 部分有两条,但无正式 changelog;维护责任未明确。扣分原因:缺少已知限制、正式 changelog 和维护责任说明。

5有效结果7 / 13 · 2.7/5

证据显示:输出为 PDF 和图片,可直接使用;边际价值高(自动化生成幻灯片);成本效益未讨论,但依赖外部 API 可能产生费用。扣分原因:成本效益分析缺失。

6证据核验3 / 8 · 1.9/5

证据显示:README 中的功能声明未提供测试或验证证据;没有交叉来源验证;事实与推断未明确区分。扣分原因:缺乏可验证的证据。

证据充分度: 评估于 2026年8月13日 审查版本 0785051d1f52
源码中未见的安全控制:执行前用户确认、依赖安全审查
使用前请注意
  • API 密钥管理:用户需在 .env 中存储密钥,但未提供安全存储指导,存在泄露风险。
  • 外部 API 调用:生成过程依赖外部 LLM 和图像生成 API,可能产生费用和数据传输,需用户注意隐私。
  • 依赖安全:依赖未完全固定版本,且未提及安全审计,可能存在供应链风险。
评估证据 [1][2][3]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Paper2Slides 是香港大学数据科学实验室(HKUDS)开源的自动化演示文稿生成工具,采用四阶段流水线(RAG索引、内容分析、布局规划、视觉生成)将文档转化为幻灯片或海报。它支持PDF、Word、Excel、PowerPoint、Markdown等多种格式,并提供命令行和Web界面两种使用方式。用户可选用内置主题(如academic、doraemon)或用自然语言描述自定义风格,并可通过检查点机制随时断点续跑。项目基于Python 3.12,需要配置LLM和图像生成API密钥。

Paper2Slides读取文档文件(PDF、Word、Excel、PowerPoint、Markdown等),通过RAG(利用LightRAG和RAG-Anything)解析并构建检索索引;提取图表、表格和内容结构;随后规划幻灯片或海报布局,并调用图像生成模型(支持OpenRouter或Google Gemini)生成视觉元素,最终输出PNG和PDF文件。命令行接口提供--input--output--style--length--fast--parallel等选项,并自动保存检查点以便断点续跑。Web界面由FastAPI后端和React前端组成,可通过start.sh脚本启动。

  1. 研究人员需要将长篇论文快速转化为会议演讲幻灯片,以节省手工整理时间。
  2. 学生或教师需要将课程讲义转换为教学演示文稿,支持自定义风格适配课堂氛围。
  3. 产品经理需要将市场报告或产品文档转换为内部汇报幻灯片,并快速迭代样式。
  4. 内容创作者需要从PDF或Word文档生成海报,用于会议展示或社交媒体宣传。
  5. 需要批量处理多份文档,利用并行生成加速制作多套演示材料。
  6. 在生成过程中遇到中断,利用检查点功能从断点继续,无需从头开始。

这个 Agent 有哪些优点和局限?

优点
  • 支持多种文档格式(PDF、Word、Excel、PPT、Markdown),可同时处理多个文件。
  • 四阶段流水线结合RAG,确保内容提取的准确性和源可追溯性。
  • 提供检查点机制,中断后可从任意阶段恢复,支持样式快速迭代。
  • 支持自定义风格,用户可用自然语言描述视觉主题,灵活性高。
  • 提供命令行和Web界面两种交互方式,适应不同用户习惯。
局限
  • 依赖外部LLM和图像生成API,需要配置API密钥,可能产生费用。
  • 图像生成默认使用OpenRouter的gemini-3-pro-image-preview模型,可能产生延迟和成本。
  • 需要Python 3.12环境,并可能依赖特定系统库(如conda)。
  • RAG索引阶段对长文档处理时间较长,快速模式会牺牲部分内容提取深度。
  • 项目较新(2025年12月开源),社区和生态尚不成熟,可能缺少长期维护保障。

如何安装或部署这个 Agent?

  1. 克隆仓库:git clone https://github.com/HKUDS/Paper2Slides.git 并进入目录。2. 创建conda环境:conda create -n paper2slides python=3.12 -y 并激活。3. 安装依赖:pip install -r requirements.txt。4. 在paper2slides/目录下创建.env文件,参考.env.example配置API密钥(包括LLM和图像生成密钥)。

如何使用这个 Agent?

命令行用法示例:python -m paper2slides --input paper.pdf --output slides --style doraemon --length medium --fast --parallel 2。常用选项包括--input(输入文件)、--output(slides或poster)、--style(academic/doraemon/自定义描述)、--fast(跳过RAG索引)、--parallel(并行生成)。Web界面:运行./scripts/start.sh启动前后端,访问http://localhost:5173。若需恢复中断任务,只需重新运行相同命令即可自动检测检查点。

常见问题

使用Paper2Slides需要哪些API密钥?
需要配置LLM的API密钥(用于内容分析和规划)以及图像生成API的密钥(支持OpenRouter或Google Gemini)。具体变量见paper2slides/.env.example
生成过程中断怎么办?
系统会自动保存检查点,重新运行相同命令即可从断点恢复。也可使用--from-stage强制从特定阶段重启。
能否自定义幻灯片风格?
可以。使用--style参数传入内置主题(如academicdoraemon)或任何自然语言描述,例如“Studio Ghibli动漫风格”。
支持哪些输入文件格式?
支持PDF、Word、Excel、PowerPoint、Markdown等常见格式,并可同时处理多个文件。
快速模式与普通模式有何区别?
快速模式(--fast)跳过RAG索引,直接使用LLM查询,适合短文档和快速预览;普通模式构建完整RAG索引,适合长文档和多文件处理。

相关 Agents