设计与前端 image-to-pptxpdf-to-pptxocrmulti-agentcodex

图片转可编辑PPT技能

把图片、PDF、图片版PPT转换为可编辑的PowerPoint文稿。

FollowAgents 评估 · FARS-2.1
不推荐
53/ 100 五分制 2.7 / 5
1 2 3 4 5 6
1信任安全12 / 29 · 2.1/5

证据显示:README 明确要求使用完全访问权限,并说明会调用 OCR、图片生成/编辑、文件读写、子 agent 分派等,但未提供最小权限方案;用户确认方面,README 提到 AI 会询问 OCR Token,但未说明所有外部调用的确认机制;数据流透明性较好,README 详细描述了输入归一化、输出目录结构和各步骤,但未提供数据流图;敏感数据处理方面,README 说明 API key 存储在用户级配置并遮蔽,但未说明加密存储;依赖安全方面,未提供依赖清单或漏洞扫描;外部影响方面,README 说明会调用第三方 API,但未说明数据发送范围;回滚方面,未提供回滚机制;来源归属方面,README 提到资产来源记录,但未明确所有输出的来源。扣分原因:缺少最小权限、用户确认、依赖安全、回滚等具体证据。

2可靠稳定8 / 14 · 2.9/5

证据显示:README 和测试文件显示 CLI 命令和流程有明确设计,测试覆盖了并发、公式渲染、后端选择等,但未提供完整测试结果;依赖可用性方面,README 提到需要外部 OCR Token 和图片后端,但未说明依赖的可用性保障;失败消息方面,测试和 README 提到错误处理,但未提供全面的失败消息示例。扣分原因:依赖可用性未充分说明,失败消息证据有限。

3适用触发12 / 18 · 3.3/5

证据显示:README 明确适用场景(图片、PDF、图片版PPT转可编辑PPT),并区分了单页和多页处理;能力边界清晰,说明了不生成新 PPT、复杂视觉元素保留为资产等;触发方式明确,提供了使用示例;环境适配方面,说明了需要支持 skill 加载、文件读写、CLI 执行等,但未详细说明不同 agent 的兼容性。扣分原因:环境适配细节不足。

4规范维护11 / 18 · 3.1/5

证据显示:README 提供了详细的信息架构,包括仓库结构、输出结构;安装说明简单明了;命名稳定,CLI 命令和文件命名有明确规范;提供了示例和 FAQ(通过文档链接);已知问题部分列出了限制;许可证为 MIT;有 CHANGELOG.md 和版本控制;维护责任方面,README 提供了支持渠道,但未明确维护者身份。扣分原因:维护责任未明确。

5有效结果7 / 13 · 2.7/5

证据显示:输出为可编辑 PPTX,README 提供了转换效果示例,说明输出可用;边际价值方面,该 skill 解决了图片转可编辑 PPT 的需求,但成本较高(README 提到 token 消耗大);成本效益方面,README 明确警告成本高,推荐 Pro 用户,但未提供具体成本数据。扣分原因:成本效益证据不足。

6证据核验3 / 8 · 1.9/5

证据显示:README 中的声明(如转换效果、成本)有示例和警告支持,但未提供可复现的验证步骤;跨来源验证方面,README 提到外部文章和文档,但未提供独立验证;事实与推断分离方面,README 区分了已知问题和预期效果,但部分声明(如“不保证 100% 复刻”)是推断。扣分原因:验证证据不足。

证据充分度: 评估于 2026年8月9日 审查版本 fb869763127f
使用前请注意
  • 该 skill 要求完全访问权限,可能执行 OCR、图片生成/编辑、文件读写、子 agent 分派等操作,请确保在可信环境中使用。
  • 第三方 API 凭据(如 OCR Token、API key)存储在用户级配置中,请确保配置文件权限安全。
  • 转换成本较高,可能消耗大量 token,请根据实际需求谨慎使用。
评估证据 [1][2][3][4][5][6][7]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

image-to-editable-ppt-skill 是一个 Codex 技能,用于将幻灯片图片、PDF 和基于图片的 PPTX 文件转换为可编辑的 PowerPoint 演示文稿。它首先将输入归一化为逐页任务,然后重建为 .pptx 文件:可读文本尽量恢复为原生文本框,简单几何形状尽量恢复为 PowerPoint 形状,复杂视觉元素则保留为带来源记录的独立图片资产。该技能采用多智能体协作流程,支持单页和多页输入,多页输入会分派给 page worker 并行处理。它自动安装 editppt CLI 工具,并支持使用内置 image_gen.imagegen 或第三方 API 作为图片生成的备用方案。文字校正依赖百度 PaddleOCR-VL,需要申请 Token。该技能建议在 Codex 中使用完全访问权限运行,因为耗时较长且需要自动执行多个步骤。输出始终是 .pptx 文件,并保留原始页面备注。

该技能执行以下操作:首先创建独立任务目录,将输入归一化为 pages/page_NNN/source.png 文件;然后根据页数选择处理方式:单页由主 agent 本地重建,多页则按 max_concurrent_pages 分派给 page worker 并行处理;页面重建者会完成页面重建、自检和修正,并创建 manifest 文件;最后主 agent 使用 editppt run finalize 命令按页顺序重建最终 .pptx 文件,复制页面备注并运行 deck validation。图片生成和编辑优先使用 Codex 内置的 image_gen.imagegen,如果不可用或出错,则降级到 editppt image CLI(使用 Codex OAuth 或 OpenAI-compatible API)。文字校正通过调用百度 PaddleOCR-VL 接口,生成每页的文字标注(框坐标、字号、分组),用于提高文字复原精度。输出目录结构包含 input、final、pages 等子目录,最终生成 .pptx 文件。

  1. 将单张幻灯片图片转换为可编辑的 PowerPoint,以便调整文字和元素位置。
  2. 将多张图片或多页 PDF 转换为一个多页 .pptx 文件。
  3. 将图片版 PPT 页面转换为更容易二次编辑的 .pptx,并保留原始页面备注。
  4. 复刻单页视觉设计,同时保留文本可编辑性。
  5. 对比源图与输出页面,定位缺字、错位或资产缺失。

这个 Agent 有哪些优点和局限?

优点
  • 恢复文本为原生文本框,保持可编辑性;
  • 支持多种输入格式(图片、PDF、图片版PPT);
  • 多页输入通过 page worker 并行处理,提高效率;
  • 自动安装依赖的 CLI 工具,降低手动配置成本。
局限
  • 依赖 Codex 环境,无法在其他平台直接使用;
  • 建议使用完全访问权限运行,否则会频繁请求审批;
  • 对于复杂视觉元素(如照片、插画)只能作为独立图片资产,不能保证内部对象可编辑;
  • 转换成本较高,10 页 PPT 可能消耗大量 token 和 5 小时额度。

如何安装或部署这个 Agent?

在支持 Codex 的环境中使用以下命令安装技能:

安装 image-to-editable-ppt 这个 skill,地址是 https://github.com/ningzimu/image-to-editable-ppt-skill

安装后,技能会自动安装 editppt CLI 工具。需要配置百度 AI Studio 的 Access Token(免费)以用于文字校正,可在 https://aistudio.baidu.com/account/accessToken 申请。图片 API 的降级配置(如提供第三方 API)会被 AI 写入用户级配置文件 ~/.editppt/config.yaml(Windows 下为 %USERPROFILE%\.editppt\config.yaml)。

如何使用这个 Agent?

在 Codex 中,使用 $image-to-editable-ppt 指令并附上图片、PDF 或 .pptx 文件路径,例如:

$image-to-editable-ppt 把这张图片转成可编辑 PPT。
$image-to-editable-ppt 把 <path-to-deck.pdf> 转成可编辑 PPT。

技能会自动完成创建任务目录、分派页面重建(使用 page worker 或多 agent 机制)、执行 OCR 校正、生成图片资产,并最终生成 .pptx 文件。输出文件位于 final 目录下。

这个 Agent 与同类方案有什么区别?

与 codex-ppt-skill 不同,codex-ppt-skill 用于从文章、报告、大纲或想法直接生成全新 PPT,而本技能专注于将现有图片/PDF/图片版PPT转换为可编辑的 .pptx 文件。

常见问题

这个技能可以在没有百度 OCR Token 的情况下运行吗?
可以,但会退化为内置的离线检测器,仅进行几何测量(知道文字位置和大小,但不识别内容),文字还原质量会打折扣。建议申请免费的 Token 以获得最佳效果。
在多页输入时,如何分配页面?
多页输入会按 max_concurrent_pages 并发槽位分派给 page worker 处理。page worker 是子 agent,需要支持分派机制,否则无法正常运行。
是否支持在非 Codex 环境中使用(如 Claude Code 或 OpenClaw)?
支持,但需要手动配置第三方 API fallback(如 OpenAI-compatible API),并且可能无法使用内置的 image_gen.imagegen,需要依赖 CLI fallback 或外部 API。
转换后能否 100% 复刻原始页面?
不能保证 100% 复刻,部分图片元素和文字位置可能会有轻微偏移,尤其是复杂视觉元素。

相关 Agents