图片转可编辑PPT技能
把图片、PDF、图片版PPT转换为可编辑的PowerPoint文稿。
证据显示:README 明确要求使用完全访问权限,并说明会调用 OCR、图片生成/编辑、文件读写、子 agent 分派等,但未提供最小权限方案;用户确认方面,README 提到 AI 会询问 OCR Token,但未说明所有外部调用的确认机制;数据流透明性较好,README 详细描述了输入归一化、输出目录结构和各步骤,但未提供数据流图;敏感数据处理方面,README 说明 API key 存储在用户级配置并遮蔽,但未说明加密存储;依赖安全方面,未提供依赖清单或漏洞扫描;外部影响方面,README 说明会调用第三方 API,但未说明数据发送范围;回滚方面,未提供回滚机制;来源归属方面,README 提到资产来源记录,但未明确所有输出的来源。扣分原因:缺少最小权限、用户确认、依赖安全、回滚等具体证据。
证据显示:README 和测试文件显示 CLI 命令和流程有明确设计,测试覆盖了并发、公式渲染、后端选择等,但未提供完整测试结果;依赖可用性方面,README 提到需要外部 OCR Token 和图片后端,但未说明依赖的可用性保障;失败消息方面,测试和 README 提到错误处理,但未提供全面的失败消息示例。扣分原因:依赖可用性未充分说明,失败消息证据有限。
证据显示:README 明确适用场景(图片、PDF、图片版PPT转可编辑PPT),并区分了单页和多页处理;能力边界清晰,说明了不生成新 PPT、复杂视觉元素保留为资产等;触发方式明确,提供了使用示例;环境适配方面,说明了需要支持 skill 加载、文件读写、CLI 执行等,但未详细说明不同 agent 的兼容性。扣分原因:环境适配细节不足。
证据显示:README 提供了详细的信息架构,包括仓库结构、输出结构;安装说明简单明了;命名稳定,CLI 命令和文件命名有明确规范;提供了示例和 FAQ(通过文档链接);已知问题部分列出了限制;许可证为 MIT;有 CHANGELOG.md 和版本控制;维护责任方面,README 提供了支持渠道,但未明确维护者身份。扣分原因:维护责任未明确。
证据显示:输出为可编辑 PPTX,README 提供了转换效果示例,说明输出可用;边际价值方面,该 skill 解决了图片转可编辑 PPT 的需求,但成本较高(README 提到 token 消耗大);成本效益方面,README 明确警告成本高,推荐 Pro 用户,但未提供具体成本数据。扣分原因:成本效益证据不足。
证据显示:README 中的声明(如转换效果、成本)有示例和警告支持,但未提供可复现的验证步骤;跨来源验证方面,README 提到外部文章和文档,但未提供独立验证;事实与推断分离方面,README 区分了已知问题和预期效果,但部分声明(如“不保证 100% 复刻”)是推断。扣分原因:验证证据不足。
- 该 skill 要求完全访问权限,可能执行 OCR、图片生成/编辑、文件读写、子 agent 分派等操作,请确保在可信环境中使用。
- 第三方 API 凭据(如 OCR Token、API key)存储在用户级配置中,请确保配置文件权限安全。
- 转换成本较高,可能消耗大量 token,请根据实际需求谨慎使用。
这个 Agent 能做什么,适合哪些场景?
image-to-editable-ppt-skill 是一个 Codex 技能,用于将幻灯片图片、PDF 和基于图片的 PPTX 文件转换为可编辑的 PowerPoint 演示文稿。它首先将输入归一化为逐页任务,然后重建为 .pptx 文件:可读文本尽量恢复为原生文本框,简单几何形状尽量恢复为 PowerPoint 形状,复杂视觉元素则保留为带来源记录的独立图片资产。该技能采用多智能体协作流程,支持单页和多页输入,多页输入会分派给 page worker 并行处理。它自动安装 editppt CLI 工具,并支持使用内置 image_gen.imagegen 或第三方 API 作为图片生成的备用方案。文字校正依赖百度 PaddleOCR-VL,需要申请 Token。该技能建议在 Codex 中使用完全访问权限运行,因为耗时较长且需要自动执行多个步骤。输出始终是 .pptx 文件,并保留原始页面备注。
该技能执行以下操作:首先创建独立任务目录,将输入归一化为 pages/page_NNN/source.png 文件;然后根据页数选择处理方式:单页由主 agent 本地重建,多页则按 max_concurrent_pages 分派给 page worker 并行处理;页面重建者会完成页面重建、自检和修正,并创建 manifest 文件;最后主 agent 使用 editppt run finalize 命令按页顺序重建最终 .pptx 文件,复制页面备注并运行 deck validation。图片生成和编辑优先使用 Codex 内置的 image_gen.imagegen,如果不可用或出错,则降级到 editppt image CLI(使用 Codex OAuth 或 OpenAI-compatible API)。文字校正通过调用百度 PaddleOCR-VL 接口,生成每页的文字标注(框坐标、字号、分组),用于提高文字复原精度。输出目录结构包含 input、final、pages 等子目录,最终生成 .pptx 文件。
- 将单张幻灯片图片转换为可编辑的 PowerPoint,以便调整文字和元素位置。
- 将多张图片或多页 PDF 转换为一个多页 .pptx 文件。
- 将图片版 PPT 页面转换为更容易二次编辑的 .pptx,并保留原始页面备注。
- 复刻单页视觉设计,同时保留文本可编辑性。
- 对比源图与输出页面,定位缺字、错位或资产缺失。
这个 Agent 有哪些优点和局限?
- 恢复文本为原生文本框,保持可编辑性;
- 支持多种输入格式(图片、PDF、图片版PPT);
- 多页输入通过 page worker 并行处理,提高效率;
- 自动安装依赖的 CLI 工具,降低手动配置成本。
- 依赖 Codex 环境,无法在其他平台直接使用;
- 建议使用完全访问权限运行,否则会频繁请求审批;
- 对于复杂视觉元素(如照片、插画)只能作为独立图片资产,不能保证内部对象可编辑;
- 转换成本较高,10 页 PPT 可能消耗大量 token 和 5 小时额度。
如何安装或部署这个 Agent?
在支持 Codex 的环境中使用以下命令安装技能:
安装 image-to-editable-ppt 这个 skill,地址是 https://github.com/ningzimu/image-to-editable-ppt-skill安装后,技能会自动安装 editppt CLI 工具。需要配置百度 AI Studio 的 Access Token(免费)以用于文字校正,可在 https://aistudio.baidu.com/account/accessToken 申请。图片 API 的降级配置(如提供第三方 API)会被 AI 写入用户级配置文件 ~/.editppt/config.yaml(Windows 下为 %USERPROFILE%\.editppt\config.yaml)。
如何使用这个 Agent?
在 Codex 中,使用 $image-to-editable-ppt 指令并附上图片、PDF 或 .pptx 文件路径,例如:
$image-to-editable-ppt 把这张图片转成可编辑 PPT。
$image-to-editable-ppt 把 <path-to-deck.pdf> 转成可编辑 PPT。技能会自动完成创建任务目录、分派页面重建(使用 page worker 或多 agent 机制)、执行 OCR 校正、生成图片资产,并最终生成 .pptx 文件。输出文件位于 final 目录下。
这个 Agent 与同类方案有什么区别?
与 codex-ppt-skill 不同,codex-ppt-skill 用于从文章、报告、大纲或想法直接生成全新 PPT,而本技能专注于将现有图片/PDF/图片版PPT转换为可编辑的 .pptx 文件。