Video Use
通过对话把原始素材剪成带字幕、调色和质检的成片。
README 明确披露每个源视频会调用一次 ElevenLabs Scribe、需要 API 密钥、输出位于源目录下的 edit/,并描述“提出策略—等待确认—执行”的流程,因此数据流、外部影响和用户确认有实际说明。原始素材似乎不会被覆盖,但没有正式的备份、撤销或恢复机制。代理被要求拥有 shell 访问权、读取素材目录并安装依赖,未见权限收窄或隔离措施。密钥通过 .env 配置,但没有权限设置、日志脱敏、保留或泄露处置说明。依赖均未锁定版本,也没有漏洞扫描、校验或供应链控制证据。MIT 版权归属清楚,但维护者身份和责任路径不充分;未验证的发布者仅按未知处理,未据此作负面推断。
README、项目元数据和依赖声明对产品用途及基本安装流程大体一致,并列出了 Python 包、ffmpeg、可选 yt-dlp、ElevenLabs 和 Python 版本要求。扣分在于外部服务、系统二进制和动画工具的可用性没有检测或降级方案,README 的跨代理承诺也超出 pyproject 中面向 Claude Code 的描述。没有提供错误消息、故障分类、重试提示或排障示例;自评最多三次的说法也没有随附代码或测试证据。
材料列出了访谈、教程、旅行、口播和蒙太奇等多种场景,并允许自定义字幕、调色链和动画工具,受众与场景覆盖充分。它说明 LLM 主要读取转录文本、按需查看视觉合成,并在策略批准后编辑,形成了基本能力边界与触发流程。扣分在于“适用于任何内容”“零假设”等表述过宽,未界定不支持的媒体格式、长度、语言或复杂编辑任务;环境说明偏向 macOS Homebrew,缺少 Windows/Linux、硬件资源和兼容性矩阵。
README 依次覆盖功能、安装、使用、架构、流水线和设计原则,命名及 final.mp4、edit/ 等约定基本稳定,也给出了手动安装和会话示例。MIT 全文与 pyproject 许可元数据一致,许可项可获满分。扣分在于没有 FAQ、排障章节或完整已知限制;仅有 0.1.0 版本号而无变更日志、发布策略或兼容承诺;版权主体存在,但没有维护者名单、支持渠道、安全报告方式或明确更新责任。部分关键规则被指向未提供的 SKILL.md 和 install.md,当前证据无法审阅其细节。
预期产物、目录、剪辑功能和工作流都描述得较具体,文本转录加按需视觉检查相较逐帧输入具有可信的潜在增益,因此普通使用下的输出可用性和边际价值有一定支持。扣分在于没有样例产物、质量基准或静态测试材料佐证剪辑、自评和自动修复效果;45M token 与 12KB 的对比是未经交叉支持的示例。成本方面只说明一次转录调用和减少视觉输入,没有 API 费用、处理时长、算力、存储或失败重跑成本。
仓库元数据可追溯地支持名称、版本、Python 要求、依赖和 MIT 许可,README 也清楚区分了转录层、视觉层及预期流水线。扣分在于多数核心效果声明——自动消除口头语、自评切点、并行动画和最多三次修复——没有在所给代码、测试、样例或日志中得到追踪或交叉印证。架构说明与营销主张在文字上尚可辨认,但若干性能和普适性陈述仍以事实口吻出现,未标注为估算、目标或推断。
- 素材音频会发送到 ElevenLabs;在处理机密、受版权保护或含个人信息的视频前,应确认授权、服务条款、数据保留与地域要求。
- 代理需要 shell 权限并被提示克隆仓库、安装依赖和注册技能;应在隔离环境中审查命令,并限制其仅访问目标素材目录。
- requests、librosa、matplotlib、pillow、numpy 和 setuptools 未锁定版本;部署前应建立锁文件、完整性校验和漏洞扫描。
- 不要仅凭 README 假定自动质检或最多三次修复可靠;所给证据没有实现、测试或样例产物可供核实。
- 没有正式撤销、备份或故障恢复说明;首次用于重要素材时应保留只读原件并在副本上工作。
这个 Agent 能做什么,适合哪些场景?
Video Use 是一个由编码智能体驱动的开源视频剪辑工作流,可处理口播、教程、访谈、旅行记录和蒙太奇等素材。它先通过 ElevenLabs Scribe 获取逐词时间戳、说话人和音频事件,再把多个片段压缩成 takes_packed.md,供智能体以文本为主要界面制定剪辑决策。遇到停顿、重拍比较或切点检查时,它按需运行 timeline_view,生成包含胶片帧、波形、单词标签和静音候选点的 PNG。确认策略后,系统生成 EDL、调用 ffmpeg 渲染,并在每个切点对成片进行自检,发现问题时最多修复和重渲染三次。最终文件写入素材目录下的 edit/final.mp4,项目记忆则保存在 project.md;运行边界是具有 shell 和本地文件系统访问权的编码智能体环境。
工作流首先清点素材,并用 ElevenLabs Scribe 对每个源文件进行一次转写,获取逐词时间戳、说话人分离和诸如笑声、掌声、叹气等音频事件。随后将所有 take 打包为 takes_packed.md;智能体据此识别填充词、错误开头、重拍段落和镜头间死寂,并在需要视觉判断时调用 timeline_view。用户批准剪辑策略后,它生成 EDL 并通过 ffmpeg 输出视频,可为片段应用自定义调色链,在切点加入 30ms 音频淡化,并烧录默认每组两个大写单词且可定制样式的字幕。动画叠加层可由 HyperFrames、Remotion、Manim 或 PIL 生成,每个动画可交给并行子智能体处理。渲染后,系统在每个切点再次运行 timeline_view,检查画面跳变、爆音和被遮挡的字幕;通过检查后产出 edit/final.mp4,并将会话信息写入 project.md。
- 需要从多段口播 take 中删除“umm”“uh”、错误开头和空白停顿,并快速制作发布视频的创作者。
- 希望在没有预设菜单的情况下,用自然语言指定节奏、调色、字幕样式和 ffmpeg 处理链的视频编辑者。
- 要将访谈或教程素材按语音边界精确剪辑,并保留说话人和笑声、掌声等上下文的内容团队。
- 需要为旅行片、蒙太奇或产品演示加入由 Remotion、Manim、HyperFrames 或 PIL 生成的动画叠加层的制作人员。
- 希望把剪辑工作放在自有电脑、VPS 或 Telegram 常驻智能体环境中,并将产物保留在素材目录旁的用户。
这个 Agent 有哪些优点和局限?
- 以约 12KB 的 takes_packed.md 和少量按需 PNG 代替逐帧输入,降低长视频进入智能体上下文的负担。
- 转写包含逐词时间戳、说话人分离和音频事件,可支持按语音边界定位切点,而不只是按固定时间裁剪。
- 渲染后会在每个切点检查画面跳变、爆音和字幕遮挡,并支持最多三轮修复与重渲染。
- 内置 30ms 切点淡化、字幕烧录、逐片段调色,以及多种动画叠加层生成路径。
- 在执行剪辑前要求用户批准策略,并通过 project.md 保留跨会话项目记忆。
- 基础转写依赖 ElevenLabs Scribe 和 ELEVENLABS_API_KEY,因此需要网络连接和外部服务凭据。
- 必须提供具有 shell、本地文件系统和 ffmpeg 的智能体运行环境;它不是浏览器内直接使用的独立编辑器。
- 智能体不会直接观看完整视频,而是依赖转写和按需 timeline_view;纯视觉内容或缺少有效语音的素材效果没有得到说明。
- 文档中的 ffmpeg 与 yt-dlp 安装示例使用 Homebrew,其他平台的安装步骤未提供。
- 自检最多修复并重渲染三次,来源没有说明三次后仍未通过时的自动恢复机制。
如何安装或部署这个 Agent?
自动安装:在 Claude Code、Codex、Hermes、Openclaw 或其他具有 shell 访问权的智能体中,要求其先读取仓库的 install.md,克隆 https://github.com/browser-use/video-use,安装依赖和 ffmpeg,将仓库注册到当前智能体的 skills 目录,并在提示时提供 ELEVENLABS_API_KEY。
手动安装:
git clone https://github.com/browser-use/video-use ~/Developer/video-use- Claude Code:
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use - Codex:
ln -sfn ~/Developer/video-use ~/.codex/skills/video-use cd ~/Developer/video-useuv sync,或运行pip install -e .brew install ffmpeg- 如需下载在线素材,可选运行
brew install yt-dlp cp .env.example .env- 编辑
.env,设置ELEVENLABS_API_KEY=...。
文档提供的是 Homebrew 安装命令,因此其他操作系统需要自行采用等效方式安装 ffmpeg 和可选的 yt-dlp。
如何使用这个 Agent?
把原始素材放入一个目录,然后运行:
cd /path/to/your/videos
claude使用 Codex 时,将第二条命令换成 codex。进入会话后提出具体请求,例如 edit these into a launch video。智能体会清点素材、提出剪辑策略并等待确认;批准后才会执行剪辑、渲染和自检。最终视频位于 <videos_dir>/edit/final.mp4,其他输出也集中在 <videos_dir>/edit/。首次日常使用前应让智能体读取 SKILL.md 和 helpers/ 中的编辑脚本。
常见问题
是否必须使用 ElevenLabs?
它会在未经确认的情况下修改剪辑吗?
最终文件和中间产物保存在哪里?
<videos_dir>/edit/ 中,最终成片为 edit/final.mp4,不会写入 skill 目录。发生渲染问题时如何处理?
能否在 Codex 中运行?
~/.codex/skills/video-use 的符号链接安装路径,并明确把 Codex 列为可使用其设置提示的 shell 智能体。