VideoAgent

用自然语言完成视频理解、剪辑与创意改编。

Star 数
★ 1.9k
最近更新
2 个月前
License
MIT
主语言
Python

30 秒速览

运行形态
命令行工具
可在哪里用
兼容但需适配OpenAI API · Claude API(部分支持)
费用
软件免费,模型调用费用自付
上手难度
高 · 需要较重的基础设施
开始前需要
Python 3.10Linux 或 Windows8GB GPU 显存FFmpegPynini 2.1.5Shell / 命令行网络访问本地文件系统
典型场景
研究人员需要针对一段播客或视频素材进行问答、摘要,并准备 Whisper 模型时,可使用 Video QA/Summarization 流程。
不适合
  • 没有 8GB 显存 GPU 或非 Linux/Windows 环境的用户
  • 希望开箱即用、不愿配置多个模型与 API 密钥的团队

这个 Agent 能做什么,适合哪些场景?

VideoAgent 是一个面向视频理解、编辑和再创作的一体化框架,MIT 许可。它通过意图分析、意图到 Agent 的映射,以及图驱动的工作流生成来处理用户需求,并包含两步自评反馈机制。其 Storyboard Agent 会分析预先生成字幕的视频素材库,将输入拆解为视觉和语义对齐的细粒度查询,用于视频检索。README 所列功能包括视频问答、摘要、影片剪辑、解说视频、视频概览、梗视频改编、音乐视频和跨语言改编。项目以本地 Python 命令行方式运行,入口为 main.py,并依赖本地下载的语音、语音转换、字幕和多模态模型。

用户运行 python main.py 后,在 User Requirement: 提示处输入需求。系统将需求拆为显式和隐式子意图,通过 intent-to-agent mapping 选择能力,并由图驱动框架生成可执行工作流及执行顺序;自评反馈用于迭代改进规划。Storyboard Agent 读取带预字幕的视频素材库,生成细粒度视觉查询以检索相关片段。按任务类型,框架可进行视频问答或摘要,也可生成影片剪辑、解说视频、视频概览、梗视频、音乐视频及跨语言喜剧改编;模型配置位于 environment/config/config.yml,可配置 DeepSeek、Claude、GPT 和 Gemini 的 API 密钥与 Base URL。

  1. 研究人员需要针对一段播客或视频素材进行问答、摘要,并准备 Whisper 模型时,可使用 Video QA/Summarization 流程。
  2. 视频创作者希望把现有视频改写为新对白、保留原始视觉内容并维持原说话者音色时,可使用视频混剪、TTS 或 SVC 相关流程。
  3. 拥有单口喜剧脚本和参考素材的创作者,需要生成带表演节奏、观众反应和相关画面的完整视频时,可使用 README 展示的 stand-up 场景。
  4. 制作人要把英文脱口秀改为中文相声,或把中文相声改为英文脱口秀时,可使用 Cross Talk 或 Talk Show 所列流程。
  5. 音乐视频制作者需要使用 DiffSinger、seed-vc、Whisper 与 ImageBind 进行 AI 音乐视频制作时,可采用 MAD SVC 场景。
  6. 内容团队需要从素材库中检索与文本描述匹配的视频片段,并据此制作解说视频或视频概览时,可使用 Storyboard Agent 的查询与检索流程。

如何安装或部署这个 Agent?

运行环境要求为 Linux 或 Windows、8GB GPU 显存。执行:

git clone https://github.com/HKUDS/VideoAgent.git
conda create --name videoagent python=3.10
conda activate videoagent
conda install -y -c conda-forge pynini==2.1.5 ffmpeg
pip install -r requirements.txt

按所需功能下载模型:CosyVoice、fish-speech、seed-vc、DiffSinger、Whisper 和 ImageBind 在 README 中均给出了 huggingface-cli download 或 wget 命令;ImageBind 下载前还需要执行 git lfs install。编辑 environment/config/config.yml,填写相应的 deepseek_api_key、claude_api_key、gpt_api_key、gemini_api_key 及对应 Base URL;README 明确说明 Claude 是 Agentic Graph Router 所必需的。

如何使用这个 Agent?

完成模型下载与 environment/config/config.yml 配置后,运行:

python main.py

在控制台出现 User Requirement: 后输入视频任务。README 示例包括:对已有视频改写台词而保留原说话者音色和画面;或将单口喜剧脚本、参考脚本及素材制作成完整视频。不同场景需要下载对应模型:例如 Video QA/Summarization 需要 Whisper,Cross Talk、Talk Show、Comm 和 News 需要 CosyVoice、Whisper 与 ImageBind。

这个 Agent 有哪些优点和局限?

优点
  • 同一框架覆盖视频问答、摘要、剪辑、解说、概览、梗视频、音乐视频和跨语言改编,而非只覆盖单一视频任务。
  • 以图驱动工作流将用户意图映射到能力组合,并记录了两步自评反馈机制,适合需要多步骤编排的视频任务。
  • Storyboard Agent 将预字幕素材库转换为视觉和语义对齐的细粒度检索查询,明确覆盖了素材检索环节。
  • 按功能列出了所需模型,允许只下载项目所需的一部分模型。
局限
  • README 明确要求 Claude 为 Agentic Graph Router 提供支持,因此部署并非完全独立于外部模型提供商。
  • 不同功能还分别依赖 GPT、Gemini 或 DeepSeek 配置,以及 CosyVoice、fish-speech、seed-vc、DiffSinger、Whisper 和 ImageBind 等模型,环境准备成本较高。
  • 运行要求 Linux 或 Windows、8GB GPU 显存,并需安装 Python 3.10、FFmpeg 和 Pynini 2.1.5。
  • README 仅记录命令行入口 python main.py,未提供 HTTP API、容器部署或托管服务接口的证据。
  • 演示视频的音视频素材来自互联网且仅声明用于研究和演示,商业使用时需自行核查素材权利。

这个 Agent 与同类方案有什么区别?

README 将 VideoAgent 与 Director、Funclip、NarratoAI 和 NotebookLM 对比:表中 VideoAgent 覆盖节拍同步剪辑、故事叙述视频、视频概览、梗视频改编、歌曲混剪、跨语言改编、视频问答和音效工具;其余产品在该表中仅覆盖其中部分能力。

与相关度最高的同类 agent 并排比较关键指标。

Agent 源码审查 形态 / 费用 Star 最近更新 主语言 完整支持的平台
VideoAgent 当前 29 · 缺口较多 命令行工具免费 + 模型费 ★ 1.9k 2 个月前 Python —
Qwen Audio Agent 59 · 缺口较多 命令行工具免费 + 模型费 ★ 2.8k 今天 JavaScript —
Big-AGI 57 · 缺口较多 自托管服务免费版 + 付费版 ★ 7.1k 1 天前 TypeScript OpenAI API · Claude API
AgentCall join-meeting 技能 46 · 缺口较多 Agent 插件 / 技能免费版 + 付费版 ★ 159 11 天前 Python Codex · Claude Code

FollowAgents 如何评估这个 Agent?

FollowAgents 源码审查 · FARS-2.1
缺口较多
29/ 100 五分制 1.5 / 5
信任安全 0/29
可靠稳定 3/14
适用触发 8/18
规范维护 8/18
有效结果 7/13
证据核验 3/8
查看各维度的扣分理由
信任安全0 / 29 · 0.0/5

证据显示:仓库未提供权限管理、用户确认、数据流透明、敏感数据处理、依赖安全、外部影响、回滚或来源归属的说明。所有信任相关标准均缺失,因此得分为0。

可靠稳定3 / 14 · 1.1/5

证据显示:README和pyproject.toml在依赖和功能描述上基本一致,但存在不一致之处,如pyproject.toml声明license为Apache而实际LICENSE为MIT,且README声称支持Windows但依赖中包含仅Linux的包。依赖可用性方面,大量依赖来自外部源,但未提供版本锁定或镜像,存在可用性风险。失败消息方面,未提供错误处理或用户提示的文档。

适用触发8 / 18 · 2.2/5

证据显示:README明确了目标用户(视频创作者、研究者)和多种使用场景(视频理解、编辑、重制),但能力边界描述模糊,未明确限制或失败条件。触发精度方面,用户通过自然语言输入,但未说明如何精确控制或避免误触发。环境适配方面,提供了环境要求(GPU内存、OS)和安装步骤,但未说明不同操作系统或硬件的兼容性细节。

规范维护8 / 18 · 2.2/5

证据显示:README提供了清晰的目录结构和功能概览,安装说明详细,但缺少版本变更日志和明确的维护责任。命名稳定性方面,项目名称和版本号在pyproject.toml中定义,但未说明命名约定或稳定性保证。示例和FAQ方面,提供了多个演示和示例,但缺少FAQ。已知限制方面,仅在README中提及内容版权问题,未全面说明技术限制。许可证方面,LICENSE文件为MIT,但pyproject.toml声明为Apache,存在不一致。

有效结果7 / 13 · 2.7/5

证据显示:输出可用性方面,README展示了多种视频输出类型和演示,但未提供输出格式或质量保证。边际价值方面,项目提供了多种独特功能(如跨语言改编、梗视频重制),但未与现有工具进行详细对比。成本效益方面,需要下载多个大型模型和依赖,但未提供资源消耗或性能基准。

证据核验3 / 8 · 1.9/5

证据显示:README中的性能声明(如成功率0.95)未提供具体实验数据或复现步骤,缺乏可追溯性。跨来源验证方面,仅依赖README和pyproject.toml,未提供第三方验证。事实与推断分离方面,README将功能描述和性能声明混合,未明确区分事实和推断。

风险与缓解建议
  • 源码中未见:最小权限约束只授予完成任务所需的权限:用专用账号或只读令牌,并限定可访问的目录和仓库。
  • 源码中未见:执行前用户确认开启或自行加上执行前确认;先在沙箱或测试环境跑通,确认行为后再接入真实数据。
  • 源码中未见:数据流向说明运行时观察它连接了哪些外部服务(代理或防火墙日志);弄清数据去向之前不要输入敏感数据。
  • 源码中未见:敏感信息处理使用专用、低权限、可随时吊销的 API 密钥,不要复用生产凭据,也不要让密钥出现在日志里。
  • 源码中未见:依赖安全审查安装前固定版本并做一次依赖扫描(如 npm audit、pip-audit);优先放在容器里运行。
  • 源码中未见:外部影响披露先弄清它会写入、发送或修改哪些外部系统,用测试账号或测试仓库验证后再接入正式环境。
  • 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
  • 源码中未见:来源归属可核验从官方仓库或包源安装,核对发布者和仓库地址,避免同名仿冒包。
  • 许可证声明不一致:pyproject.toml声明Apache,但LICENSE文件为MIT,可能引起法律混淆。
  • 依赖安全未评估:大量依赖来自外部源,且未提供版本锁定或安全审计,存在供应链风险。
  • 性能声明缺乏证据:README声称成功率0.95等,但未提供实验数据或复现步骤,不可验证。
  • 数据流和权限不透明:未说明如何处理用户数据、API密钥或权限,存在隐私和安全风险。
证据充分度:低 评估于 2026年8月9日 审查版本 f207987e3cff
查看完整评分方法 →

常见问题

必须配置哪些模型 API?
README 明确写明 Claude 是 Agentic Graph Router 所必需的。配置文件还为 DeepSeek、GPT 和 Gemini 提供了 API 密钥与 Base URL 字段,并按视频混剪、编辑、摘要、问答和细粒度理解等场景标注用途。
能否只下载部分本地模型?
可以。README 明确说明可只下载与项目相关的模型,并在表格中列出各功能所需模型,例如视频问答和摘要只列出 Whisper。
如何启动并提交任务?
完成配置后执行 python main.py,然后在控制台的 User Requirement: 提示处输入需求。
是否提供 Web 服务或 SDK?
所给资料只记录了本地命令行启动方式和配置文件,没有提供 Web API、SDK 或容器部署说明。
在 GitHub 查看 ↗ 安装 ↓

相关 Agents