VideoAgent
用自然语言完成视频理解、剪辑与创意改编。
- Star 数
- ★ 1.9k
- 最近更新
- 2 个月前
- License
- MIT
- 主语言
- Python
- FA 评分
- 29/100 · 缺口较多
30 秒速览
- 运行形态
- 可在哪里用
- 兼容但需适配OpenAI API · Claude API(部分支持)
- 费用
- 软件免费,模型调用费用自付
- 上手难度
- 高 · 需要较重的基础设施
- 开始前需要
- 典型场景
- 研究人员需要针对一段播客或视频素材进行问答、摘要,并准备 Whisper 模型时,可使用 Video QA/Summarization 流程。
- 不适合
- 没有 8GB 显存 GPU 或非 Linux/Windows 环境的用户
- 希望开箱即用、不愿配置多个模型与 API 密钥的团队
这个 Agent 能做什么,适合哪些场景?
VideoAgent 是一个面向视频理解、编辑和再创作的一体化框架,MIT 许可。它通过意图分析、意图到 Agent 的映射,以及图驱动的工作流生成来处理用户需求,并包含两步自评反馈机制。其 Storyboard Agent 会分析预先生成字幕的视频素材库,将输入拆解为视觉和语义对齐的细粒度查询,用于视频检索。README 所列功能包括视频问答、摘要、影片剪辑、解说视频、视频概览、梗视频改编、音乐视频和跨语言改编。项目以本地 Python 命令行方式运行,入口为 main.py,并依赖本地下载的语音、语音转换、字幕和多模态模型。
用户运行 python main.py 后,在 User Requirement: 提示处输入需求。系统将需求拆为显式和隐式子意图,通过 intent-to-agent mapping 选择能力,并由图驱动框架生成可执行工作流及执行顺序;自评反馈用于迭代改进规划。Storyboard Agent 读取带预字幕的视频素材库,生成细粒度视觉查询以检索相关片段。按任务类型,框架可进行视频问答或摘要,也可生成影片剪辑、解说视频、视频概览、梗视频、音乐视频及跨语言喜剧改编;模型配置位于 environment/config/config.yml,可配置 DeepSeek、Claude、GPT 和 Gemini 的 API 密钥与 Base URL。
- 研究人员需要针对一段播客或视频素材进行问答、摘要,并准备 Whisper 模型时,可使用 Video QA/Summarization 流程。
- 视频创作者希望把现有视频改写为新对白、保留原始视觉内容并维持原说话者音色时,可使用视频混剪、TTS 或 SVC 相关流程。
- 拥有单口喜剧脚本和参考素材的创作者,需要生成带表演节奏、观众反应和相关画面的完整视频时,可使用 README 展示的 stand-up 场景。
- 制作人要把英文脱口秀改为中文相声,或把中文相声改为英文脱口秀时,可使用 Cross Talk 或 Talk Show 所列流程。
- 音乐视频制作者需要使用 DiffSinger、seed-vc、Whisper 与 ImageBind 进行 AI 音乐视频制作时,可采用 MAD SVC 场景。
- 内容团队需要从素材库中检索与文本描述匹配的视频片段,并据此制作解说视频或视频概览时,可使用 Storyboard Agent 的查询与检索流程。
如何安装或部署这个 Agent?
运行环境要求为 Linux 或 Windows、8GB GPU 显存。执行:
git clone https://github.com/HKUDS/VideoAgent.git
conda create --name videoagent python=3.10
conda activate videoagent
conda install -y -c conda-forge pynini==2.1.5 ffmpeg
pip install -r requirements.txt按所需功能下载模型:CosyVoice、fish-speech、seed-vc、DiffSinger、Whisper 和 ImageBind 在 README 中均给出了 huggingface-cli download 或 wget 命令;ImageBind 下载前还需要执行 git lfs install。编辑 environment/config/config.yml,填写相应的 deepseek_api_key、claude_api_key、gpt_api_key、gemini_api_key 及对应 Base URL;README 明确说明 Claude 是 Agentic Graph Router 所必需的。
如何使用这个 Agent?
完成模型下载与 environment/config/config.yml 配置后,运行:
python main.py在控制台出现 User Requirement: 后输入视频任务。README 示例包括:对已有视频改写台词而保留原说话者音色和画面;或将单口喜剧脚本、参考脚本及素材制作成完整视频。不同场景需要下载对应模型:例如 Video QA/Summarization 需要 Whisper,Cross Talk、Talk Show、Comm 和 News 需要 CosyVoice、Whisper 与 ImageBind。
这个 Agent 有哪些优点和局限?
- 同一框架覆盖视频问答、摘要、剪辑、解说、概览、梗视频、音乐视频和跨语言改编,而非只覆盖单一视频任务。
- 以图驱动工作流将用户意图映射到能力组合,并记录了两步自评反馈机制,适合需要多步骤编排的视频任务。
- Storyboard Agent 将预字幕素材库转换为视觉和语义对齐的细粒度检索查询,明确覆盖了素材检索环节。
- 按功能列出了所需模型,允许只下载项目所需的一部分模型。
- README 明确要求 Claude 为 Agentic Graph Router 提供支持,因此部署并非完全独立于外部模型提供商。
- 不同功能还分别依赖 GPT、Gemini 或 DeepSeek 配置,以及 CosyVoice、fish-speech、seed-vc、DiffSinger、Whisper 和 ImageBind 等模型,环境准备成本较高。
- 运行要求 Linux 或 Windows、8GB GPU 显存,并需安装 Python 3.10、FFmpeg 和 Pynini 2.1.5。
- README 仅记录命令行入口
python main.py,未提供 HTTP API、容器部署或托管服务接口的证据。 - 演示视频的音视频素材来自互联网且仅声明用于研究和演示,商业使用时需自行核查素材权利。
这个 Agent 与同类方案有什么区别?
README 将 VideoAgent 与 Director、Funclip、NarratoAI 和 NotebookLM 对比:表中 VideoAgent 覆盖节拍同步剪辑、故事叙述视频、视频概览、梗视频改编、歌曲混剪、跨语言改编、视频问答和音效工具;其余产品在该表中仅覆盖其中部分能力。
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | 形态 / 费用 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|---|
| VideoAgent 当前 | 29 · 缺口较多 | 命令行工具免费 + 模型费 | ★ 1.9k | 2 个月前 | Python | — |
| Qwen Audio Agent | 59 · 缺口较多 | 命令行工具免费 + 模型费 | ★ 2.8k | 今天 | JavaScript | — |
| Big-AGI | 57 · 缺口较多 | 自托管服务免费版 + 付费版 | ★ 7.1k | 1 天前 | TypeScript | OpenAI API · Claude API |
| AgentCall join-meeting 技能 | 46 · 缺口较多 | Agent 插件 / 技能免费版 + 付费版 | ★ 159 | 11 天前 | Python | Codex · Claude Code |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
证据显示:仓库未提供权限管理、用户确认、数据流透明、敏感数据处理、依赖安全、外部影响、回滚或来源归属的说明。所有信任相关标准均缺失,因此得分为0。
证据显示:README和pyproject.toml在依赖和功能描述上基本一致,但存在不一致之处,如pyproject.toml声明license为Apache而实际LICENSE为MIT,且README声称支持Windows但依赖中包含仅Linux的包。依赖可用性方面,大量依赖来自外部源,但未提供版本锁定或镜像,存在可用性风险。失败消息方面,未提供错误处理或用户提示的文档。
证据显示:README明确了目标用户(视频创作者、研究者)和多种使用场景(视频理解、编辑、重制),但能力边界描述模糊,未明确限制或失败条件。触发精度方面,用户通过自然语言输入,但未说明如何精确控制或避免误触发。环境适配方面,提供了环境要求(GPU内存、OS)和安装步骤,但未说明不同操作系统或硬件的兼容性细节。
证据显示:README提供了清晰的目录结构和功能概览,安装说明详细,但缺少版本变更日志和明确的维护责任。命名稳定性方面,项目名称和版本号在pyproject.toml中定义,但未说明命名约定或稳定性保证。示例和FAQ方面,提供了多个演示和示例,但缺少FAQ。已知限制方面,仅在README中提及内容版权问题,未全面说明技术限制。许可证方面,LICENSE文件为MIT,但pyproject.toml声明为Apache,存在不一致。
证据显示:输出可用性方面,README展示了多种视频输出类型和演示,但未提供输出格式或质量保证。边际价值方面,项目提供了多种独特功能(如跨语言改编、梗视频重制),但未与现有工具进行详细对比。成本效益方面,需要下载多个大型模型和依赖,但未提供资源消耗或性能基准。
证据显示:README中的性能声明(如成功率0.95)未提供具体实验数据或复现步骤,缺乏可追溯性。跨来源验证方面,仅依赖README和pyproject.toml,未提供第三方验证。事实与推断分离方面,README将功能描述和性能声明混合,未明确区分事实和推断。
- 源码中未见:最小权限约束只授予完成任务所需的权限:用专用账号或只读令牌,并限定可访问的目录和仓库。
- 源码中未见:执行前用户确认开启或自行加上执行前确认;先在沙箱或测试环境跑通,确认行为后再接入真实数据。
- 源码中未见:数据流向说明运行时观察它连接了哪些外部服务(代理或防火墙日志);弄清数据去向之前不要输入敏感数据。
- 源码中未见:敏感信息处理使用专用、低权限、可随时吊销的 API 密钥,不要复用生产凭据,也不要让密钥出现在日志里。
- 源码中未见:依赖安全审查安装前固定版本并做一次依赖扫描(如 npm audit、pip-audit);优先放在容器里运行。
- 源码中未见:外部影响披露先弄清它会写入、发送或修改哪些外部系统,用测试账号或测试仓库验证后再接入正式环境。
- 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
- 源码中未见:来源归属可核验从官方仓库或包源安装,核对发布者和仓库地址,避免同名仿冒包。
- 许可证声明不一致:pyproject.toml声明Apache,但LICENSE文件为MIT,可能引起法律混淆。
- 依赖安全未评估:大量依赖来自外部源,且未提供版本锁定或安全审计,存在供应链风险。
- 性能声明缺乏证据:README声称成功率0.95等,但未提供实验数据或复现步骤,不可验证。
- 数据流和权限不透明:未说明如何处理用户数据、API密钥或权限,存在隐私和安全风险。
常见问题
必须配置哪些模型 API?
能否只下载部分本地模型?
如何启动并提交任务?
python main.py,然后在控制台的 User Requirement: 提示处输入需求。