anything2explainer

给一个题目,产出一条带配音、字幕与章节进度条的代码绘制讲解视频。

Star 数
★ 2.4k
最近更新
23 天前
License
NOASSERTION
主语言
TypeScript

30 秒速览

运行形态
Agent 插件 / 技能命令行工具
可在哪里用
兼容但需适配Codex · Claude Code
费用
软件免费,模型调用费用自付
上手难度
中 · 需要几步配置
开始前需要
Node.js 18+ffmpegPython 3zshRemotion 4.0edge-tts 7.2.8numpypillowscipykokoro + soundfile + espeak-ng(英文 TTS,可选)Chromium / REMOTION_BROWSER_EXECUTABLE(Linux ARM)Shell / 命令行网络访问本地文件系统
典型场景
技术内容创作者想为「向量数据库」「RAG 与知识库」这类抽象主题做一条 3–5 分钟的黑底动效讲解片,但不想拍摄或购买素材。
不适合
  • 需要商用授权却不想联系作者的团队(PolyForm Noncommercial)
  • 只想输出竖屏 9:16 短视频的创作者

这个 Agent 能做什么,适合哪些场景?

anything2explainer 是面向 Claude Code 与 Codex 的技能包,输入一个主题或一篇文章,输出 1280×720 @30fps 的 H.264 讲解视频,含 TTS 配音、逐词对齐字幕、章节卡、顶部 HUD 和底部章节进度条。它不是一个 CLI,而是一整套让 AI 编码代理完成影片的方法:可编译的 Remotion 4 模板、图元与灯光库、配音/分镜/渲染/量化 QC 脚本、写死的风格与动效规范、多代理分工协议,以及一部参考影片作为质量基线。每一帧都由 Remotion(React + TypeScript)代码绘制,不使用素材库或生成式视频模型。执行流程为 9 个阶段——脚手架、调研、旁白与时间轴、分镜、叠加与图元、试拍、并行构建、渲染、QC 与修复,并在时长语言、旁白定稿、配音引擎、前 30 秒四个检查点暂停等待确认。支持中文与英文两套节奏模型、字幕预算与默认音色。

技能读取 SKILL.md 描述的 9 阶段流程并驱动代理执行:先用 template/scripts/new_project.sh 复制 Remotion 模板生成项目;调研代理产出一份带来源 URL 的调研文档(每个数字、年份、机构、英文术语都要能溯源);随后写入 script/narration.txt 并运行 python3 scripts/tts_build.py,用 edge-tts(中文 zh-CN-YunxiNeural)或 kokoro-82m(英文 am_liam)生成配音,把逐词边界转成帧级时间轴与字幕表;再由 python3 scripts/render_storyboard.py 生成分镜;并行构建代理每个负责 5–7 个镜头,编写纯函数式 Remotion 组件到 src/shots/G1..Gn;src/config.ts 控制 lang、bg('dots' 点阵波或 'stars' 星野)、时长等;渲染用 VER=v1 scripts/render.sh,量化检查用 python3 scripts/frame_metrics.py;QC 代理按章节审片,修复代理按组返工,最后输出交付说明。也可手动用 scripts/preview.sh 30 先渲染前 30 秒。所有动画是帧号的纯函数并使用带种子的随机数,文字排布靠计算而非 DOM 测量,因此重复渲染结果一致。

  1. 技术内容创作者想为「向量数据库」「RAG 与知识库」这类抽象主题做一条 3–5 分钟的黑底动效讲解片,但不想拍摄或购买素材。
  2. 教育类团队需要把一篇文章或文档转成有配音、有章节进度条的课程短片,并保留调研来源与 QC 报告作为可审计的过程材料。
  3. 已经在用 Claude Code 或 Codex 的开发者,希望把一个主题直接交给代理,在 1–3 小时内拿到成片,并在四个检查点控制方向。
  4. 需要中英双语版本的发布方:同一份分镜可以重定时为英文配音版本,两版共享 44 个镜头。
  5. Raspberry Pi 5 或 Linux ARM 用户,用 kokoro_onnx 或 piper 本地 TTS,配合系统 Chromium 完成离线为主的渲染流程。
  6. 需要量化质检流水线的团队:用 frame_metrics.py 对渲染帧做客观指标检查,再由 QC 代理对照书面标准判定。

如何安装或部署这个 Agent?

克隆仓库并把它软链到 Claude Code 或 Codex 的技能目录:

git clone https://github.com/Vincentwei1021/anything2explainer.git
ln -s "$PWD/anything2explainer" ~/.claude/skills/anything2explainer   # Claude Code
ln -s "$PWD/anything2explainer" ~/.codex/skills/anything2explainer    # Codex

安装依赖(Node ≥18,模板 npm install 会拉取 remotion 4.0.507 / react 19;ffmpeg 必需):

brew install ffmpeg
python3 -m venv ~/.venvs/a2e && source ~/.venvs/a2e/bin/activate
pip install 'edge-tts==7.2.8' numpy pillow scipy

只有走英文旁白(kokoro-82m 本地运行)时才需要额外安装:

pip install kokoro soundfile && brew install espeak-ng

scipy 仅被 QC 脚本 frame_metrics.py 使用。脚本是 zsh + Python 3,在 macOS 上开发验证;Linux 可用,Windows 未测试。

Linux / Raspberry Pi(ARM64,Python 3.13 已验证)差异:

sudo apt install zsh espeak-ng
sudo apt install chromium                       # 或 chromium-browser
export REMOTION_BROWSER_EXECUTABLE=/usr/bin/chromium

ARM 上 kokoro 难以安装时可改用 kokoro_onnx 或 piper:

pip install kokoro-onnx
TTS_ENGINE=kokoro_onnx KOKORO_ONNX_MODEL=…/kokoro-v1.0.onnx KOKORO_ONNX_VOICES=…/voices-v1.0.bin \
  KOKORO_ONNX_VOICE=am_michael python3 scripts/tts_build.py
pip install piper-tts
TTS_ENGINE=piper PIPER_MODEL=…/en_US-ryan-medium.onnx python3 scripts/tts_build.py

云端的 edge 引擎在 Linux 上也可用:

TTS_ENGINE=edge VOICE=en-US-AndrewNeural python3 scripts/tts_build.py

如何使用这个 Agent?

在 Claude Code 或 Codex 里直接说出需求,技能会自行触发,例如「讲一下向量数据库,做成一条讲解视频」或 "Make me an explainer video about vector databases.",然后按 SKILL.md 的 9 个阶段推进(脚手架、调研、旁白与时间轴、分镜、叠加与图元、试拍、并行构建、渲染、QC 与修复),并在四个检查点等待你确认。

也可以手动驱动模板:

template/scripts/new_project.sh ~/work/my-video myslug
cd ~/work/my-video
# 1. research/调研.md          2. script/narration.txt → python3 scripts/tts_build.py
# 3. script/storyboard_src.md → python3 scripts/render_storyboard.py     4. edit src/config.ts
# 5. src/shots/G1..Gn          6. scripts/preview.sh 30   (first 30 seconds)
# 7. VER=v1 scripts/render.sh + python3 scripts/frame_metrics.py         8. QC → fix → v2/v3

更换视觉风格只有一个开关,src/config.ts 里的 bg:

bg: 'dots'   // 点阵波背景(默认)
bg: 'stars'  // 星野 + 雾渐变背景

使用自带配音时,把成品音频放到 public/assets/<slug>/audio.wav,并手填 src/common/timeline.ts 与 subs.ts(格式见 tts_build.py 顶部注释),下游流程不变。

这个 Agent 有哪些优点和局限?

优点
  • 画面完全由代码生成,每一帧都是帧号的纯函数并使用带种子的随机数,重复渲染结果确定,任何一帧都能通过改一个镜头文件修正。
  • 可审计性高:屏幕上出现的每个数字、年份、机构与英文术语都必须能追溯到调研文档里的来源 URL,另外还附带 QC 报告与交付说明。
  • 并行代理构建 + 量化 QC:8 个构建代理并行写镜头,QC 代理按章节审片、修复代理按组返工,参考片 4′35″ 用了 8 个构建代理 40 分钟、两轮 QC。
  • 共享分镜即可产出中英两版,两版共用 44 个镜头,英文版按英文配音重新定时,不必重做画面。
  • 无需 GPU,Remotion 通过无头 Chromium 在 CPU 上渲染;英文默认音色 kokoro-82m 只有 8200 万参数,可在本地 CPU 跑。
局限
  • 工具包采用 PolyForm Noncommercial 1.0.0,商用需作者事先授权,不是标准开源许可。
  • 旁白一旦配音完成,文字即被冻结——镜头代码硬编码帧号,改一个词就会让整片重新定时,返工代价高。
  • 只支持中文和英文,只有一种视觉风格(两个背景可切换),改其他风格必须去改 reference/style-guide.md 与 src/ui.tsx。
  • 不支持竖屏 9:16,模板与所有安全区规则都按 1280×720 横屏设计。
  • 并行构建吃资源:多个代理同时打包 Remotion,磁盘需保留 ≥5 GB 空间,tmux 面板数上限约 12,超过要分批调度;脚本在 macOS 验证,Windows 未测试。

这个 Agent 与同类方案有什么区别?

README 明确列出了四类对照工具:生成式视频模型(Sora、Veo、Runway)输出的是从提示词合成的素材,而它是确定性代码而非像素,屏幕上的每个数字可溯源,任一帧都能通过改一个镜头文件修复;数字人/主播工具(HeyGen、Synthesia)产出的是读稿的虚拟主播,它没有主播,而是讲解机制的运动图形;手工使用 Remotion 或 Motion Canvas 只提供一个可编程视频画布,它在此之上附带整套方法(调研→旁白→分镜→并行构建→QC)以及风格规范、动效词汇与参考片;Manim 做的是 Python 数学动画,它是代理驱动的端到端流水线,带 TTS 对齐字幕、章节与 QC,且用 React / TypeScript 而非 Python。

与相关度最高的同类 agent 并排比较关键指标。

Agent 源码审查 形态 / 费用 Star 最近更新 主语言 完整支持的平台
anything2explainer 当前 47 · 缺口较多 Agent 插件 / 技能免费 + 模型费 ★ 2.4k 23 天前 TypeScript Codex · Claude Code
Motion Graphics Skills 39 · 缺口较多 Agent 插件 / 技能免费 ★ 781 11 天前 HTML Codex · Claude Code
视频镜头工艺 0 · 缺口较多 Agent 插件 / 技能免费 ★ 11k 今天 TypeScript Codex · Claude Code
AI图像提示词推荐技能(Nano Banana Pro) 38 · 缺口较多 Agent 插件 / 技能免费 ★ 1.9k 今天 TypeScript Claude Code

FollowAgents 如何评估这个 Agent?

FollowAgents 源码审查 · FARS-2.1
缺口较多
47/ 100 五分制 2.4 / 5
信任安全 12/29
可靠稳定 6/14
适用触发 10/18
规范维护 9/18
有效结果 7/13
证据核验 3/8
查看各维度的扣分理由
信任安全12 / 29 · 2.1/5

证据:README 明确列出四个检查点(长度/语言、旁白定稿、配音引擎、前 30 秒预览),属于用户确认机制,故 user_confirmation 给 2;原创性一节要求每个数字/年份/机构都追溯到来源 URL,且 B-roll 需登记 sha256/来源/许可,source_attribution 给 2。扣分:仓库未提供任何权限清单或最小权限说明,脚本以 shell 直接执行、可写任意路径,least_privilege 仅 1;edge-tts 会把旁白文本发送到微软云端端点,README 只在 FAQ 中一句带过,缺少数据流图与保留策略,data_flow_transparency 与 sensitive_data_handling 各 1;依赖仅给出 pip 安装命令,无锁文件、无哈希校验、无漏洞扫描说明,dependency_security 仅 1;渲染/克隆/写盘等外部副作用无 dry-run 或影响范围说明,external_effects 1;无版本回滚或产物清理机制,rollback 1。

可靠稳定6 / 14 · 2.1/5

证据:README 对输出规格(1280×720@30fps、H.264、字幕 44px、章节进度条)、长度分档表、章节数量规则、帧间隔(句内 10 帧、段末 30 帧)描述前后一致,self_consistency 给 2。扣分:依赖可用性只靠文字说明,未提供 lockfile 或版本矩阵,且自承 kokoro 在 ARM/Python 3.13 上装不上、edge-tts 会随升级失效,dependency_availability 仅 1;失败信息方面只提到 lessons.md 记录踩坑,未展示任何错误码、诊断输出或恢复步骤,failure_messages 仅 1。

适用触发10 / 18 · 2.8/5

证据:明确面向 Claude Code 与 Codex,给出中英双语、2–8 分钟长度档、两种背景、自带 TTS 路径,audience_and_scenarios 与 capability_boundaries 各 2;环境适配写清 macOS 已验证、Linux/树莓派 ARM 的 Chromium 与 TTS 替代方案,environment_fit 给 2。扣分:触发精度只靠自然语言示例(“Make me an explainer video about…”),没有触发词表、排除条件或误触发防护,trigger_precision 仅 1。

规范维护9 / 18 · 2.5/5

证据:仓库布局、9 阶段流程、四检查点、FAQ、已知限制、许可(PolyForm Noncommercial + 字体 OFL 分列)都写得清楚,information_architecture、install_notes、examples_and_faq、known_limitations、license 各 2。扣分:无 CHANGELOG、无版本号或发布标签,versioning_changelog 为 0;命名稳定性方面 slug、VER=v1、TTS_ENGINE 等约定散落各处且无稳定契约,naming_stability 仅 1;维护责任只由 LICENSE 中的 Required Notice 与作者署名间接体现,无 issue 响应或维护承诺,maintenance_responsibility 仅 1。

有效结果7 / 13 · 2.7/5

证据:产出为可直接交付的 MP4 加完整纸面链路(研究、旁白、分镜、逐镜源码、QC 报告),output_usability 给 2;相对手写 Remotion/Manim,它把研究→旁白→分镜→并行构建→QC 的方法论与参考片一并交付,marginal_value 给 2。扣分:成本收益仅给出 1–3 小时与约 2–3 GB 磁盘的粗略估计,未说明 token 消耗、并行 agent 的失败重试成本,且并行构建需 ≥5 GB 空闲、tmux 超过约 12 个 pane 要分批,cost_benefit 仅 1。

证据核验3 / 8 · 1.9/5

证据:README 声称每个数字都可追溯到研究文档中的 URL,并给出 examples/rag/ 的完整纸面链路与 examples/contrast/ 的对照帧,claim_traceability 与 cross_source_corroboration 各 1。扣分:所有质量结论(“QC 两轮”“可复现”“参考片质量”)均为作者自述,静态审查无法核对渲染帧与 QC 报告是否真的一致,fact_inference_separation 仅 1——文档把“设计意图”与“已验证事实”混写,例如“Are the renders reproducible? Yes.”属于断言而非可核验证据。

风险与缓解建议
  • edge-tts 会把旁白文本发送到微软云端端点;若旁白含未公开材料,请改用本地 TTS(kokoro/piper)或自带音频。
  • 脚本以用户完整权限执行 shell 与渲染,仓库未提供权限清单或沙箱建议,建议在隔离环境或容器中运行。
  • 依赖仅以 pip 命令给出,无锁文件与哈希校验;edge-tts 被作者自承会随升级失效,安装前应固定版本并自行审计。
  • PolyForm Noncommercial 许可禁止未经授权的商业使用;Remotion 本身对公司另有许可条款,商用前需分别确认。
  • README 中的质量与可复现性结论均为作者自述,静态审查无法验证,请以 examples/rag/ 的产物自行核对。
  • 无 CHANGELOG 与版本标签,升级或回滚缺少可依赖的版本锚点。
证据充分度:低 评估于 2026年10月11日 审查版本 735c79c8724e
评估证据 README.mdLICENSE
查看完整评分方法 →

常见问题

生成一条视频要花多少钱?
工具包本身免费用于非商业用途(PolyForm Noncommercial)。软件本身没有订阅费,但英文默认的 edge-tts 是对微软端点的云调用,且你需要自备运行代理的 Claude Code / Codex 账号与额度;商用需另行获得作者授权。
需要 GPU 吗?
不需要。Remotion 通过无头 Chromium 在 CPU 上渲染。中文默认音色 edge-tts 是云端调用,英文默认音色 kokoro-82m 是 8200 万参数模型,可在本地 CPU 运行。
可以用我自己的配音或别的 TTS 吗?
可以。把成品音频放到 public/assets/<slug>/audio.wav,并手工填写 src/common/timeline.ts 与 subs.ts(格式写在 tts_build.py 顶部)。Linux/ARM 上也可通过 TTS_ENGINE 选择 kokoro_onnx、piper 或 edge。
渲染结果可复现吗?
可复现。每个动画都是帧号的纯函数并使用带种子的随机数,文字适配靠计算而不是在 DOM 里测量,所以重新渲染得到相同的帧。
中文旁白定稿后还能改词吗?
能改但代价高:镜头代码硬编码了帧号,改动一个字都会让整片重新定时。旁白定稿是所有检查点里最便宜的干预点,之后再审片成本会显著上升。
在 GitHub 查看 ↗ 安装 ↓

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents