anything2explainer
给一个题目,产出一条带配音、字幕与章节进度条的代码绘制讲解视频。
- Star 数
- ★ 2.4k
- 最近更新
- 23 天前
- License
- NOASSERTION
- 主语言
- TypeScript
- FA 评分
- 47/100 · 缺口较多
30 秒速览
- 运行形态
- 可在哪里用
- 兼容但需适配Codex · Claude Code
- 费用
- 软件免费,模型调用费用自付
- 上手难度
- 中 · 需要几步配置
- 开始前需要
- 典型场景
- 技术内容创作者想为「向量数据库」「RAG 与知识库」这类抽象主题做一条 3–5 分钟的黑底动效讲解片,但不想拍摄或购买素材。
- 不适合
- 需要商用授权却不想联系作者的团队(PolyForm Noncommercial)
- 只想输出竖屏 9:16 短视频的创作者
- 源码审查
- 47/100 · 缺口较多
这个 Agent 能做什么,适合哪些场景?
anything2explainer 是面向 Claude Code 与 Codex 的技能包,输入一个主题或一篇文章,输出 1280×720 @30fps 的 H.264 讲解视频,含 TTS 配音、逐词对齐字幕、章节卡、顶部 HUD 和底部章节进度条。它不是一个 CLI,而是一整套让 AI 编码代理完成影片的方法:可编译的 Remotion 4 模板、图元与灯光库、配音/分镜/渲染/量化 QC 脚本、写死的风格与动效规范、多代理分工协议,以及一部参考影片作为质量基线。每一帧都由 Remotion(React + TypeScript)代码绘制,不使用素材库或生成式视频模型。执行流程为 9 个阶段——脚手架、调研、旁白与时间轴、分镜、叠加与图元、试拍、并行构建、渲染、QC 与修复,并在时长语言、旁白定稿、配音引擎、前 30 秒四个检查点暂停等待确认。支持中文与英文两套节奏模型、字幕预算与默认音色。
技能读取 SKILL.md 描述的 9 阶段流程并驱动代理执行:先用 template/scripts/new_project.sh 复制 Remotion 模板生成项目;调研代理产出一份带来源 URL 的调研文档(每个数字、年份、机构、英文术语都要能溯源);随后写入 script/narration.txt 并运行 python3 scripts/tts_build.py,用 edge-tts(中文 zh-CN-YunxiNeural)或 kokoro-82m(英文 am_liam)生成配音,把逐词边界转成帧级时间轴与字幕表;再由 python3 scripts/render_storyboard.py 生成分镜;并行构建代理每个负责 5–7 个镜头,编写纯函数式 Remotion 组件到 src/shots/G1..Gn;src/config.ts 控制 lang、bg('dots' 点阵波或 'stars' 星野)、时长等;渲染用 VER=v1 scripts/render.sh,量化检查用 python3 scripts/frame_metrics.py;QC 代理按章节审片,修复代理按组返工,最后输出交付说明。也可手动用 scripts/preview.sh 30 先渲染前 30 秒。所有动画是帧号的纯函数并使用带种子的随机数,文字排布靠计算而非 DOM 测量,因此重复渲染结果一致。
- 技术内容创作者想为「向量数据库」「RAG 与知识库」这类抽象主题做一条 3–5 分钟的黑底动效讲解片,但不想拍摄或购买素材。
- 教育类团队需要把一篇文章或文档转成有配音、有章节进度条的课程短片,并保留调研来源与 QC 报告作为可审计的过程材料。
- 已经在用 Claude Code 或 Codex 的开发者,希望把一个主题直接交给代理,在 1–3 小时内拿到成片,并在四个检查点控制方向。
- 需要中英双语版本的发布方:同一份分镜可以重定时为英文配音版本,两版共享 44 个镜头。
- Raspberry Pi 5 或 Linux ARM 用户,用 kokoro_onnx 或 piper 本地 TTS,配合系统 Chromium 完成离线为主的渲染流程。
- 需要量化质检流水线的团队:用 frame_metrics.py 对渲染帧做客观指标检查,再由 QC 代理对照书面标准判定。
如何安装或部署这个 Agent?
克隆仓库并把它软链到 Claude Code 或 Codex 的技能目录:
git clone https://github.com/Vincentwei1021/anything2explainer.git
ln -s "$PWD/anything2explainer" ~/.claude/skills/anything2explainer # Claude Code
ln -s "$PWD/anything2explainer" ~/.codex/skills/anything2explainer # Codex安装依赖(Node ≥18,模板 npm install 会拉取 remotion 4.0.507 / react 19;ffmpeg 必需):
brew install ffmpeg
python3 -m venv ~/.venvs/a2e && source ~/.venvs/a2e/bin/activate
pip install 'edge-tts==7.2.8' numpy pillow scipy只有走英文旁白(kokoro-82m 本地运行)时才需要额外安装:
pip install kokoro soundfile && brew install espeak-ngscipy 仅被 QC 脚本 frame_metrics.py 使用。脚本是 zsh + Python 3,在 macOS 上开发验证;Linux 可用,Windows 未测试。
Linux / Raspberry Pi(ARM64,Python 3.13 已验证)差异:
sudo apt install zsh espeak-ng
sudo apt install chromium # 或 chromium-browser
export REMOTION_BROWSER_EXECUTABLE=/usr/bin/chromiumARM 上 kokoro 难以安装时可改用 kokoro_onnx 或 piper:
pip install kokoro-onnx
TTS_ENGINE=kokoro_onnx KOKORO_ONNX_MODEL=…/kokoro-v1.0.onnx KOKORO_ONNX_VOICES=…/voices-v1.0.bin \
KOKORO_ONNX_VOICE=am_michael python3 scripts/tts_build.pypip install piper-tts
TTS_ENGINE=piper PIPER_MODEL=…/en_US-ryan-medium.onnx python3 scripts/tts_build.py云端的 edge 引擎在 Linux 上也可用:
TTS_ENGINE=edge VOICE=en-US-AndrewNeural python3 scripts/tts_build.py如何使用这个 Agent?
在 Claude Code 或 Codex 里直接说出需求,技能会自行触发,例如「讲一下向量数据库,做成一条讲解视频」或 "Make me an explainer video about vector databases.",然后按 SKILL.md 的 9 个阶段推进(脚手架、调研、旁白与时间轴、分镜、叠加与图元、试拍、并行构建、渲染、QC 与修复),并在四个检查点等待你确认。
也可以手动驱动模板:
template/scripts/new_project.sh ~/work/my-video myslug
cd ~/work/my-video
# 1. research/调研.md 2. script/narration.txt → python3 scripts/tts_build.py
# 3. script/storyboard_src.md → python3 scripts/render_storyboard.py 4. edit src/config.ts
# 5. src/shots/G1..Gn 6. scripts/preview.sh 30 (first 30 seconds)
# 7. VER=v1 scripts/render.sh + python3 scripts/frame_metrics.py 8. QC → fix → v2/v3更换视觉风格只有一个开关,src/config.ts 里的 bg:
bg: 'dots' // 点阵波背景(默认)
bg: 'stars' // 星野 + 雾渐变背景使用自带配音时,把成品音频放到 public/assets/<slug>/audio.wav,并手填 src/common/timeline.ts 与 subs.ts(格式见 tts_build.py 顶部注释),下游流程不变。
这个 Agent 有哪些优点和局限?
- 画面完全由代码生成,每一帧都是帧号的纯函数并使用带种子的随机数,重复渲染结果确定,任何一帧都能通过改一个镜头文件修正。
- 可审计性高:屏幕上出现的每个数字、年份、机构与英文术语都必须能追溯到调研文档里的来源 URL,另外还附带 QC 报告与交付说明。
- 并行代理构建 + 量化 QC:8 个构建代理并行写镜头,QC 代理按章节审片、修复代理按组返工,参考片 4′35″ 用了 8 个构建代理 40 分钟、两轮 QC。
- 共享分镜即可产出中英两版,两版共用 44 个镜头,英文版按英文配音重新定时,不必重做画面。
- 无需 GPU,Remotion 通过无头 Chromium 在 CPU 上渲染;英文默认音色 kokoro-82m 只有 8200 万参数,可在本地 CPU 跑。
- 工具包采用 PolyForm Noncommercial 1.0.0,商用需作者事先授权,不是标准开源许可。
- 旁白一旦配音完成,文字即被冻结——镜头代码硬编码帧号,改一个词就会让整片重新定时,返工代价高。
- 只支持中文和英文,只有一种视觉风格(两个背景可切换),改其他风格必须去改 reference/style-guide.md 与 src/ui.tsx。
- 不支持竖屏 9:16,模板与所有安全区规则都按 1280×720 横屏设计。
- 并行构建吃资源:多个代理同时打包 Remotion,磁盘需保留 ≥5 GB 空间,tmux 面板数上限约 12,超过要分批调度;脚本在 macOS 验证,Windows 未测试。
这个 Agent 与同类方案有什么区别?
README 明确列出了四类对照工具:生成式视频模型(Sora、Veo、Runway)输出的是从提示词合成的素材,而它是确定性代码而非像素,屏幕上的每个数字可溯源,任一帧都能通过改一个镜头文件修复;数字人/主播工具(HeyGen、Synthesia)产出的是读稿的虚拟主播,它没有主播,而是讲解机制的运动图形;手工使用 Remotion 或 Motion Canvas 只提供一个可编程视频画布,它在此之上附带整套方法(调研→旁白→分镜→并行构建→QC)以及风格规范、动效词汇与参考片;Manim 做的是 Python 数学动画,它是代理驱动的端到端流水线,带 TTS 对齐字幕、章节与 QC,且用 React / TypeScript 而非 Python。
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | 形态 / 费用 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|---|
| anything2explainer 当前 | 47 · 缺口较多 | Agent 插件 / 技能免费 + 模型费 | ★ 2.4k | 23 天前 | TypeScript | Codex · Claude Code |
| Motion Graphics Skills | 39 · 缺口较多 | Agent 插件 / 技能免费 | ★ 781 | 11 天前 | HTML | Codex · Claude Code |
| 视频镜头工艺 | 0 · 缺口较多 | Agent 插件 / 技能免费 | ★ 11k | 今天 | TypeScript | Codex · Claude Code |
| AI图像提示词推荐技能(Nano Banana Pro) | 38 · 缺口较多 | Agent 插件 / 技能免费 | ★ 1.9k | 今天 | TypeScript | Claude Code |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
证据:README 明确列出四个检查点(长度/语言、旁白定稿、配音引擎、前 30 秒预览),属于用户确认机制,故 user_confirmation 给 2;原创性一节要求每个数字/年份/机构都追溯到来源 URL,且 B-roll 需登记 sha256/来源/许可,source_attribution 给 2。扣分:仓库未提供任何权限清单或最小权限说明,脚本以 shell 直接执行、可写任意路径,least_privilege 仅 1;edge-tts 会把旁白文本发送到微软云端端点,README 只在 FAQ 中一句带过,缺少数据流图与保留策略,data_flow_transparency 与 sensitive_data_handling 各 1;依赖仅给出 pip 安装命令,无锁文件、无哈希校验、无漏洞扫描说明,dependency_security 仅 1;渲染/克隆/写盘等外部副作用无 dry-run 或影响范围说明,external_effects 1;无版本回滚或产物清理机制,rollback 1。
证据:README 对输出规格(1280×720@30fps、H.264、字幕 44px、章节进度条)、长度分档表、章节数量规则、帧间隔(句内 10 帧、段末 30 帧)描述前后一致,self_consistency 给 2。扣分:依赖可用性只靠文字说明,未提供 lockfile 或版本矩阵,且自承 kokoro 在 ARM/Python 3.13 上装不上、edge-tts 会随升级失效,dependency_availability 仅 1;失败信息方面只提到 lessons.md 记录踩坑,未展示任何错误码、诊断输出或恢复步骤,failure_messages 仅 1。
证据:明确面向 Claude Code 与 Codex,给出中英双语、2–8 分钟长度档、两种背景、自带 TTS 路径,audience_and_scenarios 与 capability_boundaries 各 2;环境适配写清 macOS 已验证、Linux/树莓派 ARM 的 Chromium 与 TTS 替代方案,environment_fit 给 2。扣分:触发精度只靠自然语言示例(“Make me an explainer video about…”),没有触发词表、排除条件或误触发防护,trigger_precision 仅 1。
证据:仓库布局、9 阶段流程、四检查点、FAQ、已知限制、许可(PolyForm Noncommercial + 字体 OFL 分列)都写得清楚,information_architecture、install_notes、examples_and_faq、known_limitations、license 各 2。扣分:无 CHANGELOG、无版本号或发布标签,versioning_changelog 为 0;命名稳定性方面 slug、VER=v1、TTS_ENGINE 等约定散落各处且无稳定契约,naming_stability 仅 1;维护责任只由 LICENSE 中的 Required Notice 与作者署名间接体现,无 issue 响应或维护承诺,maintenance_responsibility 仅 1。
证据:产出为可直接交付的 MP4 加完整纸面链路(研究、旁白、分镜、逐镜源码、QC 报告),output_usability 给 2;相对手写 Remotion/Manim,它把研究→旁白→分镜→并行构建→QC 的方法论与参考片一并交付,marginal_value 给 2。扣分:成本收益仅给出 1–3 小时与约 2–3 GB 磁盘的粗略估计,未说明 token 消耗、并行 agent 的失败重试成本,且并行构建需 ≥5 GB 空闲、tmux 超过约 12 个 pane 要分批,cost_benefit 仅 1。
证据:README 声称每个数字都可追溯到研究文档中的 URL,并给出 examples/rag/ 的完整纸面链路与 examples/contrast/ 的对照帧,claim_traceability 与 cross_source_corroboration 各 1。扣分:所有质量结论(“QC 两轮”“可复现”“参考片质量”)均为作者自述,静态审查无法核对渲染帧与 QC 报告是否真的一致,fact_inference_separation 仅 1——文档把“设计意图”与“已验证事实”混写,例如“Are the renders reproducible? Yes.”属于断言而非可核验证据。
- edge-tts 会把旁白文本发送到微软云端端点;若旁白含未公开材料,请改用本地 TTS(kokoro/piper)或自带音频。
- 脚本以用户完整权限执行 shell 与渲染,仓库未提供权限清单或沙箱建议,建议在隔离环境或容器中运行。
- 依赖仅以 pip 命令给出,无锁文件与哈希校验;edge-tts 被作者自承会随升级失效,安装前应固定版本并自行审计。
- PolyForm Noncommercial 许可禁止未经授权的商业使用;Remotion 本身对公司另有许可条款,商用前需分别确认。
- README 中的质量与可复现性结论均为作者自述,静态审查无法验证,请以 examples/rag/ 的产物自行核对。
- 无 CHANGELOG 与版本标签,升级或回滚缺少可依赖的版本锚点。