写作与内容 video-translationsubtitle-generationspeech-transcriptiontts-dubbingvoice-cloningvideo-localizationcover-generationcli-automation

KrillinAI 视频翻译与配音

将视频转录、翻译、配音并重排为适配多平台的本地化成片。

FollowAgents 评估 · FARS-2.1
谨慎使用
62/ 100 五分制 3.1 / 5
1 2 3 4 5 6
1信任安全12 / 29 · 2.1/5

README区分本地与云端服务,列明下载、外部AI调用、文件产物及dry-run;工作流中的发布权限也限定为contents: write,因此数据流和外部效果有一定透明度。扣分原因是未说明发送给各云服务的具体数据、保留政策、日志脱敏或密钥存储保护;普通执行没有逐项确认机制,回滚仅可推测为删除工作目录;依赖虽有版本声明,但工作流使用master、latest及仅固定主版本的Actions,未展示审计或更新策略。来源仅归于Krillin AI团队并提供社群渠道,无法确认具体维护主体。

2可靠稳定8 / 14 · 2.9/5

CLI约定单行JSON、manifest复用和usage/retryable/dependency错误分类,有利于自动化故障处理;README也指出ffmpeg、ffprobe、yt-dlp等运行依赖并提供多种服务后端。扣分原因是pipeline与cover一方面列为可用命令,另一方面又称相关Skills为尚未完全接通的规划/保留指南,形成明显状态不一致;依赖安装、版本兼容和降级细节不完整,且没有提供错误结构实例。

3适用触发15 / 18 · 4.2/5

人类桌面用户、服务器用户、脚本和Agent场景区分清楚,各阶段命令、输入、输出、复用方式和平台目标具体,触发边界精确。扣分原因是部分能力仍标为未完全接通,输入语言少于宣传中的翻译语言范围;macOS签名、WhisperKit芯片限制和FasterWhisper平台差异虽有披露,但跨平台配置与资源要求仍不充分。

4规范维护11 / 18 · 3.1/5

README具有功能、服务矩阵、快速开始、CLI示例、配置、FAQ和联系方式等清晰结构;命令、产物和manifest命名较稳定,并明确披露桌面版缺陷、签名问题及保留能力。GPL-3.0全文与元数据一致,故许可证满分。扣分原因是安装说明依赖未提供内容的外链文档且有可疑的Google搜索式阿里云链接;未给出变更日志或兼容政策,标签发布工作流只能提供有限版本证据;维护责任只有团队称谓和社群联系方式。

5有效结果12 / 13 · 4.6/5

分阶段CLI、结构化JSON、manifest、可复用中间产物及明确媒体输出使结果可直接用于自动化;将下载、转写、翻译、配音和横竖屏渲染组合起来,较单一工具有明显增量价值。扣分原因是成本讨论只粗略区分本地免费推理与云服务成本,没有估算API、算力、存储、下载或长视频处理代价,部分端到端能力还被标为未完全接通。

6证据核验4 / 8 · 2.5/5

功能声明可部分追溯到命令表、示例、服务矩阵、go.mod及发布工作流,许可证也有直接文件证据。扣分原因是核心质量主张主要来自README自身,缺少测试、基准或其他所给文件的交叉佐证;“无遗漏或重叠”“质量非常高”“完美呈现”等营销性判断未与可验证事实或推断清晰分开。

证据充分度: 评估于 2026年8月23日 审查版本 b30c12f9e228
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 在发送媒体、字幕或声音样本到OpenAI、阿里云、MiniMax及其他兼容服务前,应自行核实上传字段、数据保留、训练使用和日志政策。
  • 将pipeline和cover用于无人值守生产流程前,应确认当前修订中的实际接线状态;README同时将其描述为可用命令和未完全接通的保留能力。
  • 固定并审计构建依赖与GitHub Actions,尤其是PairZhu/gpt-translate@master、Docker latest镜像和GoReleaser latest。
  • 使用视频下载、翻译、配音、声音克隆和封面生成能力时,应另行确认内容许可、肖像权、声音授权及目标平台规则。
  • macOS说明要求移除隔离属性且二进制未签名;执行前应独立验证发布产物的来源和完整性。
评估证据 [1][2][3][4][5]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

KrillinAI 是一套面向人类用户和 AI Agent 的音视频本地化工具,覆盖视频获取、语音识别、字幕翻译、TTS 配音、横竖屏合成与封面生成。人类用户可以通过桌面客户端或 Web 界面运行完整流程,自动化系统则可通过分阶段 CLI 单独调用 subtitle、tts、render-horizontal、render-vertical、pipeline 和 cover。CLI 默认同步执行,完成后向 stdout 输出单行 JSON,并在工作目录写入 krillinai_manifest.json,供后续阶段复用产物。项目可处理本地视频,也可通过 yt-dlp 获取在线视频,并针对哔哩哔哩、小红书、抖音、视频号、快手、YouTube 和 TikTok 等平台制作横屏或竖屏结果。它支持 Windows、Linux 和 macOS,可使用云端或本地语音识别方案,并通过兼容 OpenAI API 规范的云端或本地大模型完成翻译。采用前需要准备相应模型或服务凭据,同时安装视频处理与下载依赖。

输入可以是 YouTube、哔哩哔哩链接或本地视频。subtitle 命令优先尝试平台字幕,无法取得时再调用 Whisper 类识别服务,生成 origin_language_srt.srt、target_language_srt.srt、bilingual_srt.srt 和 short_origin_mixed_srt.srt 等文件;翻译环节通过兼容 OpenAI API 规范的大模型结合上下文处理字幕,并支持术语替换。tts 从目标语言字幕生成 tts_final_audio.wav,并可与视频合成为 video_with_tts.mp4,支持 Alibaba Cloud Voice Service、OpenAI TTS 和 MiniMax TTS;文档还说明 CosyVoice 音色与自定义克隆能力,且配置章节要求语音克隆选择阿里云。render-horizontal 将原视频与双语字幕,或配音视频与目标字幕,合成为横屏视频;render-vertical 负责竖屏转换、短字幕和标题排版。pipeline 通过 --outputs 串联多个阶段,cover 根据原始封面和提示模板生成 generated_cover.png。每个阶段记录 outputs,后续命令可只传 --workdir 读取清单;--dry-run 可在不下载视频、不调用外部 AI 服务的情况下校验参数和生成清单。

  1. 经营多语言 YouTube 或 TikTok 频道的团队,将已有视频转录、翻译、配音并输出目标平台版本。
  2. 需要把横屏长视频改编为抖音、小红书、快手或视频号竖屏内容的创作者,同时生成适合竖屏的短字幕与标题布局。
  3. 拥有本地视频素材的字幕团队,批量生成原文、译文、双语和短字幕文件,再交给人工校对。
  4. 构建内容自动化流程的开发者或 AI Agent,通过分阶段 CLI、JSON 输出和 manifest 复用中间产物。
  5. 希望控制云服务成本的自托管用户,在受支持的平台上采用 FasterWhisper、WhisperKit 或 WhisperCpp 进行本地转录。
  6. 需要统一缩略图风格的运营团队,利用 cover 阶段根据原始封面和提示模板生成平台封面。

这个 Agent 有哪些优点和局限?

优点
  • 从下载、转录、翻译和配音一直覆盖到横竖屏渲染与封面生成,减少在多个独立工具间搬运素材。
  • CLI 将 subtitle、tts、渲染等阶段拆开,并以 JSON、outputs 和 manifest 交接产物,适合脚本和 Agent 编排。
  • 识别侧同时提供 OpenAI Whisper、FasterWhisper、WhisperKit、WhisperCpp 和阿里云 ASR,可在本地成本、平台支持与云端便利性之间选择。
  • 大模型层兼容 OpenAI API 规范,文档明确列出 OpenAI、Gemini、DeepSeek、通义千问及本地开源模型。
  • 同时提供桌面、Web 服务和 CLI 使用方式,并覆盖 Windows、Linux 与 macOS。
局限
  • 完整流程依赖 ffmpeg、ffprobe 和 yt-dlp;云端识别、翻译、TTS 还需要网络、凭据并可能产生服务费用。
  • 本地识别方案存在平台限制:FasterWhisper 仅列出 Windows/Linux,WhisperKit 仅支持采用 M 系列芯片的 macOS。
  • macOS 可执行文件未签名,需要手动移除隔离属性并赋予执行权限;README 也说明桌面版较新,仍有持续修复的缺陷。
  • 非桌面版本需要手工创建并填写 config.toml,配置复杂度高于桌面客户端。
  • 文档将 pipeline 和 cover 的 Agent Skills 标为规划或预留指南,说明这些技能封装的执行路径尚未完全接通。
  • 语音克隆配置被限定为阿里云 TTS,采用其他 TTS 提供商时无法按所述方式使用该功能。

如何安装或部署这个 Agent?

最直接的方式是从 https://github.com/KrillinAI/KrillinAI/releases 下载与操作系统匹配的可执行文件,并放入空目录。桌面版可直接启动并在界面中配置;非桌面版需要新建 config/config.toml,将源码 config/config-example.toml 的内容复制进去并填写配置,然后运行可执行文件并访问 http://127.0.0.1:8888(端口以配置为准)。macOS 版本未签名:桌面版需依次执行 sudo xattr -cr ./KrillinAI_1.0.0_desktop_macOS_arm64、sudo chmod +x ./KrillinAI_1.0.0_desktop_macOS_arm64 和 ./KrillinAI_1.0.0_desktop_macOS_arm64;非桌面版对应使用 sudo xattr -rd com.apple.quarantine。项目也提供 Docker 部署说明。若从源码构建 CLI,安装 Go 后执行:go build -o build/krillinai-cli ./cmd/cli。实际处理还需要 ffmpeg、ffprobe 和 yt-dlp;使用云端识别、翻译或 TTS 时,需要填写所选服务的 API 密钥及相应配置。

如何使用这个 Agent?

仅做字幕翻译时,在 [transcribe] 中把 provider.name 设为 openai,并在 [llm] 中填写 OpenAI API 密钥;如需本地转录,可选择 fasterwhisper 并将 transcribe.fasterwhisper.model 设为 large-v2,再配置 [llm]。首次 CLI 调用示例:./build/krillinai-cli subtitle "https://www.youtube.com/watch?v=dQw4w9WgXcQ" --origin-lang en --target-lang zh_cn --workdir tasks/demo --caption-source any。生成配音可执行:./build/krillinai-cli tts --workdir tasks/demo --input-srt tasks/demo/target_language_srt.srt --line-mode target-only --video tasks/demo/origin_video.mp4。横屏合成使用:./build/krillinai-cli render-horizontal --workdir tasks/demo --video tasks/demo/origin_video.mp4 --subtitle tasks/demo/bilingual_srt.srt。竖屏合成使用:./build/krillinai-cli render-vertical --workdir tasks/demo --video tasks/demo/origin_video.mp4 --subtitle tasks/demo/short_origin_mixed_srt.srt --major-title "今日话题" --minor-title "AI Video"。自动化调用应解析 stdout 最后一行 JSON 和 krillinai_manifest.json,不要解析普通日志;接入真实服务前可使用 --dry-run 检查参数。

这个 Agent 与同类方案有什么区别?

与纯云端识别路径相比,FasterWhisper、WhisperKit 和 WhisperCpp 可在本地运行,从而避免云端转录费用,但平台支持和本地模型资源需求不同。OpenAI Whisper 云端方案覆盖所有平台并被描述为速度快、效果好;阿里云 ASR 则用于规避中国大陆的网络问题。

常见问题

必须购买云端 AI 服务吗?
不一定。语音识别可选择 FasterWhisper、WhisperKit 或 WhisperCpp 等本地方案;翻译仍需配置兼容 OpenAI API 规范的云端或本地大模型。使用 OpenAI、阿里云、MiniMax 等云服务时,费用取决于各提供商。
自动化程序应该如何判断一次 CLI 调用是否成功?
解析 stdout 的最后一行 JSON,并读取工作目录中的 krillinai_manifest.json。若失败,按 error.kind 处理:usage 表示修正参数,retryable 表示可重试,dependency 表示需要安装 ffmpeg、ffprobe 或 yt-dlp。
可以先验证流程而不下载视频或消耗 API 吗?
可以。CLI 支持 --dry-run,用于校验参数并生成 manifest,同时不下载视频、不调用外部 AI 服务。
哪些语言受到支持?
输入语言明确列出中文、英文、日文、德文、土耳其文、韩文、俄文和马来文;翻译目标包括英文、中文、俄文、西班牙文、法文及另外 101 种语言。
它可以直接嵌入 ChatGPT 或 Claude 吗?
资料没有说明这些产品的原生集成。已明确提供的是本地或服务器 CLI、桌面与 Web 模式,以及兼容 OpenAI API 规范的模型服务接入。

相关 Agents