从任意主题到5分钟讲解视频:Anything2Explainer完整入门指南
【免费下载链接】anything2explainerTopic in, narrated explainer video out. A Claude Code / Codex skill that turns any topic into a black-canvas motion-graphics explainer video with TTS voiceover, subtitles and a chapter progress bar. Chinese or English; every frame drawn in code with Remotion.项目地址: https://gitcode.com/gh_mirrors/an/anything2explainer
Anything2Explainer是一个面向 Claude Code / Codex 的 AI 技能(skill):输入任意主题,自动产出一条带TTS 配音、字幕和章节进度条的黑底 MG 风格讲解视频,中文或英文均可。它不用视频生成模型、不套素材模板——每一帧画面都由 Remotion(React + TypeScript)代码绘制,数字和术语全部带来源出处。你只需要给一个主题,AI agent 会在 1~3 小时内把成片做出来。
Anything2Explainer 到底是什么?
它不是一个命令行工具,而是一套"让 AI 编程 agent 完整做完一条片子"的方法包:
| 组成部分 | 说明 |
|---|---|
| 可编译模板 | template/ 内含开箱即用的 Remotion 4 工程(图元库、光效、字幕、进度条) |
| 风格与动效规范 | reference/style-guide.md、reference/motion-vocabulary.md 等书面标准 |
| 配音/分镜/渲染/QC 工具 | template/scripts/tts_build.py、template/scripts/render.sh、template/scripts/frame_metrics.py 等 |
| 多 agent 分工协议 | SKILL.md 定义 9 个阶段、4 个确认点,构建与质检并行跑 |
| 完整样片 | examples/rag/ 提供一条成片的全过程文件,作为质量标尺 |
它和其他工具最大的区别在于:画面是确定的代码,不是生成式像素。屏幕上出现的每个数字都能追溯到调研文档中的来源 URL;某一帧不满意,改一个镜头文件重渲即可。
成片长什么样?先睹为快
输出规格固定:1280×720 @ 30fps,H.264 MP4,2~8 分钟自选,统一视觉体系——黑底幕底(星点雾底或点阵波)、白线条图形 + 紫色重点、超粗黑体大字、44px 白字黑边字幕、底部章节进度条。
下面几帧都来自仓库内置样片《RAG 与知识库》:
算法、公式、大数据都能变成"主角"。例如 HNSW 分层跳板图解:
以及大数字镜头——关键数值会用超大号字体 + 发光处理:
每个章节有专属章节卡,底部进度条按章节等宽分段:
时长与规模的对应关系(在第一个确认点选择):
| 时长 | 中文字数 | 句 / 镜头数 | 并行构建组 | 产出耗时 |
|---|---|---|---|---|
| 2–3 分钟 | 700–950 | 24–32 | 4–6 | ≈1 小时 |
| 3–5 分钟(样片档) | 1200–1500 | 40–50 | 8 | ≈2 小时 |
| 5–8 分钟 | 1800–2400 | 60–80 | 10–14 | ≈2–3 小时 |
💡 语速参考:中文约 6 字/秒、英文约 2.9 词/秒;不需要 GPU,Remotion 通过无头 Chromium 用 CPU 渲染。
一键安装步骤(5分钟装好)
# 1. 克隆仓库 git clone https://gitcode.com/gh_mirrors/an/anything2explainer # 2. 注册为技能(二选一,符号链接到对应 skills 目录) ln -s "$PWD/anything2explainer" ~/.claude/skills/anything2explainer # Claude Code ln -s "$PWD/anything2explainer" ~/.codex/skills/anything2explainer # Codex再准备依赖(一次性):
brew install ffmpeg # 抽帧/转码,必需 python3 -m venv ~/.venvs/a2e && source ~/.venvs/a2e/bin/activate pip install 'edge-tts==7.2.8' numpy pillow scipy- Node ≥18(模板安装会拉取 Remotion 4 / React 19)
scipy仅供质检脚本 frame_metrics.py 使用- 只做英文配音时才需要额外安装
kokoro、soundfile与espeak-ng - 脚本基于 zsh + Python 3,macOS 已验证,Linux 可用,Windows 未测试
使用方法:一句话启动全流程
在 Claude Code 或 Codex 里直接说:
讲一下向量数据库,做成一条讲解视频
技能会自动触发,按 SKILL.md 的 9 个阶段推进:
- 建项目——从 template/ 复制模板并编译
- 调研——1 个 agent 产出带 URL 出处的调研文档
- 解说词与时间轴——写文案 → TTS 配音 → 生成帧级时间轴与字幕表
- 分镜——每个镜头一行:帧区间、节拍、画面、动效、主角、光
- 覆盖层与图元——片头、章节卡、HUD,补 2–5 个主题图标
- 打样——先做第一组镜头,渲出前 30 秒给你看
- 并行构建——5–7 个镜头/组,多 agent 同时写 Remotion 组件
- 渲染——全片渲染 + 逐镜头量化指标
- QC 与修复——每章一个质检 agent 按书面判据逐帧审查,修复后交付
全程只在4 个确认点停下来问你,其余自动跑完:
| 确认点 | 时机 | 为什么重要 |
|---|---|---|
| 时长与语言 | 写文案前 | 决定句数、镜头数和并行规模 |
| 解说词定稿 | 配音前 | 定稿后帧号被硬编码,这是最便宜的干预点 |
| 配音引擎 | 跑 TTS 前 | 默认中文云希 / 英文 Liam,也可自带成品配音 |
| 前 30 秒样片 | 第一组构建后 | 在这里改风格成本最小 |
质量如何保证?量化 QC + 书面标尺
这是它不像"AI 随手做的片子"的关键。仓库内置了两套标尺:
- 量化指标:template/scripts/frame_metrics.py 逐镜头测量最大物体高度、主角区柔光、静止段等,输出带严重度标记的表格;
- 反例/正例帧对照:examples/contrast/ 提供 6 组"差在哪"的帧对比,规则沉淀在 reference/composition-and-light.md。例如"主角必带光"这一条——大模型图标配 110px 尺寸 + 双层紫光就是正例:
样片《RAG 与知识库》的完整质检轨迹(v1 四章报告 → v2 复验 → v3 终检)都放在 examples/rag/qc/ 里,可以看问题长什么样、如何量化。每镜头的关键术语还会用 glitch 闪烁强调(全片白名单制,绝不滥用):
完整参考案例:《RAG 与知识库》
想复刻或研究细节,examples/rag/ 是全套"过程文件",目录结构即工作流:
| 文件 | 内容 |
|---|---|
| examples/rag/research.md | 调研文档(约 7900 字、105 个来源) |
| examples/rag/narration.txt | 解说词(44 句、4 章) |
| examples/rag/storyboard_src.md / 分镜表.md | 分镜源与填帧后的成品 |
| examples/rag/shots_src/ | 44 个镜头的 Remotion 源码 |
| examples/rag/交付说明.md | 交付文档范例 |
结尾镜头用"城堡护城河"的比喻收束全片,就是标准的"象征物高光时刻"编排:
进阶章节里文档关系图这类复杂结构也能画得清楚:
常见问题(FAQ)
- 能用自己的声音吗?可以。把成品音频放到
public/assets/<slug>/audio.wav,手填timeline.ts与subs.ts,后续流程不变。 - 支持竖屏(9:16)吗?暂不支持,模板和安全区规则均基于 1280×720 横版。
- 渲染可复现吗?可以。所有动画是帧号的纯函数 + 种子随机,重渲结果逐帧一致。
- 能做商用吗?工具包采用 PolyForm Noncommercial 许可:非商用免费,商用需作者授权;用工具做出的视频版权归你。
- 能换视觉风格吗?视觉风格是有意保持单一的,幕底可切换(
bg: 'stars' | 'dots',见 template/src/config.ts);改风格需编辑 reference/style-guide.md 与 template/src/ui.tsx。
小结 🎬
Anything2Explainer 把"调研 → 文案 → 配音 → 分镜 → 并行构建 → 量化质检"这一整套专业视频工作流打包成了 AI 技能:你负责出题目和在 4 个节点点头,它负责交付一条有出处、可复现、带配音字幕的讲解视频。建议路径:先按上文装好,选 3–5 分钟档跑一个熟悉主题,对照 examples/rag/ 的样片帧感受质量标尺——然后换你真正想讲的主题开工。
【免费下载链接】anything2explainerTopic in, narrated explainer video out. A Claude Code / Codex skill that turns any topic into a black-canvas motion-graphics explainer video with TTS voiceover, subtitles and a chapter progress bar. Chinese or English; every frame drawn in code with Remotion.项目地址: https://gitcode.com/gh_mirrors/an/anything2explainer
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考