FunClip 视频剪辑:零门槛 3 分钟切出 2 小时录像里的精华
【免费下载链接】FunClipFunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.项目地址: https://gitcode.com/GitHub_Trending/fu/FunClip
下午六点,两小时的部门周会刚散,一段两个多小时的录像还躺在硬盘里,谁都不想把整段视频拖进剪辑软件从头捋一遍。FunClip 视频剪辑正是为这种场景做的本地工具:它先用语音识别把视频里的每句话转成带时间戳的文字,再由你或大语言模型圈出想保留的部分,最后自动裁出对应片段并生成字幕。全程在浏览器里点几下就完成,不需要专业剪辑软件。
它是什么?FunClip 的 4 个核心能力
FunClip 是一款开源、可本地部署的视频切片工具,核心思路是"先识别、再定位、后裁剪",把传统剪辑里最耗时的听写、找时间点、打字幕三件事交给模型自动完成。你真正能拿到的是:
✅句级精准时间戳:基于 Paraformer 大模型做中文语音识别,识别的同时输出每句话的起止时间,定位以毫秒计,不用再靠肉眼拖时间轴。 ✅三种裁剪入口:按识别出的文本裁、按说话人 ID 裁、或让大语言模型自动选段,分别对应"我要这几句""我要某个人说过的""帮我找重点"。 ✅说话人分离:内置 CAM++ 模型,多人访谈自动区分 spk0、spk1,直接提取某一位的全部发言。 ✅一键出字幕:裁剪时同步生成 SRT,还能把字幕烧进成片,省去后期手动对齐。
传统方式处理 2 小时录像,往往要反复拖时间轴、逐句标注、再手动加字幕,半天基本搭进去;FunClip 把"听"和"找"这两步前置成自动化,你只负责确认和微调。
3 分钟上手:安装、启动、第一次剪辑
FunClip 只依赖一个 Python 环境,下面三步走下来,第一次剪辑就能跑通。
第一步|安装依赖
下面三条命令完成代码获取与依赖安装:
git clone https://gitcode.com/GitHub_Trending/fu/FunClip cd FunClip pip install -r requirements.txt首次启动会单独下载语音识别模型,体积约 2GB,建议在网络较好的环境执行。
第二步|启动服务
一条命令启动本地界面服务:
python funclip/launch.py启动后在浏览器打开localhost:7860,左侧上传视频、右侧是识别与裁剪区。需要处理英文视频时,在命令后加-l en切换英文模型即可。
第三步|完成首次剪辑
界面操作不用写代码:上传视频后点"识别 | ASR",左侧会给出识别文本和 SRT 字幕;把想保留的句子复制进"待裁剪文本"(多段用#连接),点"裁剪"就得到片段视频,点"裁剪+字幕"则顺带把字幕烧进去。
实战效果:FunClip 对比传统剪辑省多少时间
同样是"2 小时录像 → 若干可用片段",两种做法的差别如下:
| 对比维度 | 传统剪辑方式 | FunClip 视频剪辑 |
|---|---|---|
| 找重点片段 | 反复拖时间轴、手动记时间点 | 文本/说话人/LLM 三种方式自动定位 |
| 时间轴精度 | 肉眼估读,误差常达数秒 | 句级时间戳,毫秒级对齐 |
| 字幕制作 | 逐字输入再手动对齐 | 自动生成 SRT,可选烧录 |
| 多人发言提取 | 手动标注每人何时说话 | 说话人分离,按 spk 提取 |
| 使用门槛 | 依赖剪辑软件与经验 | 浏览器点选,无需编程 |
| 2 小时视频耗时 | 3–4 小时起 | 视机型十几分钟到半小时 |
进阶技巧:解锁 FunClip 的隐藏用法
技巧一|LLM 智能剪辑
不想自己找重点时,把这件事交给大语言模型:识别完成后选择模型(如 qwen、gpt 系列)并填好 API Key,点"LLM 推理",它会读完整段 SRT 后按 Prompt 要求返回若干带时间戳的片段;再点"LLM 智能裁剪",FunClip 直接按这些时间戳裁片。Prompt 支持自定义,把"找出所有提到的价格""提取每位嘉宾的开场观点"写进要求即可。
技巧二|按说话人批量提取
圆桌、访谈类视频里,勾选"识别+区分说话人 | ASR+SD",系统会给每句话打上 spk 标签。之后在"待裁剪说话人"里填spk0提取单人全部发言,填spk0#spk2则同时提取两位,省去逐句筛人的功夫。
技巧三|热词 + 偏移量精调
识别不准通常是专有名词踩空。在"热词 | Hotwords"里填入人名、产品名、术语(空格分隔,仅支持中文),识别率会明显提升。裁剪结果若总差半拍,可用"开始/结束位置偏移"微调起止时间,每段还能单独设置偏移,让切点卡在句间停顿上。
想接入自动化流程时,也可以直接用命令行两步完成识别与裁剪:
python funclip/videoclipper.py --stage 1 --file input.mp4 --output_dir ./output python funclip/videoclipper.py --stage 2 --file input.mp4 --dest_text '要保留的句子' --output_file res.mp4常见问题快答
❌识别把专业名词听错了怎么办:在热词框里补上对应实体词后重新识别即可,专名和人名是最有效的两类热词。 ❌想精确按文字裁,却选了高精度转写模型:需要可靠字符级时间戳时请选用 Paraformer;Fun-ASR-Nano 适合高精度转写,但不保证逐字时间戳。 ❌英文视频识别不了:用python funclip/launch.py -l en启动英文模式,会自动加载英文 Paraformer 模型。
场景示例:3 个真实用法
场景一|会议纪要自动化:周会长达 2 小时、纪要要写半天,是很多人每周的固定负担。用 FunClip 先整体识别,再把"决策""行动项""负责人"相关句子复制出来裁剪,配 LLM 直接筛出结论段,整理时间从半天压到二十分钟量级,还顺带留下一份带时间戳的纪要底稿。
场景二|网课知识切片:90 分钟的录播课,学生总想只看重点。按知识点把讲解句摘出来裁剪成独立小段,每段自带 SRT,回放时可单段循环,老师不用再重新剪一整套课件。
场景三|自媒体素材加工:1 小时采访素材要剪成 5 分钟短视频,传统流程往往要 3 小时以上。用说话人分离锁定主讲人,再用 LLM 挑出金句片段批量裁剪,一天产出一条带字幕的成片不再是难题。
下一步:先做什么、往哪深挖、去哪分享
👉先做:克隆仓库、跑通上面三步,拿一段 10 分钟的会议或采访试裁一次,熟悉"识别—定位—裁剪"的手感。 👉往哪深挖:读 funclip/videoclipper.py 看识别与裁剪的主流程,翻 funclip/llm/ 看各家大模型的接入方式,再改改 Prompt 找到最适合自己的选段规则。 👉去哪分享:把用得顺的 Prompt 配置和热词经验发到项目讨论区,帮后来人少走弯路;遇到识别或字幕问题也欢迎提 Issue。
项目源码遵循 MIT 许可,v2.1.0 起提供带校验的稳定版本,详见 docs/releases/v2.1.0.md。如果这套"识别 + 定位 + 裁剪"的流程帮到了你,给仓库点个 Star,就是对开源社区最直接的支持。
【免费下载链接】FunClipFunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.项目地址: https://gitcode.com/GitHub_Trending/fu/FunClip
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考