视频字幕提取指南:本地 OCR 一键把硬字幕转成 srt 文件
【免费下载链接】video-subtitle-extractor视频硬字幕提取,生成srt文件。无需申请第三方API,本地实现文本识别。基于深度学习的视频字幕提取框架,包含字幕区域检测、字幕内容提取。A GUI tool for extracting hard-coded subtitle (hardsub) from videos and generating srt files.项目地址: https://gitcode.com/gh_mirrors/vi/video-subtitle-extractor
Video-subtitle-extractor(VSE)是一款开源的视频字幕提取工具,能在你自己的电脑上把视频里的硬字幕识别出来,并导出为外挂 srt 文件,全程本地运行、无需申请任何第三方 OCR API。项目内置 87 种语言的识别模型,支持批量处理多个视频,适合外语学习、影视资源整理和内容二创人群。
快速上手
拿到项目有两条路:普通用户直接下载 Release 里的压缩包解压即可运行;开发者则从仓库拉取源码。
git clone https://gitcode.com/gh_mirrors/vi/video-subtitle-extractor源码运行要求 Python 3.12 及以上版本:先在项目目录创建虚拟环境,按 requirements.txt 安装依赖(其中包含 PaddlePaddle,没有独立显卡的机器安装 CPU 版即可),然后启动图形界面。
python gui.py启动后点【打开】选择视频,右侧选好语言与识别模式,点【运行】即可。命令行用户也可以执行python backend/main.py走 CLI 流程。界面布局如下:上方是视频预览,下方滚动输出日志,右下角的任务列表会显示每个视频的处理进度。

核心能力拆解
上手之后,可以留意这四项能力,它们决定了这份字幕"干不干净、全不全"。
本地完成识别,不碰在线服务
检测与识别模型都打包在仓库内(位于backend/models/V5/目录),文字识别在你本机跑完,字幕内容不会传往任何服务器,断网环境也能用,处理隐私素材更放心。
自动锁定字幕区域,滤掉水印台标
打开视频后,程序会先判断字幕大致出现在画面哪里,并用绿色框标在预览中,你可以拖动修正。由于台标、水印的位置长期不变而字幕持续跳动,算法据此区分两者,导出的 srt 不会被固定杂音刷屏。
一次多选,批量生成外挂字幕
一次勾选多个视频,程序按顺序排队处理,每个视频各生成一份独立 srt,也可顺手导出 txt 纯文本。注意同一批视频的分辨率与字幕位置应保持一致,批量效果才稳定。
87 种语言,小语种也覆盖
右侧的"视频的语言"下拉框决定使用哪套识别模型。除简体中文(含中英混排)、繁体中文、英文、日语、韩语、越南语外,阿拉伯语、西班牙语、俄语等语言也支持,学习材料里的小语种不必再找在线工具。
参数与模式调节
模式、区域、阈值三组设置分别管"快不快、认不认、干不干净",按需调整即可:
- 识别模式:快速使用轻量模型,速度快但可能漏少量行、出现个别错字;自动按硬件分配模型(CPU 走轻量、GPU 走高精),是官方推荐的选择;精准逐帧检测不漏行但非常慢,仅在前两者漏行明显时启用。
- 字幕区域:默认框定在画面下方,字幕位置特殊时直接拖绿框,或在高级设置中修改区域坐标。
- 置信度阈值:默认 75,低于 0.75 置信度的文字直接丢弃;误识别多就调高,漏字多就调低。
- 文本相似度阈值:去重时判断两行是否为同一句字幕,值越高判断越严格。
- 采样频率:每秒抓取多少帧参与识别,默认 3 帧,调高更完整但更耗时。
文字层面的杂音交给替换规则处理:编辑backend/configs/typoMap.json,左侧填误识别原文、右侧填期望文本,例如把"威筋"改成"威胁";右侧写空字符串则整条删除,常用来清掉固定出现的水印短句。
运行门槛与性能
基础配置并不高:双核 CPU、4GB 内存、2GB 可用磁盘(模型文件已随仓库提供),没有独立显卡也能用 CPU 模式跑通全流程,只是处理长视频会比较慢。
推荐配置则是带 NVIDIA 显卡(走 CUDA)或 AMD/Intel 显卡(走 DirectML)的机器,搭配 8GB 以上内存与固态硬盘。硬件加速的价值不只是提速:GPU 环境下自动模式会直接切到更大、更准的模型,加速后准确率与速度会同时提升。
排错手册
- 闪退或报未知错误:多半是视频文件路径或项目路径含中文、空格,将两者都挪到纯英文路径后重试。
- CUDA / cuDNN 报错、识别无结果:显卡驱动与安装的 CUDA、cuDNN 版本不匹配,按显卡型号安装对应组合(常见推荐是 CUDA 11.8 + cuDNN 8.6.0)。
- 漏字幕、缺行:先把识别模式从快速换成自动重跑,仍漏得明显时再启用精准模式。
写在最后
VSE 把"硬字幕变外挂"做成了完全离线的本地流程,语言学习者、影视资源整理者和二创作者都能直接受益。👉 下一步建议:克隆项目后,先拿仓库test/目录下自带的 test_cn.mp4 试跑一次,确认环境无误后再处理正式素材。
【免费下载链接】video-subtitle-extractor视频硬字幕提取,生成srt文件。无需申请第三方API,本地实现文本识别。基于深度学习的视频字幕提取框架,包含字幕区域检测、字幕内容提取。A GUI tool for extracting hard-coded subtitle (hardsub) from videos and generating srt files.项目地址: https://gitcode.com/gh_mirrors/vi/video-subtitle-extractor
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考