Buzz 离线语音转文字:本地免费跑通 Whisper 转录的完整指南
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
一段两小时的会议录音躺在硬盘里,你需要一份能直接读的文稿。Buzz 是一个离线语音转文字工具,全部在你自己电脑上运行,基于 OpenAI 的 Whisper 模型,音频全程不出机器,也不按量收费。
适合谁用
Buzz 面向想把语音变成文字、又不想把文件传到云端的人。导入文件、选模型、点运行,文本就在本机生成,免费开源。
适用的 3 类场景:
- 做字幕的播客、视频创作者,需要批量产出 SRT 文件
- 整理访谈、讲座录音的研究员,需要带时间戳的文稿
- 活动组织者,需要现场把发言实时变成字幕
不适合的 2 类场景:
- 要一次转几百小时音频——本地硬件扛不住,请分批处理
- 录音含几十种语言混杂的频道切换——单语言任务表现更好
安装与首次运行
- Windows:从官方发布页下载安装包,双击运行。程序未签名,弹窗警告时选"更多信息"→"仍要运行"。
- macOS:下载 .dmg 拖入"应用程序"。注意只支持 Apple Silicon 机型,Intel 机型最后可用版本是 1.4.5。
- Linux:一条命令装 Flatpak 版本:
flatpak install flathub io.github.chidiwilliams.Buzz首次运行前要下载一次模型:打开偏好设置(Ctrl/Cmd + ,)→"模型",选好后端和尺寸后点击下载,文件会自动缓存到本机,之后断网也能用。
跑通第一个任务
最小闭环 4 步:
- 导入:按 Ctrl/Cmd + O,或点工具栏"+",选一个音频或视频文件。看到任务出现在列表里即成功。
- 配置:任务选 transcribe,语言手动选"中文"(别用自动检测),模型选 Whisper.cpp 的 base 或 small。
- 运行:点 Run。中等配置的笔记本用 base 模型,约 10–15 秒转完 1 分钟音频,转 2 小时录音约 20–30 分钟。
- 看结果:状态变成 Completed 后,双击该行打开转录查看器,可播放音频、搜索文字、导出 TXT/SRT/VTT。
🔧 参数怎么选
模型大小对比(Whisper 标准模型):
| 模型 | 大小 | 速度 | 精度 |
|---|---|---|---|
| tiny | 约 75 MB | 最快,适合试跑 | 一般 |
| base | 约 142 MB | 快 | 可用 |
| small | 约 466 MB | 中等 | 较好 |
| medium | 约 1.5 GB | 慢 | 高 |
| large | 约 2.9 GB | 最慢 | 最高 |
取舍建议:日常速记用 base 或 small,重要资料再上 large。太慢时先换后端而不是换模型——Whisper.cpp 纯 CPU 和集显都能跑,Faster Whisper 需要至少 6GB 显存的 Nvidia 显卡,速度比原版 Whisper 快一个量级。
三个关键参数:
- 语言:手动指定。自动检测在口音重或嘈杂的音频上容易判错语种。
- 初始提示:在 Advanced 按钮里填入人名、术语,能明显减少专有名词的误识别。
- 词级时间戳:默认关闭;只有后面要精细调字幕时才打开。
放进你的场景
后期制作:给节目做 SRT 字幕
- 要解决什么:两小时节目音频变出能直接导入剪辑软件的字幕。
- 用到哪些功能:导入 MP3 → 语言选中文、勾选词级时间戳 → 转录完成后用 Resize 按标点拆分长句、合并过短的条目 → 导出 SRT。
- 最后得到什么:时间码对齐的 SRT 文件,拖进时间线即可上屏。
研究整理:多人访谈分说话人
- 要解决什么:两小时双人访谈变成分角色标记的文字稿。
- 用到哪些功能:转录前打开"提取语音"降噪;在转录查看器里逐段标注说话人;导出 TXT。
- 最后得到什么:带时间戳的访谈稿,边听边核对,随时修改。
现场活动:实时字幕
- 要解决什么:培训现场把发言人内容即时投到屏幕上。
- 用到哪些功能:新建录音转录任务并选好麦克风 → 打开演示窗口投屏 → 偏好里开启实时文本导出,TXT 文件可接 OBS。
- 最后得到什么:一块能投大屏的字幕画面,外加一份同步给 OBS 的 TXT。
常见坑
转录不准,先查哪?按顺序查:语言是否手动指定(自动检测会误判)→ 录音是否嘈杂(开语音分离)→ 模型是否偏小(升一级)。专名错得离谱就把词写进初始提示。
完全断网的机器能用吗?可以。先在有网电脑上下好模型,通过"偏好设置 → 模型 → 显示文件位置"找到模型目录(Linux 为 ~/.cache/Buzz/models),整个拷到离线机的相同路径。仓库里的 scripts/download-models.py 支持批量预缓存。
转录太慢或电脑卡?换 Whisper.cpp 后端,或把模型降一档;有 6GB 以上显存的 Nvidia 卡可以试 Faster Whisper。实时转录务必用小模型,否则跟不上语速。
录音没声音,报 PaErrorCode 错误?结论:多半是麦克风权限问题。检查系统隐私设置是否允许 Buzz 访问麦克风,杀毒软件也可能拦截。
Buzz 启动就崩溃?多数是模型下载不完整,到"偏好设置 → 模型"删掉后重新下载;另注意 CPU 需要支持 AVX2,太老的机器跑不起来。
📋 使用前自查
- 模型已下载完成,能通过"显示文件位置"打开模型文件夹
- 语言是手动选的,没有留在自动检测
- 导出格式选对:文稿用 TXT,字幕用 SRT 或 VTT
- 实时场景已确认麦克风权限正常,演示窗口能打开
- 机器较老时先确认 CPU 支持 AVX2,再排查软件问题
更多细节可查 官方文档 和 常见问题。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考