Buzz 离线语音转录完整指南:从安装到批量字幕的 6 步实操
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款基于 OpenAI Whisper 的离线语音转录工具:音频和视频在你自己的电脑上转成文字,不上传云端,免费且可翻译、可做字幕。无论是会议纪要、采访整理还是视频字幕制作,Buzz 语音转录都能一条链路完成——导入、转录、校对、导出。下面按"安装 → 跑通第一次转录 → 实时录音 → 校对导出 → 进阶自动化 → 排错"的顺序,带你完整走一遍。
安装 Buzz:三种平台各一条命令
Windows:从官方发布渠道下载.exe安装包,双击安装即可。程序未签名,安装时若弹出警告,选"更多信息 → 仍要运行"。
macOS:下载.dmg镜像安装。Apple 芯片用户优先选适配版本,走 Metal 加速,性能明显更好。
Linux(Snap 或 Flatpak 二选一):
sudo snap install buzz sudo snap connect buzz:password-manager-service第二条命令授权 Buzz 访问系统密码管理器,用于安全保存 API 密钥。
flatpak install flathub io.github.chidiwilliams.Buzz国内网络下载 Hugging Face 模型较慢时,可设置环境变量HF_ENDPOINT=https://hf-mirror.com后再启动。
首次启动会提示下载 Whisper 模型,按"帮助 → 偏好设置 → 模型"操作即可,模型文件默认缓存在~/.cache/Buzz(Linux)、%USERPROFILE%\AppData\Local\Buzz(Windows)。
第一次转录:导入、选模型、出结果
- 点工具栏"+"图标,或菜单"文件 → 导入媒体文件"(快捷键Ctrl/Cmd + O),选择音频/视频文件,也支持直接粘贴 YouTube 等在线视频链接。
- 设置三个选项:
- 任务:Transcribe(按原语言转写)或 Translate to English(翻译成英文);
- 语言:建议手动指定(如
zh、en),自动检测偶尔会出错; - 模型:Whisper 类型 + 模型大小。
- 点Run,任务列表出现进度,状态变为 Completed 后双击该行打开转录查看器。
模型选择速查表:
| 模型 | 速度 | 准确率 | 推荐场景 |
|---|---|---|---|
| Tiny | 极快 | 基础 | 试跑、低配机器 |
| Base | 快 | 良好 | 日常快速转写 |
| Small | 中等 | 优秀 | 会议记录(均衡之选) |
| Medium | 较慢 | 非常好 | 专业转写 |
| Large-v3 | 慢 | 最佳 | 高精度需求,偶有"幻觉" |
| Turbo | 较快 | 高 | Large 与 Small 之间的平衡档 |
Whisper 类型怎么选:
| 类型 | 加速方式 | 适合谁 |
|---|---|---|
| Whisper.cpp | CPU 或任意 GPU(Vulkan) | Mac 用户、集显笔记本,首选 |
| Faster Whisper | NVIDIA GPU(需 ≥6GB 显存) | 有独立显卡的高配机器 |
| Whisper | CUDA 加速 | 追求原版行为 |
| Hugging Face | GPU | 用第三方定制模型(如 Parakeet、MMS 多语种模型) |
| OpenAI API | 云端 | 本地算力不足时兜底 |
进阶细节:点导入面板的Advanced...可以填 Initial Prompt(把易错的专业名词、人名写进去能减少拼错)、勾选 Word-Level Timings(生成词级时间戳,后续重排字幕用)和 Extract speech(先从混音中分离人声,嘈杂音频效果明显)。
实时录音:会议和讲座的现场转写
适合边开会边出纪要的场景:
- 在主界面下方选好录音任务(转录/翻译)、语言、麦克风;
- 点Record,转写结果逐句出现;
- 需要投屏展示时,点Presentation window打开演示窗口,全屏大字实时滚动。
三种转录模式按需切换(偏好设置里可配):
| 模式 | 行为 | 适用 |
|---|---|---|
| Append below / above | 新句子追加到末尾/开头,带空行 | 普通记录 |
| Append and correct | 追加并回改上一句,最连贯 | 长会议,吃算力 |
注意:实时转写吃资源,建议选 Whisper.cpp + Base/Small 模型;机器负载高时调大"转录步长"降低频率。另外偏好设置里开启Live transcript exports,转写文本会实时导出为 txt 文件,方便接入 OBS 等直播工具。
校对与导出:转录查看器的实用功能
双击任务列表中的转录打开查看器,这是日常使用频率最高的界面:
- 三种视图:带时间戳的表格视图 / 纯文本视图 / 译文视图,一键切换;
- 搜索:Ctrl/Cmd + F 实时搜索,Enter 跳转下一处;
- 播放控制:播放速度 0.5x–2.0x,可勾选"跟随音频"自动滚动、"循环段落"反复听某一段;
- 微调时间戳:Ctrl/Cmd + ←/→ 调整段落起点,加 Shift 调整终点,每按一次 0.5 秒。
字幕重排:查看器里的Resize按钮可以把转录切成标准字幕。开启词级时间戳的转录支持按静音间隙合并、按标点断句、限制单条字幕最大长度;如果源音频还在本机,还会分析静音点让字幕更贴合。还能给每条字幕的结束时间统一延长若干秒,让字幕在屏幕上停留更久。
导出格式:TXT、SRT、VTT、JSON 等,点工具栏 Export 按钮选择即可。文件名模板可在偏好设置里自定义,支持{{ input_file_name }}、{{ date_time }}等变量。
进阶玩法:插件、命令行与监听文件夹
插件系统(1.4.5 起,Help → Plugins 管理)内置了几个实用件:
- AI Summary:接 OpenAI 兼容 API,给转录自动生成摘要;
- DeepFilterNet 降噪:转录前先做本地人声降噪;
- Enhanced Language Detection:本地模型自动识别未知语种;
- Export to DOCX:一键导出 Word 文档;
- Skip Already Transcribed:重复导入同批文件时跳过已转过的,批量场景省算力;
- Resize Transcript:转录完成后自动重排成字幕块。
社区插件可点Add by URL直接安装,写法参考 buzz/plugins/ 源码。
命令行批量处理:
buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt /path/to/audio.mp4作用:用 Whisper.cpp 的 small 模型转录指定文件,并直接输出 SRT 和 VTT 字幕。-l zh可指定语言,--txt、-w(词级时间戳)等选项见 docs/docs/cli.md。
监听文件夹:偏好设置里配置一个 watched folder,往里丢文件就自动排队转录,配合上面的 Skip 插件可实现无人值守的批量转写。
高级调优:部分参数通过环境变量控制,Linux/macOS 可写进启动脚本:
export BUZZ_WHISPERCPP_N_THREADS=8 # Whisper.cpp 线程数,16 线程机器设为 8 通常更快 export BUZZ_FORCE_CPU=true # GPU 有问题时强制走 CPU buzz完整变量表(含BUZZ_MODEL_ROOT改模型目录、BUZZ_FAVORITE_LANGUAGES置顶常用语言)见 docs/docs/preferences.md。
常见问题与性能调优
转得太慢怎么办?三招:换更小的模型;NVIDIA 显卡(≥6GB 显存)切到 Faster Whisper;N 卡之外的机器统一用 Whisper.cpp(支持 Vulkan 加速)。
崩溃或结果异常?多半是模型文件下载不完整。到"帮助 → 偏好设置 → 模型"里删除对应模型重新下载。另外注意 Buzz 要求 CPU 支持AVX2,过老的处理器无法运行。
录音时提示PaErrorCode-9999?检查系统麦克风权限(Windows:设置 → 隐私 → 麦克风),或暂时关闭杀毒软件再试。
没有网络的机器能用吗?可以。在联网机器上先下载好模型,把整个模型缓存目录("模型"页有"Show file location"按钮直达)拷到离线机器相同位置即可。
GPU 加速不生效?Linux 的 NVIDIA 显卡开箱即用,异常时补装 CUDA 12 + cuBLAS + cuDNN;Windows 安装包已内置 CUDA 12 支持,旧 CUDA 版本会自动回落到 CPU。
要点回顾
- Buzz 全程本地离线运行,免费、不上传音频,是隐私敏感场景(医疗、法务、采访)的稳妥选择;
- 模型缓存位置固定(
~/.cache/Buzz等),复制一份即可让离线机器"开箱即用"; - 硬件普通就用Whisper.cpp + Base/Small,N 卡充足就上Faster Whisper + Medium/Large;
- 词级时间戳 + Resize 是字幕工作流的关键组合:先开
-w,再按标点断句重排; - 批量与自动化靠三件套:命令行
buzz add+ 监听文件夹 + Skip Already Transcribed 插件; - 想继续深入:查看 docs/docs/ 目录下的使用手册,或参考 buzz/plugins/ 自己写一个插件。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考