Buzz 离线语音转录完整指南:从安装到批量字幕的 6 步实操
2026/9/7 17:57:26 网站建设 项目流程

Buzz 离线语音转录完整指南:从安装到批量字幕的 6 步实操

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款基于 OpenAI Whisper 的离线语音转录工具:音频和视频在你自己的电脑上转成文字,不上传云端,免费且可翻译、可做字幕。无论是会议纪要、采访整理还是视频字幕制作,Buzz 语音转录都能一条链路完成——导入、转录、校对、导出。下面按"安装 → 跑通第一次转录 → 实时录音 → 校对导出 → 进阶自动化 → 排错"的顺序,带你完整走一遍。

安装 Buzz:三种平台各一条命令

Windows:从官方发布渠道下载.exe安装包,双击安装即可。程序未签名,安装时若弹出警告,选"更多信息 → 仍要运行"。

macOS:下载.dmg镜像安装。Apple 芯片用户优先选适配版本,走 Metal 加速,性能明显更好。

Linux(Snap 或 Flatpak 二选一):

sudo snap install buzz sudo snap connect buzz:password-manager-service

第二条命令授权 Buzz 访问系统密码管理器,用于安全保存 API 密钥。

flatpak install flathub io.github.chidiwilliams.Buzz

国内网络下载 Hugging Face 模型较慢时,可设置环境变量HF_ENDPOINT=https://hf-mirror.com后再启动。

首次启动会提示下载 Whisper 模型,按"帮助 → 偏好设置 → 模型"操作即可,模型文件默认缓存在~/.cache/Buzz(Linux)、%USERPROFILE%\AppData\Local\Buzz(Windows)。

第一次转录:导入、选模型、出结果

  1. 点工具栏"+"图标,或菜单"文件 → 导入媒体文件"(快捷键Ctrl/Cmd + O),选择音频/视频文件,也支持直接粘贴 YouTube 等在线视频链接。
  2. 设置三个选项:
    • 任务:Transcribe(按原语言转写)或 Translate to English(翻译成英文);
    • 语言:建议手动指定(如zhen),自动检测偶尔会出错;
    • 模型:Whisper 类型 + 模型大小。
  3. Run,任务列表出现进度,状态变为 Completed 后双击该行打开转录查看器。

模型选择速查表

模型速度准确率推荐场景
Tiny极快基础试跑、低配机器
Base良好日常快速转写
Small中等优秀会议记录(均衡之选)
Medium较慢非常好专业转写
Large-v3最佳高精度需求,偶有"幻觉"
Turbo较快Large 与 Small 之间的平衡档

Whisper 类型怎么选

类型加速方式适合谁
Whisper.cppCPU 或任意 GPU(Vulkan)Mac 用户、集显笔记本,首选
Faster WhisperNVIDIA GPU(需 ≥6GB 显存)有独立显卡的高配机器
WhisperCUDA 加速追求原版行为
Hugging FaceGPU用第三方定制模型(如 Parakeet、MMS 多语种模型)
OpenAI API云端本地算力不足时兜底

进阶细节:点导入面板的Advanced...可以填 Initial Prompt(把易错的专业名词、人名写进去能减少拼错)、勾选 Word-Level Timings(生成词级时间戳,后续重排字幕用)和 Extract speech(先从混音中分离人声,嘈杂音频效果明显)。

实时录音:会议和讲座的现场转写

适合边开会边出纪要的场景:

  1. 在主界面下方选好录音任务(转录/翻译)、语言麦克风
  2. Record,转写结果逐句出现;
  3. 需要投屏展示时,点Presentation window打开演示窗口,全屏大字实时滚动。

三种转录模式按需切换(偏好设置里可配):

模式行为适用
Append below / above新句子追加到末尾/开头,带空行普通记录
Append and correct追加并回改上一句,最连贯长会议,吃算力

注意:实时转写吃资源,建议选 Whisper.cpp + Base/Small 模型;机器负载高时调大"转录步长"降低频率。另外偏好设置里开启Live transcript exports,转写文本会实时导出为 txt 文件,方便接入 OBS 等直播工具。

校对与导出:转录查看器的实用功能

双击任务列表中的转录打开查看器,这是日常使用频率最高的界面:

  • 三种视图:带时间戳的表格视图 / 纯文本视图 / 译文视图,一键切换;
  • 搜索:Ctrl/Cmd + F 实时搜索,Enter 跳转下一处;
  • 播放控制:播放速度 0.5x–2.0x,可勾选"跟随音频"自动滚动、"循环段落"反复听某一段;
  • 微调时间戳:Ctrl/Cmd + ←/→ 调整段落起点,加 Shift 调整终点,每按一次 0.5 秒。

字幕重排:查看器里的Resize按钮可以把转录切成标准字幕。开启词级时间戳的转录支持按静音间隙合并、按标点断句、限制单条字幕最大长度;如果源音频还在本机,还会分析静音点让字幕更贴合。还能给每条字幕的结束时间统一延长若干秒,让字幕在屏幕上停留更久。

导出格式:TXT、SRT、VTT、JSON 等,点工具栏 Export 按钮选择即可。文件名模板可在偏好设置里自定义,支持{{ input_file_name }}{{ date_time }}等变量。

进阶玩法:插件、命令行与监听文件夹

插件系统(1.4.5 起,Help → Plugins 管理)内置了几个实用件:

  • AI Summary:接 OpenAI 兼容 API,给转录自动生成摘要;
  • DeepFilterNet 降噪:转录前先做本地人声降噪;
  • Enhanced Language Detection:本地模型自动识别未知语种;
  • Export to DOCX:一键导出 Word 文档;
  • Skip Already Transcribed:重复导入同批文件时跳过已转过的,批量场景省算力;
  • Resize Transcript:转录完成后自动重排成字幕块。

社区插件可点Add by URL直接安装,写法参考 buzz/plugins/ 源码。

命令行批量处理

buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt /path/to/audio.mp4

作用:用 Whisper.cpp 的 small 模型转录指定文件,并直接输出 SRT 和 VTT 字幕。-l zh可指定语言,--txt-w(词级时间戳)等选项见 docs/docs/cli.md。

监听文件夹:偏好设置里配置一个 watched folder,往里丢文件就自动排队转录,配合上面的 Skip 插件可实现无人值守的批量转写。

高级调优:部分参数通过环境变量控制,Linux/macOS 可写进启动脚本:

export BUZZ_WHISPERCPP_N_THREADS=8 # Whisper.cpp 线程数,16 线程机器设为 8 通常更快 export BUZZ_FORCE_CPU=true # GPU 有问题时强制走 CPU buzz

完整变量表(含BUZZ_MODEL_ROOT改模型目录、BUZZ_FAVORITE_LANGUAGES置顶常用语言)见 docs/docs/preferences.md。

常见问题与性能调优

转得太慢怎么办?三招:换更小的模型;NVIDIA 显卡(≥6GB 显存)切到 Faster Whisper;N 卡之外的机器统一用 Whisper.cpp(支持 Vulkan 加速)。

崩溃或结果异常?多半是模型文件下载不完整。到"帮助 → 偏好设置 → 模型"里删除对应模型重新下载。另外注意 Buzz 要求 CPU 支持AVX2,过老的处理器无法运行。

录音时提示PaErrorCode-9999检查系统麦克风权限(Windows:设置 → 隐私 → 麦克风),或暂时关闭杀毒软件再试。

没有网络的机器能用吗?可以。在联网机器上先下载好模型,把整个模型缓存目录("模型"页有"Show file location"按钮直达)拷到离线机器相同位置即可。

GPU 加速不生效?Linux 的 NVIDIA 显卡开箱即用,异常时补装 CUDA 12 + cuBLAS + cuDNN;Windows 安装包已内置 CUDA 12 支持,旧 CUDA 版本会自动回落到 CPU。

要点回顾

  • Buzz 全程本地离线运行,免费、不上传音频,是隐私敏感场景(医疗、法务、采访)的稳妥选择;
  • 模型缓存位置固定(~/.cache/Buzz等),复制一份即可让离线机器"开箱即用";
  • 硬件普通就用Whisper.cpp + Base/Small,N 卡充足就上Faster Whisper + Medium/Large
  • 词级时间戳 + Resize 是字幕工作流的关键组合:先开-w,再按标点断句重排;
  • 批量与自动化靠三件套:命令行buzz add+ 监听文件夹 + Skip Already Transcribed 插件
  • 想继续深入:查看 docs/docs/ 目录下的使用手册,或参考 buzz/plugins/ 自己写一个插件。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询