Buzz 离线音频转录:本地 Whisper 五种后端,字幕、纪要、直播文字一次搞定
2026/9/7 9:10:49 网站建设 项目流程

Buzz 离线音频转录:本地 Whisper 五种后端,字幕、纪要、直播文字一次搞定

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款完全在本地运行的音频转录工具,基于 OpenAI 的 Whisper 模型,把录音转成文字、翻译成其他语言,全程不经过任何云端服务器。它既能处理导入的音视频文件,也能对着麦克风做实时转录,结果支持导出 TXT、SRT、VTT 等格式,模型与历史任务都保存在自己的电脑上。

🚀 先跑起来:四种安装方式与首次转录

按你的系统选一种装法即可:

  • macOS / Windows:从发行版下载页获取.dmg或安装包(Windows 安装包未签名,安装时选择“更多信息”→“仍要运行”即可)
  • Linuxflatpak install flathub io.github.chidiwilliams.Buzz,或sudo snap install buzz
  • 开发者:准备 Python 3.12 环境和 ffmpeg 后执行pip install buzz-captions,再运行python -m buzz

首次使用的主线流程只有四步:点工具栏的 “+” 或按Ctrl/Cmd + O导入音频/视频文件;在任务行选择任务类型(转录或翻译成英语)、语言和模型;点 Run;状态变为 Completed 后双击该行打开转录查看器。默认使用 tiny 模型,首次运行会按需下载对应模型文件。

🔍 核心能力深读

五种 Whisper 后端,一个模型管理面板

Buzz 把同一份任务交给不同引擎执行:OpenAI 原版 Whisper 最稳但吃内存;Whisper.cpp 是 C++ 实现,支持 Vulkan 加速,核显甚至纯 CPU 都能实时转录,也是 Mac 上的首选;Faster Whisper 适合 NVIDIA GPU(建议 6GB 显存以上);Hugging Face 后端可加载社区定制模型,从 1.4.0 起还支持 Meta 的 MMS 系列(覆盖上千种语言);OpenAI API 后端则把识别交给远程服务。模型尺寸从 tiny 到 large,另有 large-v2、large-v3 和兼顾速度的 turbo 可选。

它解决的问题是“同一台电脑上,精度和速度怎么平衡”。入口在Help → Preferences → Models,可以下载、删除模型,还能给 Whisper.cpp 填自定义.bin模型地址或使用量化版本省显存。模型缓存位置:Linux 在~/.cache/Buzz,macOS 在~/Library/Caches/Buzz,Windows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache

实时录音转录与演示窗口

选择任务、语言、麦克风后点 Record,Buzz 就会边听边出字。实时模式有三种:新句追加在下方、追加在上方、以及“追加并修正”(会回头纠正已出文字,更吃算力)。偏好里还能设静音阈值、转录步长,并开启“实时文本导出”,把正在生成的文字持续写入 txt 文件,方便喂给 OBS 这类推流软件。录音开始后会出现演示窗口选项,把当前字幕投到大屏上,适合讲座和发布会场景。

转录查看器:搜索、改时间戳、分说话人

双击任务行进入查看器,顶部有视图切换(时间戳/纯文本/译文)、搜索框和导出菜单;下方是可编辑的段落表,能拖动调整起止时间、拆分合并段落,播放器支持调速。对于多人的会议录音,点 “Identify speakers” 后 Buzz 会自动给每个句子打上说话人标签,你可以试听任意句子 10 秒来确认身份、把标签改成真实姓名,保存时勾选合并选项还能把同一人的连续句子并成一段。

🎬 实际用法

  • 会议录音出纪要:导入会议录音跑完转录后,直接用说话人识别区分各人发言,重命名标签、导出 TXT 归档;如果音频有背景噪音,可以先启用 DeepFilterNet 降噪插件再转录。
  • 给视频补字幕:导入 MP4 后 Buzz 自动提取音轨,选择导出 SRT 或 VTT;想要更细的字幕块时开启 word-level timestamps,再用 Resize Transcript 插件按静音间隔和标点把逐词结果重排成标准字幕长度。
  • 批量与脚本化:配合 watch folder 让新放进目录的文件自动排队转录;需要固定流程时直接用 CLI,例如buzz add --task translate --language fr --model-type openaiapi 文件1.mp3 文件2.mp3,参数详见 CLI 文档。

⚠️ 避坑清单

  • 实时转录卡顿:换用 Whisper.cpp 并选 small 及以下模型,同时观察队列长度,步长调大一点能减压
  • Windows 提示麦克风错误(PaErrorCode-9999):检查系统设置里 Buzz 的麦克风权限
  • 转录崩溃:多为模型下载不完整,到 Models 偏好里删掉重下;另注意 CPU 需要支持 AVX2,过老的机器跑不了
  • 语言检测结果不对劲:自动检测只看开头几秒,已知语言时请手动指定
  • 无网络的机器:在联网电脑上先下载好模型,把整个模型缓存文件夹拷到同路径即可
  • 模型太吃内存:换量化版本(如 q_5)或在偏好中开启 “Reduce GPU RAM”

更多问题可查 官方 FAQ。

🛠 给开发者

Buzz 用 Python + Qt 编写,采用 MIT 许可。代码结构清晰:转录引擎 封装各后端,界面组件 负责主窗口与查看器,数据层 管理任务与段落的 SQLite 存储,插件系统 允许在转录前后插入自定义处理(Help → Plugins 里可以启停、排序、调参,还能用 “Add by URL” 安装社区插件,内置了 AI 摘要、DOCX 导出等六个)。测试位于tests/,文档源码在docs/。想改代码或提功能建议,可以克隆仓库https://gitcode.com/GitHub_Trending/buz/buzz后参与贡献。

Buzz 适合所有不想把录音交给云端、又想要带时间戳字幕和说话人标记的场景。装一个、下一个模型,第一次转录通常几分钟内就能跑通。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询