Buzz 本地语音转录工具:3 步把音频变成可编辑的字幕
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款运行在你个人电脑上的离线语音识别应用,基于 OpenAI 的 Whisper 模型,可以把 MP3、WAV 等音频文件、视频文件甚至 YouTube 链接转成文字,并支持翻译成英文。它适合需要处理会议录音、访谈资料、视频字幕,又不想把原始音频交给第三方服务的用户。全文按"选它 → 装它 → 用它跑完一次任务 → 调常用设置"的顺序展开,读完即可独立完成一次完整的离线转录。
先判断:这 3 种情况适合用 Buzz
- 音频内容敏感,希望处理过程发生在本地机器上,而不是上传给在线服务。Buzz 的所有 Whisper 类模型都在本机运行,只有第一次下载模型时需要联网;模型缓存目录可在 偏好设置 → 模型 中查看,也能整体复制到断网机器上使用。
- 需要批量或自动化处理:Buzz 支持文件夹监视(watch folder),新放入的音频会自动排队转录。
- 需要字幕或时间戳:导出格式包含 TXT、SRT、VTT,并且可以对转录结果做编辑和时长调整。
如果你的场景是"把麦克风里的话实时转成文字展示",Buzz 的实时录音功能也能覆盖,见后文。
安装 Buzz 并首次启动
Windows
从 SourceForge 的 buzz-captions 项目页下载安装包。安装程序未签名,系统会弹出警告,选择"更多信息"→"仍要运行"即可。安装包已内置 GPU 支持,需要 CUDA 12 环境,旧版本 CUDA 的机器会退回 CPU 运行。
macOS
下载.dmg文件,将应用拖入应用程序文件夹。Apple Silicon 与 Intel 芯片均有对应版本。
Linux
两种包管理方式任选其一:
# Flatpak flatpak install flathub io.github.chidiwilliams.Buzz # Snap sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzz sudo snap connect buzz:password-manager-service通过 Python 安装
pip install buzz-captions python -m buzz建议配合 Python 3.12 环境,并提前装好 ffmpeg。NVIDIA 显卡用户需要按 docs/docs/installation.md 中的说明为 torch 安装 CUDA 版本。
第一次完整任务:从导入文件到导出字幕
主界面是一张任务表,每一行是一个转录任务,能看到状态、进度和所用模型。第一次操作的完整流程:
- 点击工具栏的"+"图标(或菜单"文件 → 导入媒体文件",快捷键
Ctrl/Cmd + O),选择音频或视频文件。 - 在任务行里选择三个参数:
- 任务:Transcribe(原语言转写)或 Translate to English(翻译成英文);
- 语言:官方文档建议手动指定语言,自动检测基于开头几秒音频,可能出现意外结果;
- 模型:类型(Whisper / Whisper.cpp / Faster Whisper 等)与大小(tiny 到 large)。
- 点击Run开始转录,状态变为 Completed 后,双击该行打开转录查看器。
- 在查看器顶部工具栏点击Export,选择 SRT、VTT 或 TXT 导出。
查看器里可以同时搜索文本(Ctrl/Cmd + F)、播放音频并跟随滚动(Ctrl/Cmd + G跳到当前位置)、按 0.5 秒步进微调片段起止时间。
实时录音:会议场景的另一种入口
不想先录文件再转?在录音面板选择任务、语言、麦克风和模型后点击Record,Buzz 会边录边转,并支持"追加重写"(Append and correct)模式对已出句尾做纠错。实时模式下建议选 Whisper.cpp 和较小的模型,降低延迟与占用;NVIDIA 显卡用户可改用 Faster Whisper。录音开始后会出现Presentation window(演示窗口),适合在会议或演讲现场把实时文字投到大屏。
字幕长度调整:让 SRT 更像成品
导出字幕前,Buzz 提供一个 Resize(调整大小)入口,用于把过长的字幕行重组为适合屏幕上显示的长度:
- 开启 Word-Level Timings 生成的转录,可以按静音间隙合并、按标点拆分,并设置单条字幕最大长度;
- 未开字级时间戳的转录,只能按最大长度重新切分;
- 还可以给每条字幕统一延长显示秒数,避免闪得太快。
常用设置:模型、命名规则与插件
偏好设置(Ctrl/Cmd + ,)里高频使用的几项:
- 模型管理:下载、删除模型;Whisper.cpp 支持自定义
.bin模型和 q5 等量化版本,可显著降低显存与内存占用。模型缓存位置(Linux~/.cache/Buzz、macOS~/Library/Caches/Buzz、Windows%USERPROFILE%\AppData\Local\Buzz)可在此页一键打开。 - 默认导出文件名:支持模板变量,如
{{ input_file_name }} ({{ task }}d on {{ date_time }}),批量导出时命名更可控。 - 初始提示(Initial prompt):在导入面板的 Advanced 里填写,把容易拼错的人名、术语放进去,可以减少错字。
- 插件(1.4.5 起,Help → Plugins 管理):内置 AI 摘要、DOCX 导出、降噪(DeepFilterNet)、跳过已转录文件等,可以逐个开关并调整执行顺序。
三个典型用法示例
示例一:会议录音自动出文字稿。开启文件夹监视,把录音丢进指定文件夹,Buzz 自动排队转录并导出;配合"跳过已转录"插件,重复导入同一文件夹也不会重跑模型。
示例二:为视频生成字幕。导入 MP4,任务选 Transcribe 并指定语言,开启 Word-Level Timings,转完后用 Resize 设置字幕最大长度,再导出 SRT 直接交给剪辑软件。
示例三:完全离线环境使用。在联网机器上提前下载所需模型,将整个模型目录复制到离线机器相同位置(例如 Linux 主目录下的.cache/Buzz/models)即可。仓库里还提供了一个 scripts/download-models.py 脚本,可用来批量准备离线模型缓存。
开始前的检查清单
- 转录太慢:换更小的模型,或改用 Whisper.cpp;有 6GB 以上显存的 NVIDIA 显卡可试 Faster Whisper。
- 模型怎么选:小模型快但错得多,大模型准但吃硬件;FAQ 中对比了 Large、Large-V2、Large-V3 与 Turbo 的特性差异,最稳妥的方式是拿自己的语言各试一遍。
- 麦克风报错(如 PaErrorCode-9999):检查系统隐私设置里 Buzz 是否有权访问麦克风。
- 应用启动崩溃:多半是模型下载不完整,到 偏好设置 → 模型 删除后重新下载。
- 老机器注意:Buzz 需要 CPU 支持 AVX2 指令集。
延伸资料
- 安装细节与依赖说明:docs/docs/installation.md
- 文件导入选项表:docs/docs/usage/1_file_import.md
- 实时录音与系统声音录制(虚拟声卡配置):docs/docs/usage/2_live_recording.md
- 命令行用法(脚本化、批量导出 SRT/VTT):docs/docs/cli.md
- 插件开发参考:buzz/plugins/
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考