Buzz 本地语音转录上手指南:离线安装、模型调优与排障全解
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
会议录音、访谈音频要上传到云服务器才能转录时,隐私与费用总是绕不开的问题。Buzz 是一个基于 OpenAI Whisper 的本地语音转录工具,录音、推理、导出全流程都在你自己的电脑上离线完成,音频文件不会离开设备。从安装验证到模型选择、故障排查,本文带你 10 分钟跑通全流程。
它解决了什么问题
语音转录的主要使用者是会议组织、访谈、授课和字幕制作等高频处理音视频的人。传统云端转录服务要求先上传文件,存在隐私顾虑、网络依赖和按量计费的问题。Buzz 把整条链路搬回本地:模型下载一次后,转录与翻译可在完全无网络的环境完成,同时提供 Whisper、Faster Whisper、Whisper.cpp、HuggingFace 等多种推理后端,支持 CUDA 与 Vulkan 加速,还能对多人对话做说话人识别。
5分钟跑起来
Linux 用 Flatpak 或 Snap 一键安装
flatpak install flathub io.github.chidiwilliams.Buzzsudo snap install buzzPython 方式安装(需先装好 ffmpeg 并准备 Python 3.12 环境)
pip install buzz-captions python -m buzzWindows 与 macOS 安装包
官方 .exe / .dmg 安装包可从项目发布页 SourceForge 下载。Windows 安装包未签名,安装出现警告时选择“更多信息”再“仍要运行”即可。
从源码构建开发版
git clone https://gitcode.com/GitHub_Trending/buz/buzz用 CLI 验证首次转录
应用启动后,也可以用内置命令行直接验证环境。下面这条命令用 Whisper.cpp 的 tiny 模型转录一段中文音频并直接输出 SRT 字幕:
buzz add --model-type whispercpp --model-size tiny --language zh --srt /path/to/audio.mp3图形界面下的验证方式:首次启动会打开主窗口,按 Ctrl/Cmd + O 导入一段短音频,点击 Run,任务状态变为 Completed 后双击该行能打开转录结果,即代表安装成功。
核心流程一图看懂
Buzz 的处理链路是一条单向流水线:各类输入先统一转成模型可读的音频,推理产出生成带时间戳的文本段落,落库后可继续编辑、精修或导出。
核心模块与职责:
| 模块 | 职责 |
|---|---|
| buzz/transcriber/ | 封装 Whisper、Faster Whisper、Whisper.cpp、HuggingFace、OpenAI API 等多后端推理 |
| buzz/whisper_audio.py | 音频解码与预处理,转成模型可读取的数据 |
| buzz/widgets/ | 界面:导入任务列表、录音控制、转录查看器、首选项 |
| buzz/db/ | 本地数据库,存储转录任务与段落级文本 |
| buzz/model_loader.py | 模型自动下载与缓存管理 |
| buzz/plugins/ | 插件系统:AI 摘要、DOCX 导出、降噪等 |
三个真实场景实战
场景一:本地音视频文件批量转录
- 按 Ctrl/Cmd + O 或点工具栏“+”导入一个或多个音频、视频文件,也支持粘贴 URL
- 任务行选择 transcribe 或 translate to English,语言建议手动指定,比自动检测更稳
- 点 Advanced 可配置 Initial prompt(初始提示词)、Word-Level Timings(词级时间戳)、Extract speech(语音分离)
- 点 Run,状态变为 Completed 后双击该行打开转录查看器
- 查看器里可搜索、编辑段落文本并导出 TXT / SRT / VTT
场景二:会议与演讲实时转写
- 打开 Live recording 选项卡,选好任务、语言与麦克风
- 配置有限时改用 Whisper.cpp 后端加小模型,实时性能更好,详见 实时录音文档
- 点 Record 开始录音,说话的同时文字持续生成
- 对外演示可点 Presentation window 打开大字版展示窗口
- 高级设置里可调整 Silence threshold、行分隔符与 Transcription step,Append and correct 模式更准但占用更高
需要转写电脑内部播放的声音时,先装一个虚拟声卡(macOS 的 BlackHole、Windows 的 VB-CABLE 均可),把声音路由过去再在 Buzz 里选它作为麦克风。
场景三:字幕精修、批量与自动化
- 双击任务行打开转录,对词级时间戳的转录点 Resize,把逐词结果合并成字幕,可设最大长度、按标点拆分,细节见 编辑与重排文档
- 多人群聊用 Identify speakers 自动标注说话人,可试听片段并改成真实姓名
- 批量处理用 CLI:buzz add 支持任务、后端、模型大小、语言、初始提示、输出格式等参数,详见 CLI 文档
- 首选项里开启 Watch folder 后,监控目录新增的音频会自动进入转录队列
- 配合内置插件做后处理:AI 摘要、导出 DOCX、Resize Transcript 自动字幕合并、DeepFilterNet 降噪,见 插件文档
参数与性能速查
模型大小是性能与质量的主要开关,Whisper 后端提供以下档位:
| 模型大小 | 速度 | 效果 | 资源占用 | 适用场景 |
|---|---|---|---|---|
| tiny | 最快 | 基础 | 低 | 快速草稿、低配机器 |
| base | 快 | 良好 | 低 | 速度与质量平衡 |
| small | 中等 | 良好 | 中等 | 日常转录常用选择 |
| medium | 较慢 | 很好 | 高 | 专业内容转录 |
| large | 最慢 | 最佳 | 很高 | 关键内容、低质量音频 |
large 还有细分版本:Large-V3 精度最高但偶尔会“脑补”音频里没有的词,Turbo 在速度与精度之间取平衡,选型逻辑见 FAQ: 该用哪个模型。
调优建议:
- 后端选择:没有 Nvidia 显卡就选 Whisper.cpp(可用 Vulkan 加速,集显、CPU 都能跑);显存 6GB 以上优先 Faster Whisper,比原生 Whisper 快一个量级,依据见 FAQ
- 内存吃紧时在模型首选项里下量化版模型(如 q5),或用 BUZZ_REDUCE_GPU_MEMORY 环境变量开启 8bit 量化,变量说明在 首选项文档
- 线程数环境变量 BUZZ_WHISPERCPP_N_THREADS 默认是 CPU 核心数的一半,16 线程机器设为 8 比盲目加线程更快,同样见 首选项文档
- 专业领域人名、术语易错时,把常见词写进 Initial prompt 可显著减少拼写错误,方法见 文件导入文档
排障手册
- 转录太慢:换更小的模型或改用 Whisper.cpp 后端;显存 6GB 以上的机器可换 Faster Whisper,速度会快一个量级
- 识别错误偏多:手动指定语言代替自动检测,补充 Initial prompt 给上下文,仍不理想就换大一号的模型
- 录音报 PaErrorCode-9999:检查系统隐私设置是否授予 Buzz 麦克风权限(Windows 在 设置 → 隐私 → 麦克风),并尝试临时关闭杀毒软件
- 断网环境能否使用:可以,联网机器下载好模型后,把模型缓存目录(Linux 为 ~/.cache/Buzz)整体拷贝到离线机的相同位置
- GPU 加速不生效:Linux 需 CUDA 12 及 cuBLAS、cuDNN;Windows 安装包已内置 GPU 支持;老显卡兼容有问题时可设 BUZZ_FORCE_CPU=true 强制走 CPU
- 老电脑无法运行:Buzz 要求 CPU 支持 AVX2 指令集,非常老的机型不在支持范围内,崩溃排查与日志位置见 FAQ
结语
Buzz 把音频转录整条流程收进你的电脑:离线优先、后端可选,从单文件转录、实时演讲字幕到批量自动化都能覆盖,插件机制让后处理也能按自己的需求扩展。想参与改进,看 CONTRIBUTING.md 即可上手,遇到问题也欢迎到项目 issue 区反馈。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考