Buzz 音频转录完整指南:本地部署 Whisper,一条命令开始语音转文字
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款基于 OpenAI Whisper 的本地语音转文字工具:它把模型直接装在你电脑上,音频文件、麦克风录音和网页链接都能在离线状态下转录成带时间戳的文字,还支持翻译成英文。数据不出本机、不收 API 账单、不限调用次数,这是它最值得上手的地方。整个处理链路很简单:音频输入 → 预处理 → Whisper 推理 → 后处理 → 导出,你不需要理解细节,只需要会点按钮。
为什么音频转录要搬到本地
结论先说:怕录音内容泄露、常断网、或不想被 API 额度卡住的人,本地部署是更稳的选择。把两种方案放在一起看,差异很清楚:
| 维度 | 云端 API 转录 | Buzz 本地部署 |
|---|---|---|
| 隐私 | 音频上传到第三方服务器 | 文件始终留在本机 |
| 网络 | 必须联网,弱网即失败 | 模型下载一次后即可完全离线使用 |
| 用量限制 | 按分钟计费或有调用配额 | 无限制,转多久都行 |
| 速度 | 受网络波动影响 | 取决于本地硬件,可复现 |
Buzz 支持 99 种语言的转录,也支持把任意语言翻译成英文;模型自动下载并缓存在本地(各平台的缓存位置可在 docs/docs/faq.md 查到),断网环境照样能跑。
四大平台安装速查
安装本身一条命令就够,唯一的公共前置是装好 ffmpeg——Buzz 靠它解码音频。
- Windows
winget install ChidiWilliams.Buzz- macOS
brew install --cask buzz- Linux(Flatpak 或 Snap)
flatpak install flathub io.github.chidiwilliams.Buzz sudo snap install buzz- 源码 / PyPI 安装:先装好 ffmpeg(Ubuntu 用
sudo apt install ffmpeg),再执行:
pip install buzz-captions python -m buzzNvidia 显卡用户装好 CUDA 版的 PyTorch 即可获得 GPU 加速,具体步骤参考 docs/docs/faq.md 的 GPU 部分。
第一条转录跑起来
四步就能看到结果,建议第一次就用 tiny 模型,出结果最快:
- 打开 Buzz,点击"导入文件"(快捷键
Ctrl+O),选一个音频或视频文件。 - 在转录选项里确认模型为 tiny、语言选"自动检测"。
- 点击"开始转录",首次运行会自动下载模型,耐心等待一次。
- 任务完成后双击列表中的转录记录,即可查看带时间戳的全文。
上图就是 Buzz 的文件转录界面:左侧导入文件,右侧是转录任务列表,所有后续操作都从这里出发。
文件、录音、URL 三种入口怎么选
三种入口覆盖几乎所有场景,按素材来源对号入座即可。
转录本地文件
适合已有的录音、播客、会议录像等成品文件。
Ctrl+O导入一个或多个文件,支持批量;- 设置语言、任务类型(转录或翻译成英文)和模型;
- 开始转录,输出 TXT/SRT/VTT 保存在源文件同目录。
录音实时转录
适合会议、讲座、采访等正在发生的内容。
- 点击顶部麦克风按钮进入录音界面,选择输入设备;
- 点红色录制按钮开始,过程中可随时暂停跳过无关片段;
- 停止后自动保存录音音频和转录文本。
导入 URL
适合 YouTube 等可直接下载链接的内容,免去手动下载视频。
- 工具栏选择"导入 URL",粘贴链接;
- Buzz 下载媒体文件后按任务队列正常排队处理;
- 后续操作与本地文件完全一致。
Buzz 模型怎么选:准确率与速度的权衡
选型的唯一权衡就是速度换精度:小模型跑得快但错得多,大模型准但吃内存、跑得慢。
| 模型 | 速度 | 精度 | 内存需求 | 适合谁 |
|---|---|---|---|---|
| tiny | 最快 | 基础 | <1 GB | 快速预览、低配电脑 |
| base | 快 | 良好 | ~1 GB | 日常速记 |
| small | 中等 | 优秀 | ~2 GB | 多数人的默认选择 |
| medium | 较慢 | 非常好 | ~5 GB | 专业内容 |
| large | 最慢 | 最佳 | ~10 GB | 关键内容、嘈杂音频 |
除了尺寸,还有三个参数直接决定准确率:
- 温度:默认是一组递增的后备值。清晰人声用低温度更稳;环境吵、口音重时适当调高,给模型更多重试机会。
- 初始提示:转录专业内容时,把术语表写进初始提示(如"本次涉及心电图、心肌梗死等术语"),模型会优先识别这些词。
- 手动指定语言:混合语言内容建议直接指定主语言,比自动检测更可靠。
这些参数都在首选项 → 模型页维护(模型文件由 buzz/model_loader.py 统一下载和缓存)。另外 Whisper.cpp 引擎在纯 CPU 和 Mac 上表现最好,有 6 GB 以上显存的 Nvidia 显卡则建议用 faster-whisper。
从草稿到成品
Buzz 的转录查看器支持搜索、播放控制,并允许精修到单词级时间戳:
- 拖拽片段边缘或直接改时间值,修正不准确的起止点;
- 双击文本直接编辑,改错字、补标点;
- 合并或拆分片段,让段落更自然;
- 通过导出菜单输出 TXT、SRT、VTT 三种格式,文件名模板可在首选项里自定义。
转录完的长视频,可以用分段调整功能把一条大段落切细,字幕就不会"挤成一坨":
Buzz 批量转录:文件夹监控与命令行
处理一整批文件时,别再手动点。打开 帮助 → 首选项 → 文件转录:
- 勾选"启用文件夹监控";
- 选好输入文件夹和输出文件夹,按需勾选"删除已处理文件";
- 在同一页面配置好默认模型、语言等转录选项,之后丢进输入目录的新文件会被自动处理。
监控逻辑实现在 buzz/widgets/transcription_task_folder_watcher.py。更喜欢脚本化的人直接用 CLI(完整参数见 docs/docs/cli.md):
# 转录单条文件并直接导出 SRT buzz add --model-type whispercpp --model-size small --srt ./meeting.mp3 # 批量转录多个文件 buzz add --model-size medium --language zh ./a.mp3 ./b.mp3排错速查:现象、原因与动作
🔧 遇到问题先对照这张表,能解决大部分常见状况:
| 现象 | 可能原因 | 你的动作 |
|---|---|---|
| 转录速度太慢 | 模型太大或纯 CPU 运行 | 换 tiny/base 模型;Nvidia 显卡装 faster-whisper,其他机器换 Whisper.cpp |
| 内存占用大 | large/medium 模型吃显存 | 降一档模型;减少同时入队的任务数 |
| 识别错误多 | 模型小、音频吵或领域词陌生 | 换更大模型;写入术语初始提示;先降噪 |
| 某格式导入失败 | 未装 ffmpeg 或版本过旧 | 安装最新版 ffmpeg 后重试 |
| 启动或转录时崩溃 | 模型文件下载不完整 | 首选项 → 模型中删除后重新下载;还不行就看 帮助 → 关于 Buzz → 显示日志 |
| 提示 CPU 不支持 | 老机器没有 AVX2 指令集 | 硬件限制,需更换支持 AVX2 的电脑 |
更多细节(离线环境搬运模型、系统录音等)见 docs/docs/faq.md。
写在最后
Buzz 把 Whisper 本地部署做成了普通用户也能上手的程度:一条命令装好,四个步骤转出第一条文字,之后靠模型、温度、初始提示三个旋钮调质量,最后用文件夹监控和 CLI 把重复劳动交给机器。会议录音、课程录像、访谈整理,这些场景里它都能离线顶用。项目仍在持续迭代,多说话人分离等能力也在路上;如果你愿意修 bug 或加功能,可以从 CONTRIBUTING.md 开始。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考