Buzz 离线转录完整指南:Whisper 语音转文字工具从入门到导出 SRT
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款开源的离线语音转文字工具,基于 OpenAI Whisper,把音频转写成文字的全部计算都跑在你自己的电脑上。数据不上传、断网照常工作、一次安装后不再产生任何费用,这是它相对云端转录服务最实在的三个差别。
Buzz 离线转录和云端方案,差在哪里
这一节用可量化的差别说明 Buzz 适合谁:模型文件(如 Base 档约 142MB)下载一次后,整个转录过程不需要任何网络连接,官方 FAQ 甚至给出了"把模型目录拷到离线电脑即可用"的完整方案;下载好的模型存放在本机缓存目录(Linux 为~/.cache/Buzz),拷走就能让第二台机器离线开工。
| 维度 | Buzz 本地离线转录 | 云端转录服务 |
|---|---|---|
| 断网可用性 | 预下载模型后,转录、导出字幕全部照常 | 无网络即完全不可用 |
| 数据归属 | 音频与文稿只存在于本地文件 | 原始文件上传至服务商服务器 |
| 第 100 小时音频的成本 | 0 元,无次数限制 | 按分钟累加计费或订阅续费 |
| 模型与格式控制 | 5 档 Whisper 模型可选,TXT/SRT/VTT 自由导出 | 能力与格式由服务商决定 |
如果处理的是律师访谈、医疗记录、学术资料这类内容,或者长期有大量长音频要批量转写,本地方案在数据归属和长期成本上都能给出确定答案。
Buzz 怎么安装:四步跑通第一次离线转录
照下面的顺序操作,约 5 分钟能看到第一份文稿。
- 安装:Windows 与 macOS 下载官方安装包;Linux 执行
flatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzz;命令行路线为pip install buzz-captions后运行python -m buzz(需 Python 3.12 及 ffmpeg)。 - 导入:点左上角"+"或菜单 File → Import Media File,选中 MP3、WAV、MP4、AVI 等文件。
- 指定语言:在语言下拉框里手动选择音频语种——这是新手最容易踩的坑,自动检测遇到带口音或背景嘈杂的录音经常误判,判错就要整段重跑。
- 运行:点 Run,状态变为 Completed 后双击该行打开文稿。
第一次运行时 Buzz 会按所选档位自动下载模型,网速慢的话这一步耗时最长。如果文稿里有专有名词、人名,点"Advanced..."在 Initial prompt 填入相关术语,这些词的出现准确率会明显提高。
完整的图文说明在 docs/docs/,从文件导入到插件共 7 个主题。
Buzz 模型怎么选:速度、内存和精度怎么权衡
Buzz 的效率由四个开关决定:模型档位、Whisper 后端实现、GPU 加速、词级时间戳。先按下表定档位:
| 模型 | 体积 | 速度 | 精度 | 适合场景 |
|---|---|---|---|---|
| Tiny | 约 75MB | 最快 | 基础 | 快速试听、老机器 |
| Base | 约 142MB | 快 | 良好 | 日常首选 |
| Small | 约 466MB | 中等 | 优秀 | 正式转录、做字幕 |
| Medium | 约 1.5GB | 较慢 | 很好 | 高精度需求 |
| Large | 约 2.9GB | 最慢 | 最好 | 多语言、专业任务 |
如果录音较长且机器没有独显,从 Base 起步并观察耗时;如果有 6GB 显存以上的 NVIDIA 显卡或 Apple Silicon,就在偏好里选对应后端并启用加速,1 小时音频的处理时间能从半小时级压到几分钟。要产出字幕,转录前勾选 Word-Level Timings,完成后在查看器点 Resize,可按标点、最长时长、静音间隔自动重新断行,SRT/VTT 直接导出,不必手工逐条调整。模型在 Help → Preferences → Models 里统一下载和管理:
按角色用 Buzz:创作者、研究者与会议记录者
按身份取用功能,不需要全部学会。
- 视频创作者:勾选词级时间戳后,文稿就是带时间轴的字幕行;配合"翻译"任务把英文访谈译成中文再导出 SRT,整条字幕流水线在本地完成。
- 研究者与会议记录者:在偏好里配置文件夹监控,把一上午的访谈录音丢进该文件夹即自动转录;查看器自带搜索、播放控制和语速调节,2 小时录音也能快速定位到某句话。
- 实时使用者:连接麦克风边开会边出文字,打开演示窗口可以在投屏时当大字幕用。
- 开发者:命令行可直接写进脚本,例如
buzz add --task transcribe --model-size small --srt /path/to/file.mp3,转录完自动落一份 SRT 文件,参数全集见 docs/docs/cli.md;AI 摘要、DeepFilterNet 降噪、DOCX 导出、跳过已转录文件等都做成了可开关插件,按需启用。
深入仓库:文档、插件与核心模块
想看内部实现,从这三处入手即可。
- buzz/plugins/:插件系统本体,含 AI 摘要、降噪、导出、跳过已转录等 6 个内置插件的完整源码,照着写就能扩展。
- buzz/transcriber/:各 Whisper 后端的接入层,whisper.cpp、faster-whisper、OpenAI API 都在这里对接。
- buzz/db/:本地任务数据库,文稿与分段信息如何持久化。
Buzz 对语音转文字给出的答案是本地、免费、开源。下一步:下载安装后导入你最近的一段录音,手动选语言点 Run,记下 1 小时音频实际花掉几分钟。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考