Buzz 离线语音转文字完整指南:四步跑通你的第一个转写任务
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
如果你手头有一段两小时的访谈录音,或者想把网课视频变成文字稿,你可能正需要一种在本机就能完成音频转文字的解决方案。Buzz 就是这样一个开源工具:它运行在你自己的电脑上,基于 OpenAI 的 Whisper 语音识别模型(一个专门把声音变成文字的 AI 模型)完成离线语音转文字和翻译,音频文件从头到尾不用离开你的设备。它支持 Windows、macOS 和 Linux,可以输出 TXT、SRT、VTT 等格式,也支持麦克风实时转写。这篇文章带你从安装一路走到批量自动化。
先解决"为什么用本地"的问题
把录音上传到云端转录服务虽然省事,但有几点绕不开:文件要经过别人的服务器;敏感内容(客户采访、医疗访谈、公司内部会议)一旦上传就不可控;部分长音频还涉及按量计费。
Buzz 的思路相反:
- 转写模型下载后存在本地,识别过程不联网,隐私由你自己把关
- 免费开源,MIT 协议,个人和团队使用都不花钱
- 同一套操作逻辑覆盖文件转写、麦克风实时转写两种用法
安装:按你的系统选一条路
- macOS:下载 dmg 安装包双击安装即可,Intel 和 Apple Silicon 芯片都支持
- Windows:运行安装程序。首次安装会弹出安全提示,因为应用没有数字签名,点"更多信息 → 仍要运行"即可
- Linux:通过 Flatpak 或 Snap 商店安装,例如 Flatpak 一行命令就能装好
安装完成先别急着用。首次使用时 Buzz 会让你下载转写模型,模型默认存在用户缓存目录(设置里"模型"页面有"显示文件位置"按钮,可以直达那个文件夹)。
四步完成第一次文件转写
- 点工具栏的"+"按钮(或按 Ctrl+O),选择音频或视频文件,MP3、WAV、M4A、MP4 都行
- 在任务栏选择任务(转写,或翻译成英语)和语言。强烈建议手动指定语言——自动检测只靠开头几秒音频判断,混合口音时容易猜错
- 选择模型后点Run。第一次运行某个模型前会先下载,之后就是本地计算
- 状态变为 Completed 后,双击这一行打开转写查看器,双击任意一句可以回到原音对应位置试听
官方对导入流程的详细字段说明在 docs/docs/usage/1_file_import.md,里面的"Initial prompt"(初始提示词)可以填人名、专业术语,能明显减少这类词的拼写错误。
三个值得了解的核心能力
转写查看器:搜索、试听、识别说话人
转写完成后的查看器不只是"看一段文字":
- 支持关键词搜索,长访谈里找某个说法直接定位
- 有播放控制和倍速调节,校对时可以 2 倍速快速过
- 支持说话人识别(speaker identification),自动把同一段转写按"谁说的"分段,多人对话整理起来快很多
麦克风实时转写
选好转写任务、语言和麦克风,点 Record,句子就会随说随出。它适合三类场合:会议记录、演讲现场、给课程做实时字幕。录音开始后会出现Presentation window(演示窗口)选项,可以把实时文字投到大屏幕上。官方文档特别提示:实时转写对算力要求高,建议用 Whisper.cpp 模型并选小尺寸档位。
边转写边翻译
任务选"Translate to English"后,外语音频直接产出英文文本。如果你主要处理中文内容,也可以把中文音频转成英文文本,方便后续处理。
模型怎么选:一张表对号入座
先说结论:模型大小决定"准还是快",实现类型决定"在你什么硬件上跑得动"。
📌模型尺寸(Whisper 系列,从最小到最大):
| 尺寸 | 特点 | 适合 |
|---|---|---|
| tiny | 最轻量、最快 | 先跑通流程、低配设备 |
| base | 小而均衡 | 日常转写 |
| small | 准确率明显提升 | 有大量专有名词的音频 |
| medium | 更准,速度慢不少 | 不赶时间、追求质量 |
| large | 最准,需求最高 | 专业场景,配合显卡 |
官方 FAQ 里的经验之谈是:没有万能答案,建议在自己的语言上各试一遍。Large-V2 稳定,Large-V3 更准但偶尔会"无中生有"编造词,Turbo 则在速度和准确率之间取平衡。
📌实现类型(同一套模型的几种"运行方式"):
| 类型 | 硬件情况 | 说明 |
|---|---|---|
| Whisper.cpp | 无独显、集显、Mac | C++ 优化实现,CPU 也能跑,苹果电脑首选 |
| Faster Whisper | N 卡且显存 ≥6GB | 比原版快很多,显存占用更低 |
| Whisper(原版) | 大内存机器 | OpenAI 原始实现,稳但慢 |
| Hugging Face | 各类设备 | 支持上千种语言的 MMS 等定制模型 |
| OpenAI API | 本地硬件不够时 | 走云端,需要密钥,不再纯离线 |
下载和删除模型都在"帮助 → 偏好设置 → 模型"里完成。不用的模型删掉能省几十 GB 磁盘。
三个高频场景的推荐设置
🎬 场景一:访谈/播客做成字幕文件
推荐设置:
- 模型:Whisper.cpp + small 或 medium
- 勾选"Word-Level Timings"(逐词时间戳),让每个词都带时间点
- 导出格式选 SRT
操作步骤:导入音频 → 勾选逐词时间戳 → 运行 → 完成后用内置的字幕调整功能(或 Resize Transcript 插件)把逐词结果合并成"一行一句、长度合适"的正式字幕行 → 导出 .srt,可直接拖进视频剪辑软件。
🎙️ 场景二:会议实时记录
推荐设置:
- Whisper.cpp + tiny/base(实时性优先,准确率靠后续校对)
- 语言明确指定,别用自动检测
- 开启实时文本导出:生成的文字会边转边写进一个 txt 文件,方便接 OBS 等推流软件
操作步骤:选麦克风和语言 → 点 Record → 会议结束即停。需要投屏演示就打开演示窗口。
📁 场景三:文件夹自动批量转写
在偏好设置里启用文件夹监控(watch folder),指定一个路径后,往里丢的新文件会自动进入转写队列——出差路上把文件丢进网盘同步目录,回家时文稿已经转好了。
配合 Skip Already Transcribed 插件使用:它先检查同名结果文件是否已存在,已转过的直接标记 Skipped,重复导入一个文件夹时不会白烧算力。
进阶玩法:命令行与插件
Buzz 自带完整的 CLI(命令行界面,指在终端里用命令而不是鼠标操作应用的方式),适合写脚本做批量任务。最常用的"加一个转写任务并导出字幕"一条命令就够:
buzz add --model-type whispercpp --model-size small --language zh --srt --vtt 访谈录音.mp3加上--hide-gui可以让主窗口隐藏,纯后台跑。完整参数列表见 docs/docs/cli.md。
从 1.4.5 版本开始,Buzz 有插件系统,内置插件包括:
- AI Summary:调用 OpenAI 兼容接口(也可以是本机 Ollama)给长转写生成摘要
- DeepFilterNet:转写前自动降噪,嘈杂录音的识别率会明显改善
- Export to DOCX:把转写结果导出成 Word 文档
- Enhanced Language Detection:先用本地小模型判断语言再转写,适合语言未知的文件
管理入口在"帮助 → 插件",可以开关、排序、改配置。想看插件怎么写,直接读 buzz/plugins/ 目录下的源码,内置插件就是现成模板。
常见疑问:现象 → 原因 → 解决
1. Windows 安装时弹"未知发布者"警告原因:安装包没有数字签名。解决:点"更多信息 → 仍要运行",属于正常现象。
2. 转写特别慢原因:模型档位太高,或没走 GPU。解决:换 Whisper.cpp 实现 + 小一档模型;N 卡用户可改用 Faster Whisper;具体排查思路见 docs/docs/faq.md。
3. 点运行后 Buzz 闪退原因:模型文件下载不完整或损坏(很常见)。解决:在"偏好设置 → 模型"里删掉该模型重新下载。另注意 Buzz 要求 CPU 支持 AVX2 指令集,非常老的电脑无法运行。
4. 录音报错,提示麦克风访问失败原因:系统隐私设置没给权限(Windows 下常见错误码 PaErrorCode-9999)。解决:到"设置 → 隐私 → 麦克风"里确认 Buzz 有权限,再检查杀毒软件是否拦截。
5. 想在完全断网的机器上用原因:模型需要先联网下载一次。解决:在有网电脑上把模型下好,整个模型缓存目录拷到离线机器相同位置;项目里还附带了 scripts/download-models.py 脚本帮你提前备齐模型。
Buzz 的价值不在于某个单点功能,而在于"离线转写 + 多种模型实现 + 实时/批量两种节奏"这条完整链路:小文件用 tiny 模型几分钟出稿,正式交付用 medium 以上逐词校对,会议室里直接开实时记录,文件夹里堆多少文件它就消化多少。装好它、下载一个 base 模型、丢一段音频进去,你的第一个转写文稿离你只有四步。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考