Buzz 离线转录指南:3 步把会议录音变成字幕,全程免费不上云
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款跑在本地的音频转文字工具,基于 OpenAI 的 Whisper 模型,支持 99 种语言,数据全程留在你的电脑里。装好之后,你可以导入一段 MP3,几分钟拿到带时间戳的文字稿;也可以对着麦克风说话,让句子实时变成字幕。
先跑起来:Buzz 安装各平台一条命令
这一节让你在 5 分钟内装好 Buzz,覆盖 Windows、macOS 和 Linux。
Windows:执行
pip install buzz-captions,再用python -m buzz启动;或者从发布页下载安装包双击运行,出现"未验证发布者"提示时选「更多信息 → 仍要运行」。macOS:从发布页下载
.dmg,把 Buzz 拖进"应用程序"文件夹;命令安装方式与 Windows 相同。Linux:
sudo snap install buzz
首次启动会自动下载基础转录模型,等它完成即可。之后按 Ctrl(Mac 上是 Command)加逗号打开设置窗口,在"模型设置"里能看到下载进度,也可以提前把常用模型下好。
第一次转录:4 步从音频到文字
这一节带你走最短路径,拿到第一份文字稿。
- 点工具栏的"+"号(或 Ctrl/Command + O),选中音频文件,MP3、WAV、M4A、MP4 都支持。
- 选择文件使用的语言——手动指定比自动检测更稳定;模型保持默认 Base 即可。
- 点 Run,等状态列显示"Completed"。
- 双击该行打开转录结果,选一个格式导出,文字稿就成了。
如果音频里有人名、地名或专业术语,可以把容易拼错的词写进"初始提示"(导入后点"Advanced…"按钮),模型生成文字时会参照它,减少错字。
三种用法:单文件、批量队列、实时录音
这一节把 Buzz 的三种任务类型分清楚,你对号入座选一种就行。
单文件转录
导入一个文件,选模型和语言,点 Run。适合把单条采访、讲座、播客变成文稿。它和"第一次转录"的区别只在一处:跑完发现准确率不满意,可以换一个更大的模型重新跑。
批量队列
按住 Ctrl 一次选中多个文件,它们全部进入任务列表,按顺序处理,单个任务可以暂停、恢复。适合一次导入整季播客或一门课的录音。再进一步可以配置"监控文件夹":新音频放进指定目录就自动开始转录,不用手动导入。
实时录音 🎙️
在实时录音区域选好麦克风、语言和模型,点 Record,句子会逐句出现在屏幕上,还可以打开演示窗口把字幕放大投屏。适合会议纪要、活动现场字幕。提醒一句:实时转录吃性能,模型选小了才跟得上语速。
字幕与导出 🎬:SRT、VTT、TXT 三种格式
这一节解决"文字稿怎么变成能用的视频字幕"。
- 双击打开转录结果,底部时间轴和文字同步,拖动或直接输入秒数,就能改每一段的起止时间。
- 点"Resize"重新切分字幕:单行最大长度建议40~50 个字符,开启"按标点拆分";想让字幕在屏幕上多留一会儿,可以把每段结束时间延长 0.2~0.5 秒。
- 导出格式三种:SRT 给剪辑软件,VTT 给网页播放器,TXT 要纯文字就用它。
- 转录前如果勾选了"词级时间戳",Resize 会依据每个词的时间点切分,合并和拆分都更准。
模型怎么选:Whisper 五档一张表
这一节帮你按电脑内存直接定档位,不用自己猜。
| 模型 | 速度 | 内存约需 | 适合场景 |
|---|---|---|---|
| tiny | 最快 | <1GB | 实时录音、快速草稿 |
| base | 快 | ~1GB | 日常使用,默认选择 |
| small | 中等 | ~2GB | 速度和准确率平衡 |
| medium | 慢 | ~5GB | 专业转录、有背景噪音的音频 |
| large | 最慢 | ~10GB | 追求最高准确率 |
结论:默认用base;内存有 16GB 可以直接上small;准确率不满意时先升到medium再考虑更大的。模型在"设置 - 模型设置"里按需下载、删除,空间紧张时选量化版本(如 q5),内存省掉近一半,准确率损失不大。
避坑指南 ⚠️:6 个高频问题
以下是最常见的 6 个问题,每条给出原因和解决办法。
- 语言检测识别错——自动检测靠开头几秒音频,开头是音乐或噪音就容易误判 → 手动指定语言,速度还更快。
- Windows 安装时提示"未验证发布者"——程序未签名导致的正常现象 → 点「更多信息 → 仍要运行」即可。
- 实时录音卡顿、句子出不来——默认转录链路比较吃资源 → 改用 Whisper.cpp 引擎,配 tiny 或 base 模型,关掉其他占资源的应用。
- 模型下载慢或失败——模型文件从几十 MB 到几 GB 不等 → 网络好的时候重试,也可以手动下载模型文件放进模型目录(用环境变量
BUZZ_MODEL_ROOT指定位置)。 - 专有名词老拼错——模型不知道说话人的背景 → 把常用名词写进"初始提示"。
- 字幕行太长不好读——默认分段偏粗 → 用 Resize 工具把最大长度设到 40~50 字符。
Buzz 适合三类人:常处理录音的办公和媒体从业者、需要字幕的视频创作者、不想把音频交给在线服务的用户。更多操作细节见仓库文档 文件导入 与 偏好设置。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考