Buzz 离线语音转文字快速上手:5 分钟本地免费转出第一份字幕
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款完全跑在本地的离线语音转文字工具,基于 OpenAI 的 Whisper 模型,音频不上传、转录不收费。它面向做字幕的剪辑师、整理访谈的研究员、要现场字幕的活动组织者:装好软件,导入一段音频,点一次运行,文字稿就出来了。
它替你解决什么问题
会议录音、讲座、访谈想变成文字,在线工具多半要你先把文件传上服务器,隐私和按量计费都是坎。Buzz 把 Whisper 的推理整个搬进你自己的电脑:本地处理,断网照样跑,不花一分钱。
边界一次说清:它是个本地批处理加实时转录的桌面客户端,和云端 API 最大的区别,是音频从头到尾不离开电脑。
跑起来之前的准备
三个系统都有现成安装包,装完只差一步——挑个模型下下来。
Windows
到发布页下载官方安装包,双击安装。程序未签名,弹出警告点"更多信息"→"仍要运行"即可。
macOS
下载 .dmg 文件,拖进"应用程序"文件夹。注意新版只支持 Apple Silicon,Intel 机器最后可用版本是 1.4.5,老机型留意。
Linux
一条命令装 Flatpak 版:
flatpak install flathub io.github.chidiwilliams.Buzz模型首次转录时自动下载并缓存,离线也能用;想提前备好,进"偏好设置 → 模型"统一管理(偏好设置说明)。
第一次完整走一遍
只读这一节也能跑通,跟着做:
- 打开 Buzz,点工具栏 + 号(或 File → Import Media File),选一段本地音频。
- 任务选 Transcribe;语言手动选"中文",比自动检测稳。
- 后端选 Whisper.cpp,模型选 base 或 small:省内存、CPU 也能跑,新手最省心。
- 点 Run。首次会先下模型,转完状态变成 Completed 即完成。
- 双击任务行进入转录查看器:边听边逐段改字和时间戳,能搜索、能调速。
- 点导出,选 TXT 或 SRT,文件直接落在音频旁边。
能力边界与可选项
边界摊开说,分三组看。
能喂进去什么
- 本地音频:MP3、WAV、FLAC 等常见格式,丢进去就能转
- 视频文件:自动抽出音轨再转录
- YouTube 链接:粘贴地址,下载后转
- 麦克风实时录音:边说边出字,能开演示窗口投到大屏
怎么转录
- 后端五选一:Whisper 原版(准但吃内存)、Faster Whisper(N 卡 6GB 显存以上)、Whisper.cpp(C++ 实现,CPU 集显友好,Mac 推荐)、Hugging Face(可加载微调模型)、OpenAI API(云端备用)
- 有 NVIDIA 显卡,在 Help → About Buzz 里补装 CUDA 加速
- 嘈杂录音可开"提取语音"先分离;多人对话可开说话人识别
怎么收尾
- 转录查看器:搜索、调速播放、逐段修字
- 导出 TXT / SRT / VTT,文稿和字幕需求都覆盖
- Resize:长句按标点拆开、过短的字幕行合并、显示时长可调
- 文件夹监控:新文件丢进去自动转,不用人守
- CLI 可写进脚本批量跑:
buzz add --txt interview.mp3模型大小怎么选,一张表说清:
| 模型 | 体积 | 适合谁 |
|---|---|---|
| tiny | ≈75 MB | 试流程、赶时间 |
| base | ≈142 MB | 日常速记 |
| small | ≈466 MB | 速度与准确度的平衡点 |
| medium | ≈1.5 GB | 长内容、要求较高 |
| large | ≈2.9 GB | 重要资料,最好有显卡 |
两个参数建议先调:语言手动指定;把人名、术语写进"初始提示",能明显减少误识别。
按场景对号入座
给播客做字幕的剪辑师
- 你要的:两小时节目音频,变成能拖进剪辑软件的中文字幕。
- 你做的:导入 MP3,语言选中文,导出选 SRT;跑完点 Resize,按标点拆行、设最大长度。
- 你拿到的:时间码精确的 SRT 文件,导入软件直接上屏。
整理多人访谈的研究员
- 你要的:长访谈的文字稿,每句话都标清是谁说的。
- 你做的:转录前打开说话人识别;出来后在查看器逐段核对标注,导出 TXT。
- 你拿到的:带时间戳、带说话人的文字稿,边听边改。
做现场实时字幕的组织者
- 你要的:演讲内容即时变大屏字幕,最好还能同步进 OBS。
- 你做的:选录音任务、接好麦克风,开演示窗口点录制;偏好里打开实时文本导出。
- 你拿到的:能投屏的字幕画面,外加一份实时更新的 TXT,OBS 直接读文件。
踩坑与自救
转出来不准,先查哪里?
先怀疑语言设置,再怀疑模型。手动指定语言;还不行,把人名术语写进初始提示,或把模型升一档。
完全断网的机器能用吗?
能。模型就是几个文件:有网机器上下载好,进"偏好设置 → 模型"点"显示文件位置",把文件夹拷到离线机器相同路径。批量预缓存可用 scripts/download-models.py。
转得太慢、电脑发烫?
先换 Whisper.cpp 后端,比原版快且省内存;6GB 显存以上的 N 卡再试 Faster Whisper。实时转录用小模型,跟不上语速就别硬撑。
录音报错 PaErrorCode-9999、没声音?
多半是麦克风权限问题。去系统隐私设置确认允许 Buzz 使用麦克风,杀毒软件顺手排查一下。
你现在手里有什么
你现在有了不依赖网络、数据不出本地的语音转文字方案:导入音频、点一次运行,文本和字幕都能落地,实时转、批量转也都行。
更多细节看 CLI 用法——现在就去把第一段音频跑一遍。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考