☰
Buzz 离线语音转文字快速上手:5 分钟本地免费转出第一份字幕
2026/10/11 1:36:41 网站建设 项目流程

Buzz 离线语音转文字快速上手:5 分钟本地免费转出第一份字幕

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款完全跑在本地的离线语音转文字工具,基于 OpenAI 的 Whisper 模型,音频不上传、转录不收费。它面向做字幕的剪辑师、整理访谈的研究员、要现场字幕的活动组织者:装好软件,导入一段音频,点一次运行,文字稿就出来了。

它替你解决什么问题

会议录音、讲座、访谈想变成文字,在线工具多半要你先把文件传上服务器,隐私和按量计费都是坎。Buzz 把 Whisper 的推理整个搬进你自己的电脑:本地处理,断网照样跑,不花一分钱。

边界一次说清:它是个本地批处理加实时转录的桌面客户端,和云端 API 最大的区别,是音频从头到尾不离开电脑。

跑起来之前的准备

三个系统都有现成安装包,装完只差一步——挑个模型下下来。

Windows

到发布页下载官方安装包,双击安装。程序未签名,弹出警告点"更多信息"→"仍要运行"即可。

macOS

下载 .dmg 文件,拖进"应用程序"文件夹。注意新版只支持 Apple Silicon,Intel 机器最后可用版本是 1.4.5,老机型留意。

Linux

一条命令装 Flatpak 版:

flatpak install flathub io.github.chidiwilliams.Buzz

模型首次转录时自动下载并缓存,离线也能用;想提前备好,进"偏好设置 → 模型"统一管理(偏好设置说明)。

第一次完整走一遍

只读这一节也能跑通,跟着做:

  1. 打开 Buzz,点工具栏 + 号(或 File → Import Media File),选一段本地音频。
  2. 任务选 Transcribe;语言手动选"中文",比自动检测稳。
  3. 后端选 Whisper.cpp,模型选 base 或 small:省内存、CPU 也能跑,新手最省心。
  4. 点 Run。首次会先下模型,转完状态变成 Completed 即完成。
  5. 双击任务行进入转录查看器:边听边逐段改字和时间戳,能搜索、能调速。
  6. 点导出,选 TXT 或 SRT,文件直接落在音频旁边。

能力边界与可选项

边界摊开说,分三组看。

能喂进去什么

  • 本地音频:MP3、WAV、FLAC 等常见格式,丢进去就能转
  • 视频文件:自动抽出音轨再转录
  • YouTube 链接:粘贴地址,下载后转
  • 麦克风实时录音:边说边出字,能开演示窗口投到大屏

怎么转录

  • 后端五选一:Whisper 原版(准但吃内存)、Faster Whisper(N 卡 6GB 显存以上)、Whisper.cpp(C++ 实现,CPU 集显友好,Mac 推荐)、Hugging Face(可加载微调模型)、OpenAI API(云端备用)
  • 有 NVIDIA 显卡,在 Help → About Buzz 里补装 CUDA 加速
  • 嘈杂录音可开"提取语音"先分离;多人对话可开说话人识别

怎么收尾

  • 转录查看器:搜索、调速播放、逐段修字
  • 导出 TXT / SRT / VTT,文稿和字幕需求都覆盖
  • Resize:长句按标点拆开、过短的字幕行合并、显示时长可调
  • 文件夹监控:新文件丢进去自动转,不用人守
  • CLI 可写进脚本批量跑:
buzz add --txt interview.mp3

模型大小怎么选,一张表说清:

模型体积适合谁
tiny≈75 MB试流程、赶时间
base≈142 MB日常速记
small≈466 MB速度与准确度的平衡点
medium≈1.5 GB长内容、要求较高
large≈2.9 GB重要资料,最好有显卡

两个参数建议先调:语言手动指定;把人名、术语写进"初始提示",能明显减少误识别。

按场景对号入座

给播客做字幕的剪辑师

  • 你要的:两小时节目音频,变成能拖进剪辑软件的中文字幕。
  • 你做的:导入 MP3,语言选中文,导出选 SRT;跑完点 Resize,按标点拆行、设最大长度。
  • 你拿到的:时间码精确的 SRT 文件,导入软件直接上屏。

整理多人访谈的研究员

  • 你要的:长访谈的文字稿,每句话都标清是谁说的。
  • 你做的:转录前打开说话人识别;出来后在查看器逐段核对标注,导出 TXT。
  • 你拿到的:带时间戳、带说话人的文字稿,边听边改。

做现场实时字幕的组织者

  • 你要的:演讲内容即时变大屏字幕,最好还能同步进 OBS。
  • 你做的:选录音任务、接好麦克风,开演示窗口点录制;偏好里打开实时文本导出。
  • 你拿到的:能投屏的字幕画面,外加一份实时更新的 TXT,OBS 直接读文件。

踩坑与自救

转出来不准,先查哪里?

先怀疑语言设置,再怀疑模型。手动指定语言;还不行,把人名术语写进初始提示,或把模型升一档。

完全断网的机器能用吗?

能。模型就是几个文件:有网机器上下载好,进"偏好设置 → 模型"点"显示文件位置",把文件夹拷到离线机器相同路径。批量预缓存可用 scripts/download-models.py。

转得太慢、电脑发烫?

先换 Whisper.cpp 后端,比原版快且省内存;6GB 显存以上的 N 卡再试 Faster Whisper。实时转录用小模型,跟不上语速就别硬撑。

录音报错 PaErrorCode-9999、没声音?

多半是麦克风权限问题。去系统隐私设置确认允许 Buzz 使用麦克风,杀毒软件顺手排查一下。

你现在手里有什么

你现在有了不依赖网络、数据不出本地的语音转文字方案:导入音频、点一次运行,文本和字幕都能落地,实时转、批量转也都行。

更多细节看 CLI 用法——现在就去把第一段音频跑一遍。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询