Buzz 本地离线语音转文字:给会议录音和播客自动出字幕
2026/9/7 23:43:45 网站建设 项目流程

Buzz 本地离线语音转文字:给会议录音和播客自动出字幕

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款完全在本地运行的离线语音转文字工具,基于 OpenAI 的 Whisper 模型,音频不上传、不联网也能转写,把会议录音、播客、访谈变成可搜索、可编辑的文字和字幕。

📋 能力速览:Buzz 能替你做什么

能力一句话场景
文件转录导入 MP3、WAV、MP4 等媒体,转录成带时间戳的文字
实时录音麦克风进、字幕出,说话的同时逐行生成文字
翻译任意语言一键出英文稿,或接 LLM 翻到指定语言
批量 CLIbuzz add一次处理一文件夹,适合挂机跑批
多格式导出TXT、SRT、VTT,DOCX 由导出插件提供

把它想象成一台搬回家的录音厨房:食材(音频)从进门到出锅都不离开你的房子。数据不出你的电脑,没有上传环节,也就没有泄露、排队和按分钟计费的焦虑。

🍳 5 分钟跑通第一条转录

三个平台都有一行命令的安装方式:

系统途径命令
Windowswingetwinget install ChidiWilliams.Buzz
macOSHomebrewbrew install --cask buzz
LinuxFlatpak / Snapflatpak install flathub io.github.chidiwilliams.Buzzsudo snap install buzz

⚠️ 注意:Windows 安装包未做代码签名,首次安装时系统会弹出安全警告。点"更多信息"再"仍要运行"即可,项目开源,源码可查。

想体验未发布的改动,也可以克隆仓库按 README 装依赖:git clone https://gitcode.com/GitHub_Trending/buz/buzz

装好后打开软件,主界面是一张任务队列。按Ctrl+O(或点工具栏的"+")导入一段会议 MP3,弹出的表单里只有三个选项值得看:Task 默认就是 Transcribe(同语言转录);Language 如果你知道是中文,直接选zh,别指望自动检测;Model 先选base,够用。点 Run,任务进队列,进度条走完,状态变成 Completed。双击这一行,你落在转录查看器里,带时间戳的文字一段段排在眼前——第一份转录稿诞生了。

接下来是校对。在时间戳表格里双击文本单元格就能直接改,改动自动保存;Ctrl+P播放/暂停对应位置的音频,Ctrl+←/→微调片段起点、Ctrl+Shift+←/→调终点,边听边修。

🎬 三个真实工作流

会议现场出稿

切到 Live Recording 标签页,选好麦克风、语言和模型,点红色 Record 按钮,话音未落文字已经一行行排出来。实时转录对硬件胃口不小,务必选 Whisper.cpp 后端配tinybase,否则文字追不上语速。

录制模式有两种:默认 Append below 只往末尾追加;在偏好设置里改成 Append and correct,它会回头重查刚生成的句子、边说边修正,代价是更吃硬件。

录的同时可以打开演示窗口(Live Transcript Presentation),把实时字幕投到外接屏——演讲同传、远程会议看稿都靠它。偏好设置里还能把实时转录导出到文本文件,OBS 就能把它当直播字幕源读。

把播客剪成可上传的字幕

视频同样是普通食材:MP4、MOV、MKV 直接导入,Buzz 用内置的 FFmpeg 解码。要做字幕,转录前有个开关别漏——词级时间戳(word-level timestamps)。没勾它,查看器里那把断句刀就使不出来。

转录完成后,点查看器工具栏的 Resize,设一个字幕行最大长度,按标点分割、按静音间隙合并,一句被拦腰砍断的长台词会重新归位。然后从导出菜单选 SRT 或 VTT,直接拖进剪辑软件;留档用 TXT;要 Word 文档则启用导出插件拿 DOCX。

想转的是播客、在线课程这类"系统声音"?装个虚拟声卡把声音改道给 Buzz 即可:Windows 装 VB-CABLE,把系统输出设到 CABLE Input,Buzz 里麦克风选 CABLE Output;macOS 用brew install blackhole-2ch,在"音频 MIDI 设置"里把扬声器和 BlackHole 组进多输出设备;Linux 用pavucontrol在录制标签里把指定应用的音频重定向过去。电脑上能出声的内容,从此都能变成可搜索的文字。

批量与自动化:让电脑夜里干活

文件一多,GUI 逐个点就慢了。buzz add支持一次吃进多个文件:

buzz add --task transcribe --model-type whispercpp --model-size small --language zh --prompt "访谈录音,人名:张伟、李娜" --srt --vtt 访谈.mp3 会议录音.wav

--prompt是初始提示词,把常错的专有名词写进去,错字会明显减少;--output-directory指定产出位置,--hide-gui可以静默运行。把它挂进系统的定时任务(任务计划程序或 cron),睡前丢一个文件夹进去,早上收字幕。

翻译也在这条流水线上。任务类型选 Translate to English,任何语言直接给你英文稿,这是 Whisper 自带能力,离线可用。想翻到别的语言(比如英译西),在偏好设置里填一个 OpenAI 兼容的 API 地址和密钥,本地用 Ollama 或 LM Studio 跑模型也完全接得上;再到查看器点 Translate,给 AI 一句指令,例如"只翻译,不添加解释",就是一条全离线翻译管线。

🧰 模型怎么选、速度怎么调

模型适用场景
tiny/base低配机器、实时录音、先出个大意
small日常文件转录,速度与精度的平衡点
medium/large术语密集、口音复杂的录音,建议配 GPU
large-v3-turbo质量接近 large,速度更快,GPU 友好

模型管理在偏好设置的 Models 标签页:左边已下载、右边待下载,勾选后点 Download,也支持粘贴自定义模型的下载地址。想省内存,选 Whisper.cpp 后端并挑量化版本(如q_5),用一点点精度换显存和速度。

遇到卡顿,问自己三个问题:

  • 有 NVIDIA 显卡吗?有就在设置里启用 CUDA,large 的转录能从小时级压到分钟级;
  • 确认 GPU 没生效吗?设BUZZ_FORCE_CPU=true强制纯 CPU 跑一遍,对比速度就能定位;
  • 内存紧张吗?退回 Whisper.cpp 量化模型,或换小一号的模型。

❓ 踩过的坑,一次说清

中文没指定语言,转录质量差?自动检测偶尔会判断失误,中文音频手动选zh最稳。

实时转录总跟不上语速?默认模型太大。切 Whisper.cpp 后端加tinybase,立刻跟手。

Resize 重组功能为什么用不了?转录时没勾词级时间戳。勾选后重新转一次即可。

明明有显卡,为什么还是 CPU 在跑?先确认驱动装好、设置里 CUDA 已启用;也可以BUZZ_FORCE_CPU=true强制 CPU 排除变量。

国内网络下模型下载慢?设置环境变量HF_ENDPOINT=https://hf-mirror.com走镜像,速度立竿见影。

下一步

今晚挑一段十分钟的录音,从导入跑到导出 SRT。跑得顺就去项目仓库点个 Star,卡住了就把现象丢给社区。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询