Buzz 离线音频转录实战:如何把本地录音免费转成文字稿和 SRT 字幕
2026/9/7 7:51:04 网站建设 项目流程

Buzz 离线音频转录实战:如何把本地录音免费转成文字稿和 SRT 字幕

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

会议录音、课堂音频、采访素材都存在一个共同的麻烦:文件躺在本地,却往往因为内容敏感、不便上传,或者单纯不想为在线服务付费,而迟迟没法变成可检索的文字。Buzz 是一款跑在你自己电脑上的本地音频转录工具,基于 OpenAI 的 Whisper 模型,把语音识别和字幕生成这件事放在离线环境里完成——不依赖云端,也不产生按分钟计费的账单。

它是一款什么工具,适合谁用

Buzz 的核心工作方式很简单:读取你指定的音频或视频文件(也支持麦克风实时输入),用本地的 Whisper 模型推理出文本,再按段落切分并带上时间戳,最后导出成 TXT、SRT 或 VTT 文件。它不上传音频,处理过程全部在本地完成,支持 Windows、macOS 和 Linux,并可在 NVIDIA 显卡上启用 CUDA、在 Apple Silicon 上做优化,也能通过 Whisper.cpp 后端借助 Vulkan 使用各类 GPU 甚至核显。

它的定位是"单人本地的批处理工具",而不是一个多用户协作平台。需要说清楚两处边界:第一,除 OpenAI API 这一后端外它是纯离线的,而一旦选用该后端就需要联网和密钥;第二,模型越大、音频越长,处理时间越长,它不会"即时"返回,更适合"丢进去、等结果、批量跑"的节奏。

安装与首次运行

三个平台的安装路径各有不同,按自己系统选最快的一条:

  • macOS:从 SourceForge 下载.dmg,拖入应用程序目录即可。
  • Windows:从 SourceForge 下载安装包。由于程序未做签名,安装时系统会弹出警告,点"更多信息"再选"仍要运行"。
  • Linux:以 Flatpak 或 Snap 形式提供,一条命令即可装好,例如flatpak install flathub io.github.chidiwilliams.Buzz
  • 通过 Python 安装:需要先装好 ffmpeg,再用 Python 3.12 环境执行pip install buzz-captions,之后以python -m buzz启动。若想让 PyPI 版本用上 NVIDIA 显卡,还需额外安装带 CUDA 的 PyTorch 与对应 CUDA 运行库。

首次启动时它会提示你选择默认后端、模型与语言。界面是一个任务表:每行代表一个待处理文件或录音任务,右侧可以单独设置参数,底部有全局设置入口。把文件拖进窗口或点"+"即可开始。官方把完整文档放在仓库的 docs/ 目录,按"导入文件、实时录音、翻译、编辑与字幕调整"分节,适合逐项对照。

把一段录音转成带时间戳的文字稿

这是最基础的任务。操作流程:

  1. 用"+"按钮、拖拽,或快捷键(Windows/Linux 是 Ctrl+O,macOS 是 Cmd+O)导入一个音频或视频文件。Buzz 支持 MP3、WAV、FLAC 以及 MP4、AVI 等容器,因为底层走 ffmpeg 解码,绝大多数能播放的音视频都能处理。
  2. 在任务行里确认"任务类型"选的是转录(transcribe),语言留空则自动检测,或手动指定。
  3. 选择模型档位(见下文参数表),点"运行"。

结果是一个带时间戳的分段文字稿,可在转录查看器里逐段播放、搜索和调整速度。导出时勾选 TXT,就是一份可复制进笔记或 Word 的纯文本。

给视频生成 SRT / VTT 字幕

给视频配字幕和"转个文字"差别不大,只是导出格式不同:

  1. 同样导入视频文件,任务类型保持"转录"。
  2. 运行后,在导出处勾选SRTVTT。SRT 更适合大多数剪辑软件和平台上传;VTT 则面向网页播放器。
  3. 如果单行字幕太长、太短或换行频繁,用"字幕调整(resize)"功能重排:设置目标行数和最大字符长度,程序按标点和语义边界重新切段,生成符合平台规范的字幕文件。

翻译需求走的是另一条路:任务类型选翻译(translate),它会把源语言音频直接转成英文文本,适合"法语音频转成英文稿"这类跨语言场景。

实时录音转写与演讲场景

Buzz 也能直接读麦克风输入,把语音即时转成文字,并配有一个独立的"演示窗口",专门在报告、直播、访谈时把实时文字投到第二块屏幕上。适用场景包括:线上会议边开边出纪要、讲座同步出笔记、直播加实时字幕、访谈边录边出稿。

操作路径是打开实时录音界面、选择麦克风与语言后开始;若对噪声敏感,可开启"提取语音"选项,它会先做一次语音分离再识别,能明显降低背景杂音对结果的干扰。

批量处理与文件夹监控

需要一次性跑很多文件时,Buzz 有两层自动化:

  • 多任务队列:一次导入多个文件,它们在任务列表里排队逐个处理,进度互不阻塞。
  • 文件夹监控(watch folder):在偏好里指定一个目录后,任何新音频丢进去就会被自动转录,适合定期更新的播客、批量上传的课程录音这类持续产出的工作流。仓库中对应的监控逻辑在 buzz/widgets/transcription_task_folder_watcher.py。

结合"先小模型快速过一遍、重要文件再换大模型重跑"的策略,可以兼顾预览速度和最终精度。

关键参数怎么选

下表是日常最常用的几个参数,按"它管什么 → 怎么选"给出建议。

参数作用选择建议
任务类型转录(保留原语言)或翻译(转成英文)只要原语言文字稿选转录;要跨语言转英文选翻译
模型后端决定推理引擎:Whisper、Whisper.cpp、Faster Whisper、Hugging Face、OpenAI API本地跑优先 Whisper.cpp 或 Faster Whisper;有独显且要最高精度可用 Whisper + CUDA
模型档位tiny / base / small / medium / large 系列,越大越准也越慢实时或预览用 tiny/base;日常用 small/medium;重要内容用 large-v3 或 large-v3-turbo
语言留空为自动检测,或手动指定已知语言时手动指定,识别更稳
输出格式TXT / SRT / VTT 可多选纯文本用 TXT;剪辑、平台上传用 SRT;网页播放用 VTT
初始提示词把术语、人名、地名喂给模型含专业词汇的音频填入关键词,能提升这些词的命中率
提取语音转录前先做语音分离噪声大、多人嘈杂时开启
词级时间戳生成 word 级对齐需要逐词定位时开启

模型档位命名里带.en的是仅针对英文的变体(如tiny.enbase.en),在纯英文素材上通常更准;支持 101 种语言的识别,翻译统一输出为英文。

进阶:插件、脚本与命令行

Buzz 的插件系统把一些高频需求做成可开关的模块,代码在 buzz/plugins/,包括:AI 摘要生成、字幕自动调整(transcript resizer)、跳过已转录文件、增强语言检测、导出 DOCX、以及噪声下的语音分离(deep filter net)。在插件对话框里启用或禁用即可,不用改任何代码。

命令行面向脚本和自动化,核心是add子命令,把文件(或 URL)交给 Buzz 并在完成后退出。典型用法:

# 转录单文件,输出 SRT 与 TXT buzz add -l zh -s small --srt --txt audio.mp3

常用选项:-t指定任务(transcribe/translate),-m指定后端,-s指定档位,-l指定语言,-p填初始提示词,-w开词级时间戳,-e开语音分离,-d指定输出目录。翻译场景则是把-t translate加上去。加--hide-gui可以隐藏主窗口,方便嵌进定时任务。

常见问题

Buzz 需要联网吗?不需要。选用本地后端(Whisper / Whisper.cpp / Faster Whisper / Hugging Face)时全程离线,只有 OpenAI API 后端才需要网络和密钥。

支持哪些语言?共 101 种语言的识别;翻译功能统一把音频转成英文文本。

处理速度受什么影响?主要由音频时长、模型档位、后端和硬件共同决定。小模型 + GPU 后端时通常能接近甚至快于实时;大模型 + 纯 CPU 则会明显变慢,长音频建议用大模型前先跑一遍小模型确认结果。

能处理多长的音频?没有硬性时长限制,从几秒到几小时都可以;长文件用队列或文件夹监控跑更省心。

结果不准怎么调?依次尝试:手动指定正确语言、换更大的模型档位、给专业术语填初始提示词、噪声场景开启语音分离。

输出格式怎么选?TXT 用于阅读和复制,SRT 用于剪辑与平台上传,VTT 用于网页播放器,可一次多选。

小结

Buzz 把 Whisper 的语音识别能力装进一个本地、离线、可批处理的应用里:导入文件即转、支持实时录音与演讲窗口、能输出 TXT/SRT/VTT,并通过模型档位、后端选择、插件和命令行覆盖从个人到自动化的不同需求。它的代价是"等结果"而非"即时",模型越大越慢——理解这一点,就能把它安排进正确的工作流。

下一步可以直接做三件事:装一个对应平台的版本,丢一段本地录音选 small 档跑一遍 SRT,再打开偏好里的文件夹监控,把"手动导入"升级成"自动转录"。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询