Buzz 上手指南:本地离线语音转文字,从安装到批量转录
2026/9/6 16:31:38 网站建设 项目流程

Buzz 上手指南:本地离线语音转文字,从安装到批量转录

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

周五下午,桌面上躺着一段 40 分钟的会议录音,你需要一份带时间戳的文字稿,但这份音频不能离开本机。打开 Buzz,导入文件、选个模型、点运行,几分钟后 SRT 字幕文件就出现在音频旁边。

Buzz是一款桌面应用,把 OpenAI Whisper 模型装在你自己的电脑上做语音转文字和翻译:音频文件、视频文件、麦克风实时录音都在本地处理,结果可导出为 TXT、SRT、VTT 三种格式。它的核心场景是"音频不出机器"——没有稳定的网络、不想把敏感内容交给在线服务,或者只是觉得批量处理文件上传太麻烦,都适合用它。支持从 PyPI 安装的命令行方式,也提供 macOS、Windows、Linux 三种平台的安装包,模型侧覆盖 Whisper 多个后端和 tiny 到 large 五档尺寸。

装好 Buzz:按系统选一条路 📦

每个平台都给你最短路径,选一个即可,装完都能跑起同一个界面。

macOS:下载 dmg,拖进应用程序

从发行渠道(SourceForge 的 buzz-captions 项目)下载.dmg文件,打开后把图标拖到应用程序文件夹。Buzz 对 Apple Silicon 原生支持,M 系列芯片上可直接使用 GPU 加速。

Windows:运行安装包,绕过签名提示

从同一渠道下载安装程序并运行。应用未做数字签名,安装时系统会弹出警告,点"更多信息"再选"仍要运行"即可继续。

Linux:一行命令装 Flatpak

flatpak install flathub io.github.chidiwilliams.Buzz # 或者改用 Snap:sudo snap install buzz

从 PyPI 安装:适合想直接用命令行的人

确认系统是 Python 3.12 并已装好 ffmpeg,然后:

pip install buzz-captions python -m buzz

PyPI 版本在 Linux/Windows 上默认带 CUDA 构建的 torch,Nvidia 显卡开箱可用;Intel Mac 的依赖版本在 pyproject.toml 里单独锁定,照装即可。

第一次转录:把 MP3 变成文字稿

首次运行后,主界面是一张任务列表,顶部工具栏放着全部常用入口。导入文件有三种方式:File 菜单的 Import Media File、工具栏的+图标、快捷键Command/Ctrl + O,支持直接把文件拖进窗口。

导入文件后,Buzz 会在任务行里让你确认三项设置:

  • 任务:Transcribe(转成说话语言的文字)或 Translate to English(译成英文);
  • 语言:可以留空让它自动检测,但官方文档明确建议已知语言就手动指定,检测可能给出意外结果;
  • 模型:类型加尺寸,第一次选小模型跑通流程最稳妥。

点 Run,进度条走到 Completed 后,双击该行(或选中后点"⤢"图标)打开转录查看器。每个片段都有独立的时间戳,点时间戳会跳转到音频对应位置;顶部的搜索框和播放控制让长稿校对不必反复拖进度条。

用命令行批量转录并导出 SRT

不想逐条点界面时,Buzz 自带 CLI(docs/docs/cli.md 有完整选项说明)。buzz add一条命令可以同时处理多个文件,常用参数:-m选模型类型、-s选尺寸、-l指定语言、--srt/--vtt/--txt决定导出格式。

buzz add -m whispercpp -s small -l zh --srt --txt meeting-01.mp3 meeting-02.mp3

这条命令用 Whisper.cpp 的 small 模型把两个会议录音转成中文,并各生成一份 SRT 和 TXT。加--hide-gui可以隐藏主窗口,适合放进脚本无人值守跑。

选模型:速度、显存和准确率的取舍

模型设置藏在偏好设置(docs/docs/preferences.md)里,分两层:模型类型和模型尺寸。

类型决定用哪个后端跑:Whisper(原版)、Whisper.cpp、Faster Whisper、Hugging Face(可填任意 whisper 系模型 ID)、OpenAI API(走云端,仅作对照)。日常离线转录推荐 Whisper.cpp:支持 Vulkan 加速,多数独显和核显都能用,还允许填Custom下载社区量化模型(如 q5 版本)进一步省显存。

尺寸直接决定速度和效果的平衡点:

尺寸体量适合场景
tiny最小实时录音、低配置设备,先跑通流程
base日常快速转录
smallCLI 批量处理的常用档
medium对准确率要求高的正式转录
large最大关键内容,机器配置充足时再用

偏好里还有两个实用开关:Reduce GPU RAM 用 8bit 量化压缩模型换显存;环境变量BUZZ_WHISPERCPP_N_THREADS可指定 Whisper.cpp 的线程数,默认取一半 CPU 核心。

让新文件自动转录:文件夹监视

偏好设置里的 Folder Watch 让 Buzz 盯住一个目录,里面的新音频文件出现后自动按预设模型开始转录,不用人工导入。它和Skip Already Transcribed插件搭配最好用:插件会检查同名.txt/.srt/.vtt是否已存在或 Buzz 数据库里已有结果,有就标记 Skipped,避免重复跑模型。这套组合适合"每天把录音丢进一个文件夹"的工作流。

插件:把转录流水线接得更长

插件系统在Help → Plugins里管理,可开关、拖拽排序、逐个配置,还能通过 Add by URL 装社区插件(buzz/plugins/ 目录下有全部内置插件源码,写新插件时照着结构改即可)。内置的六个里最常用的:

  • Resize Transcript:把带词级时间戳的转录自动重组成适合字幕的片段,支持按静音间隙合并、按标点分割、限制单条最大长度;导出字幕前想调节奏时用它;
  • AI Summary:调 OpenAI 兼容接口(OpenAI 或本地 Ollama)给转录生成摘要,存进备注或存成文本文件;
  • DeepFilterNet:转录前先降噪,处理嘈杂录音效果好,去噪结果默认转完即删。

其余的 DOCX 导出、本地语言检测都是单步开关,用到再开。

速查表:模型、格式与常用参数 🎯

选项取值默认说明
任务-ttranscribe / translatetranscribe转录或翻译成英文
模型类型-mwhisper / whispercpp / fasterwhisper / huggingface / openaiapiwhisper离线推荐 whispercpp
模型尺寸-stiny / base / small / medium / largetiny仅 whisper 系三种类型可用
语言-len、zh、fr 等数十种空(自动检测)已知语言建议手动指定
导出格式--txt/--srt/--vttTXT可多格式同时输出
初始提示-p自由文本塞入专有名词可减少拼错
词级时间戳-w开 / 关开启后才能用重组字幕

收尾前的三条避坑提示

首次使用每个模型时 Buzz 会联网下载一次模型文件,之后完全离线运行;断网环境下先把模型下齐。实时录音对机器负载敏感,默认 Whisper 模型较重,直播场景建议切到 Whisper.cpp 配小模型,录音中留意队列长度,积压就调大转录步长。导出字幕若单条过长,勾选 Word-Level Timings 重新转录,再用 Resize 功能按标点重组,比手工剪切快得多。

下一步建议:先拿一段自己语言清晰、两三分钟的录音,依次试一遍 tiny 和 small,感受速度差异,再决定日常档位;完整文档见 docs/。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询