Buzz 音频转录完整指南:本地部署 Whisper,一条命令开始语音转文字
2026/9/7 2:24:54 网站建设 项目流程

Buzz 音频转录完整指南:本地部署 Whisper,一条命令开始语音转文字

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款基于 OpenAI Whisper 的本地语音转文字工具:它把模型直接装在你电脑上,音频文件、麦克风录音和网页链接都能在离线状态下转录成带时间戳的文字,还支持翻译成英文。数据不出本机、不收 API 账单、不限调用次数,这是它最值得上手的地方。整个处理链路很简单:音频输入 → 预处理 → Whisper 推理 → 后处理 → 导出,你不需要理解细节,只需要会点按钮。

为什么音频转录要搬到本地

结论先说:怕录音内容泄露、常断网、或不想被 API 额度卡住的人,本地部署是更稳的选择。把两种方案放在一起看,差异很清楚:

维度云端 API 转录Buzz 本地部署
隐私音频上传到第三方服务器文件始终留在本机
网络必须联网,弱网即失败模型下载一次后即可完全离线使用
用量限制按分钟计费或有调用配额无限制,转多久都行
速度受网络波动影响取决于本地硬件,可复现

Buzz 支持 99 种语言的转录,也支持把任意语言翻译成英文;模型自动下载并缓存在本地(各平台的缓存位置可在 docs/docs/faq.md 查到),断网环境照样能跑。

四大平台安装速查

安装本身一条命令就够,唯一的公共前置是装好 ffmpeg——Buzz 靠它解码音频。

  • Windows
winget install ChidiWilliams.Buzz
  • macOS
brew install --cask buzz
  • Linux(Flatpak 或 Snap)
flatpak install flathub io.github.chidiwilliams.Buzz sudo snap install buzz
  • 源码 / PyPI 安装:先装好 ffmpeg(Ubuntu 用sudo apt install ffmpeg),再执行:
pip install buzz-captions python -m buzz

Nvidia 显卡用户装好 CUDA 版的 PyTorch 即可获得 GPU 加速,具体步骤参考 docs/docs/faq.md 的 GPU 部分。

第一条转录跑起来

四步就能看到结果,建议第一次就用 tiny 模型,出结果最快:

  1. 打开 Buzz,点击"导入文件"(快捷键Ctrl+O),选一个音频或视频文件。
  2. 在转录选项里确认模型为 tiny、语言选"自动检测"。
  3. 点击"开始转录",首次运行会自动下载模型,耐心等待一次。
  4. 任务完成后双击列表中的转录记录,即可查看带时间戳的全文。

上图就是 Buzz 的文件转录界面:左侧导入文件,右侧是转录任务列表,所有后续操作都从这里出发。

文件、录音、URL 三种入口怎么选

三种入口覆盖几乎所有场景,按素材来源对号入座即可。

转录本地文件

适合已有的录音、播客、会议录像等成品文件。

  1. Ctrl+O导入一个或多个文件,支持批量;
  2. 设置语言、任务类型(转录或翻译成英文)和模型;
  3. 开始转录,输出 TXT/SRT/VTT 保存在源文件同目录。

录音实时转录

适合会议、讲座、采访等正在发生的内容。

  1. 点击顶部麦克风按钮进入录音界面,选择输入设备;
  2. 点红色录制按钮开始,过程中可随时暂停跳过无关片段;
  3. 停止后自动保存录音音频和转录文本。

导入 URL

适合 YouTube 等可直接下载链接的内容,免去手动下载视频。

  1. 工具栏选择"导入 URL",粘贴链接;
  2. Buzz 下载媒体文件后按任务队列正常排队处理;
  3. 后续操作与本地文件完全一致。

Buzz 模型怎么选:准确率与速度的权衡

选型的唯一权衡就是速度换精度:小模型跑得快但错得多,大模型准但吃内存、跑得慢。

模型速度精度内存需求适合谁
tiny最快基础<1 GB快速预览、低配电脑
base良好~1 GB日常速记
small中等优秀~2 GB多数人的默认选择
medium较慢非常好~5 GB专业内容
large最慢最佳~10 GB关键内容、嘈杂音频

除了尺寸,还有三个参数直接决定准确率:

  • 温度:默认是一组递增的后备值。清晰人声用低温度更稳;环境吵、口音重时适当调高,给模型更多重试机会。
  • 初始提示:转录专业内容时,把术语表写进初始提示(如"本次涉及心电图、心肌梗死等术语"),模型会优先识别这些词。
  • 手动指定语言:混合语言内容建议直接指定主语言,比自动检测更可靠。

这些参数都在首选项 → 模型页维护(模型文件由 buzz/model_loader.py 统一下载和缓存)。另外 Whisper.cpp 引擎在纯 CPU 和 Mac 上表现最好,有 6 GB 以上显存的 Nvidia 显卡则建议用 faster-whisper。

从草稿到成品

Buzz 的转录查看器支持搜索、播放控制,并允许精修到单词级时间戳:

  • 拖拽片段边缘或直接改时间值,修正不准确的起止点;
  • 双击文本直接编辑,改错字、补标点;
  • 合并或拆分片段,让段落更自然;
  • 通过导出菜单输出 TXT、SRT、VTT 三种格式,文件名模板可在首选项里自定义。

转录完的长视频,可以用分段调整功能把一条大段落切细,字幕就不会"挤成一坨":

Buzz 批量转录:文件夹监控与命令行

处理一整批文件时,别再手动点。打开 帮助 → 首选项 → 文件转录:

  1. 勾选"启用文件夹监控";
  2. 选好输入文件夹和输出文件夹,按需勾选"删除已处理文件";
  3. 在同一页面配置好默认模型、语言等转录选项,之后丢进输入目录的新文件会被自动处理。

监控逻辑实现在 buzz/widgets/transcription_task_folder_watcher.py。更喜欢脚本化的人直接用 CLI(完整参数见 docs/docs/cli.md):

# 转录单条文件并直接导出 SRT buzz add --model-type whispercpp --model-size small --srt ./meeting.mp3 # 批量转录多个文件 buzz add --model-size medium --language zh ./a.mp3 ./b.mp3

排错速查:现象、原因与动作

🔧 遇到问题先对照这张表,能解决大部分常见状况:

现象可能原因你的动作
转录速度太慢模型太大或纯 CPU 运行换 tiny/base 模型;Nvidia 显卡装 faster-whisper,其他机器换 Whisper.cpp
内存占用大large/medium 模型吃显存降一档模型;减少同时入队的任务数
识别错误多模型小、音频吵或领域词陌生换更大模型;写入术语初始提示;先降噪
某格式导入失败未装 ffmpeg 或版本过旧安装最新版 ffmpeg 后重试
启动或转录时崩溃模型文件下载不完整首选项 → 模型中删除后重新下载;还不行就看 帮助 → 关于 Buzz → 显示日志
提示 CPU 不支持老机器没有 AVX2 指令集硬件限制,需更换支持 AVX2 的电脑

更多细节(离线环境搬运模型、系统录音等)见 docs/docs/faq.md。

写在最后

Buzz 把 Whisper 本地部署做成了普通用户也能上手的程度:一条命令装好,四个步骤转出第一条文字,之后靠模型、温度、初始提示三个旋钮调质量,最后用文件夹监控和 CLI 把重复劳动交给机器。会议录音、课程录像、访谈整理,这些场景里它都能离线顶用。项目仍在持续迭代,多说话人分离等能力也在路上;如果你愿意修 bug 或加功能,可以从 CONTRIBUTING.md 开始。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询