Buzz 离线语音转文字完整指南:四步跑通你的第一个转写任务
2026/9/6 18:44:01 网站建设 项目流程

Buzz 离线语音转文字完整指南:四步跑通你的第一个转写任务

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

如果你手头有一段两小时的访谈录音,或者想把网课视频变成文字稿,你可能正需要一种在本机就能完成音频转文字的解决方案。Buzz 就是这样一个开源工具:它运行在你自己的电脑上,基于 OpenAI 的 Whisper 语音识别模型(一个专门把声音变成文字的 AI 模型)完成离线语音转文字和翻译,音频文件从头到尾不用离开你的设备。它支持 Windows、macOS 和 Linux,可以输出 TXT、SRT、VTT 等格式,也支持麦克风实时转写。这篇文章带你从安装一路走到批量自动化。

先解决"为什么用本地"的问题

把录音上传到云端转录服务虽然省事,但有几点绕不开:文件要经过别人的服务器;敏感内容(客户采访、医疗访谈、公司内部会议)一旦上传就不可控;部分长音频还涉及按量计费。

Buzz 的思路相反:

  • 转写模型下载后存在本地,识别过程不联网,隐私由你自己把关
  • 免费开源,MIT 协议,个人和团队使用都不花钱
  • 同一套操作逻辑覆盖文件转写、麦克风实时转写两种用法

安装:按你的系统选一条路

  • macOS:下载 dmg 安装包双击安装即可,Intel 和 Apple Silicon 芯片都支持
  • Windows:运行安装程序。首次安装会弹出安全提示,因为应用没有数字签名,点"更多信息 → 仍要运行"即可
  • Linux:通过 Flatpak 或 Snap 商店安装,例如 Flatpak 一行命令就能装好

安装完成先别急着用。首次使用时 Buzz 会让你下载转写模型,模型默认存在用户缓存目录(设置里"模型"页面有"显示文件位置"按钮,可以直达那个文件夹)。

四步完成第一次文件转写

  1. 点工具栏的"+"按钮(或按 Ctrl+O),选择音频或视频文件,MP3、WAV、M4A、MP4 都行
  2. 在任务栏选择任务(转写,或翻译成英语)和语言。强烈建议手动指定语言——自动检测只靠开头几秒音频判断,混合口音时容易猜错
  3. 选择模型后点Run。第一次运行某个模型前会先下载,之后就是本地计算
  4. 状态变为 Completed 后,双击这一行打开转写查看器,双击任意一句可以回到原音对应位置试听

官方对导入流程的详细字段说明在 docs/docs/usage/1_file_import.md,里面的"Initial prompt"(初始提示词)可以填人名、专业术语,能明显减少这类词的拼写错误。

三个值得了解的核心能力

转写查看器:搜索、试听、识别说话人

转写完成后的查看器不只是"看一段文字":

  • 支持关键词搜索,长访谈里找某个说法直接定位
  • 有播放控制和倍速调节,校对时可以 2 倍速快速过
  • 支持说话人识别(speaker identification),自动把同一段转写按"谁说的"分段,多人对话整理起来快很多

麦克风实时转写

选好转写任务、语言和麦克风,点 Record,句子就会随说随出。它适合三类场合:会议记录、演讲现场、给课程做实时字幕。录音开始后会出现Presentation window(演示窗口)选项,可以把实时文字投到大屏幕上。官方文档特别提示:实时转写对算力要求高,建议用 Whisper.cpp 模型并选小尺寸档位。

边转写边翻译

任务选"Translate to English"后,外语音频直接产出英文文本。如果你主要处理中文内容,也可以把中文音频转成英文文本,方便后续处理。

模型怎么选:一张表对号入座

先说结论:模型大小决定"准还是快",实现类型决定"在你什么硬件上跑得动"。

📌模型尺寸(Whisper 系列,从最小到最大):

尺寸特点适合
tiny最轻量、最快先跑通流程、低配设备
base小而均衡日常转写
small准确率明显提升有大量专有名词的音频
medium更准,速度慢不少不赶时间、追求质量
large最准,需求最高专业场景,配合显卡

官方 FAQ 里的经验之谈是:没有万能答案,建议在自己的语言上各试一遍。Large-V2 稳定,Large-V3 更准但偶尔会"无中生有"编造词,Turbo 则在速度和准确率之间取平衡。

📌实现类型(同一套模型的几种"运行方式"):

类型硬件情况说明
Whisper.cpp无独显、集显、MacC++ 优化实现,CPU 也能跑,苹果电脑首选
Faster WhisperN 卡且显存 ≥6GB比原版快很多,显存占用更低
Whisper(原版)大内存机器OpenAI 原始实现,稳但慢
Hugging Face各类设备支持上千种语言的 MMS 等定制模型
OpenAI API本地硬件不够时走云端,需要密钥,不再纯离线

下载和删除模型都在"帮助 → 偏好设置 → 模型"里完成。不用的模型删掉能省几十 GB 磁盘。

三个高频场景的推荐设置

🎬 场景一:访谈/播客做成字幕文件

推荐设置:

  • 模型:Whisper.cpp + small 或 medium
  • 勾选"Word-Level Timings"(逐词时间戳),让每个词都带时间点
  • 导出格式选 SRT

操作步骤:导入音频 → 勾选逐词时间戳 → 运行 → 完成后用内置的字幕调整功能(或 Resize Transcript 插件)把逐词结果合并成"一行一句、长度合适"的正式字幕行 → 导出 .srt,可直接拖进视频剪辑软件。

🎙️ 场景二:会议实时记录

推荐设置:

  • Whisper.cpp + tiny/base(实时性优先,准确率靠后续校对)
  • 语言明确指定,别用自动检测
  • 开启实时文本导出:生成的文字会边转边写进一个 txt 文件,方便接 OBS 等推流软件

操作步骤:选麦克风和语言 → 点 Record → 会议结束即停。需要投屏演示就打开演示窗口。

📁 场景三:文件夹自动批量转写

在偏好设置里启用文件夹监控(watch folder),指定一个路径后,往里丢的新文件会自动进入转写队列——出差路上把文件丢进网盘同步目录,回家时文稿已经转好了。

配合 Skip Already Transcribed 插件使用:它先检查同名结果文件是否已存在,已转过的直接标记 Skipped,重复导入一个文件夹时不会白烧算力。

进阶玩法:命令行与插件

Buzz 自带完整的 CLI(命令行界面,指在终端里用命令而不是鼠标操作应用的方式),适合写脚本做批量任务。最常用的"加一个转写任务并导出字幕"一条命令就够:

buzz add --model-type whispercpp --model-size small --language zh --srt --vtt 访谈录音.mp3

加上--hide-gui可以让主窗口隐藏,纯后台跑。完整参数列表见 docs/docs/cli.md。

从 1.4.5 版本开始,Buzz 有插件系统,内置插件包括:

  • AI Summary:调用 OpenAI 兼容接口(也可以是本机 Ollama)给长转写生成摘要
  • DeepFilterNet:转写前自动降噪,嘈杂录音的识别率会明显改善
  • Export to DOCX:把转写结果导出成 Word 文档
  • Enhanced Language Detection:先用本地小模型判断语言再转写,适合语言未知的文件

管理入口在"帮助 → 插件",可以开关、排序、改配置。想看插件怎么写,直接读 buzz/plugins/ 目录下的源码,内置插件就是现成模板。

常见疑问:现象 → 原因 → 解决

1. Windows 安装时弹"未知发布者"警告原因:安装包没有数字签名。解决:点"更多信息 → 仍要运行",属于正常现象。

2. 转写特别慢原因:模型档位太高,或没走 GPU。解决:换 Whisper.cpp 实现 + 小一档模型;N 卡用户可改用 Faster Whisper;具体排查思路见 docs/docs/faq.md。

3. 点运行后 Buzz 闪退原因:模型文件下载不完整或损坏(很常见)。解决:在"偏好设置 → 模型"里删掉该模型重新下载。另注意 Buzz 要求 CPU 支持 AVX2 指令集,非常老的电脑无法运行。

4. 录音报错,提示麦克风访问失败原因:系统隐私设置没给权限(Windows 下常见错误码 PaErrorCode-9999)。解决:到"设置 → 隐私 → 麦克风"里确认 Buzz 有权限,再检查杀毒软件是否拦截。

5. 想在完全断网的机器上用原因:模型需要先联网下载一次。解决:在有网电脑上把模型下好,整个模型缓存目录拷到离线机器相同位置;项目里还附带了 scripts/download-models.py 脚本帮你提前备齐模型。


Buzz 的价值不在于某个单点功能,而在于"离线转写 + 多种模型实现 + 实时/批量两种节奏"这条完整链路:小文件用 tiny 模型几分钟出稿,正式交付用 medium 以上逐词校对,会议室里直接开实时记录,文件夹里堆多少文件它就消化多少。装好它、下载一个 base 模型、丢一段音频进去,你的第一个转写文稿离你只有四步。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询