Buzz 离线转录指南:3 步把会议录音变成字幕,全程免费不上云
2026/9/7 16:27:55 网站建设 项目流程

Buzz 离线转录指南:3 步把会议录音变成字幕,全程免费不上云

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款跑在本地的音频转文字工具,基于 OpenAI 的 Whisper 模型,支持 99 种语言,数据全程留在你的电脑里。装好之后,你可以导入一段 MP3,几分钟拿到带时间戳的文字稿;也可以对着麦克风说话,让句子实时变成字幕。

先跑起来:Buzz 安装各平台一条命令

这一节让你在 5 分钟内装好 Buzz,覆盖 Windows、macOS 和 Linux。

  • Windows:执行pip install buzz-captions,再用python -m buzz启动;或者从发布页下载安装包双击运行,出现"未验证发布者"提示时选「更多信息 → 仍要运行」。

  • macOS:从发布页下载.dmg,把 Buzz 拖进"应用程序"文件夹;命令安装方式与 Windows 相同。

  • Linux

    sudo snap install buzz

首次启动会自动下载基础转录模型,等它完成即可。之后按 Ctrl(Mac 上是 Command)加逗号打开设置窗口,在"模型设置"里能看到下载进度,也可以提前把常用模型下好。

第一次转录:4 步从音频到文字

这一节带你走最短路径,拿到第一份文字稿。

  1. 点工具栏的"+"号(或 Ctrl/Command + O),选中音频文件,MP3、WAV、M4A、MP4 都支持。
  2. 选择文件使用的语言——手动指定比自动检测更稳定;模型保持默认 Base 即可。
  3. 点 Run,等状态列显示"Completed"。
  4. 双击该行打开转录结果,选一个格式导出,文字稿就成了。

如果音频里有人名、地名或专业术语,可以把容易拼错的词写进"初始提示"(导入后点"Advanced…"按钮),模型生成文字时会参照它,减少错字。

三种用法:单文件、批量队列、实时录音

这一节把 Buzz 的三种任务类型分清楚,你对号入座选一种就行。

单文件转录

导入一个文件,选模型和语言,点 Run。适合把单条采访、讲座、播客变成文稿。它和"第一次转录"的区别只在一处:跑完发现准确率不满意,可以换一个更大的模型重新跑。

批量队列

按住 Ctrl 一次选中多个文件,它们全部进入任务列表,按顺序处理,单个任务可以暂停、恢复。适合一次导入整季播客或一门课的录音。再进一步可以配置"监控文件夹":新音频放进指定目录就自动开始转录,不用手动导入。

实时录音 🎙️

在实时录音区域选好麦克风、语言和模型,点 Record,句子会逐句出现在屏幕上,还可以打开演示窗口把字幕放大投屏。适合会议纪要、活动现场字幕。提醒一句:实时转录吃性能,模型选小了才跟得上语速。

字幕与导出 🎬:SRT、VTT、TXT 三种格式

这一节解决"文字稿怎么变成能用的视频字幕"。

  • 双击打开转录结果,底部时间轴和文字同步,拖动或直接输入秒数,就能改每一段的起止时间。
  • 点"Resize"重新切分字幕:单行最大长度建议40~50 个字符,开启"按标点拆分";想让字幕在屏幕上多留一会儿,可以把每段结束时间延长 0.2~0.5 秒。
  • 导出格式三种:SRT 给剪辑软件,VTT 给网页播放器,TXT 要纯文字就用它。
  • 转录前如果勾选了"词级时间戳",Resize 会依据每个词的时间点切分,合并和拆分都更准。

模型怎么选:Whisper 五档一张表

这一节帮你按电脑内存直接定档位,不用自己猜。

模型速度内存约需适合场景
tiny最快<1GB实时录音、快速草稿
base~1GB日常使用,默认选择
small中等~2GB速度和准确率平衡
medium~5GB专业转录、有背景噪音的音频
large最慢~10GB追求最高准确率

结论:默认用base;内存有 16GB 可以直接上small;准确率不满意时先升到medium再考虑更大的。模型在"设置 - 模型设置"里按需下载、删除,空间紧张时选量化版本(如 q5),内存省掉近一半,准确率损失不大。

避坑指南 ⚠️:6 个高频问题

以下是最常见的 6 个问题,每条给出原因和解决办法。

  1. 语言检测识别错——自动检测靠开头几秒音频,开头是音乐或噪音就容易误判 → 手动指定语言,速度还更快。
  2. Windows 安装时提示"未验证发布者"——程序未签名导致的正常现象 → 点「更多信息 → 仍要运行」即可。
  3. 实时录音卡顿、句子出不来——默认转录链路比较吃资源 → 改用 Whisper.cpp 引擎,配 tiny 或 base 模型,关掉其他占资源的应用。
  4. 模型下载慢或失败——模型文件从几十 MB 到几 GB 不等 → 网络好的时候重试,也可以手动下载模型文件放进模型目录(用环境变量BUZZ_MODEL_ROOT指定位置)。
  5. 专有名词老拼错——模型不知道说话人的背景 → 把常用名词写进"初始提示"。
  6. 字幕行太长不好读——默认分段偏粗 → 用 Resize 工具把最大长度设到 40~50 字符。

Buzz 适合三类人:常处理录音的办公和媒体从业者、需要字幕的视频创作者、不想把音频交给在线服务的用户。更多操作细节见仓库文档 文件导入 与 偏好设置。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询