Buzz 离线音频转写指南:如何在本机跑通 Whisper 转写与翻译
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
录音文件越攒越多,逐字手抄字幕已经扛不住了,敏感内容又不方便丢上云端。Buzz 在本机离线完成音频转写与翻译,音轨全程不离开你的电脑。
它替你省掉了什么
音频拖进转写网站排队等结果的日子结束了,Buzz 在本机离线转写,文件不出电脑。
逐字手抄换成按时间戳的段落表,导出 SRT、VTT 直接进剪辑软件。
会议讲座边录边出字,演示窗口挂副屏,现场就能看。
MIT 协议,Python 加 PyQt6 打底,字幕组、语言学习者和脚本用户都够用。
数据流:从输入到产出
输入端比你想的宽:拖进音频或视频会自动抽音轨,不用先转格式;贴个链接也能直接建任务。实时录音时麦克风就是输入源,边说边出字。
处理环节有多后端可选:Whisper、Whisper.cpp、Faster Whisper 和 Hugging Face 模型按硬件挑,模型从 tiny 到 large,Nvidia 卡走 CUDA,其他显卡走 Vulkan 加速。嘈杂录音可以先做语音分离再转写,多人对话还能做说话人识别。
语言可以手动指定,也可以留空让它自动检测;术语多的领域,在高级设置里给初始提示填几句已知词,识别会稳很多。
产出是一张带起止时间戳的段落表,在查看器里点哪段播哪段,顺带核对;导出 TXT、SRT、VTT 一键完成。
自动化这边最省心:监视文件夹里的新文件会自动建任务进队列;buzz add一条命令就能指定后端、语言和输出格式,写进脚本跑批;插件系统内置了 AI 摘要、DOCX 导出、自动字幕时长调整,不用自己再开发。
从零到第一次出结果
- 从发布页拿 Windows 或 macOS 对应安装包,Windows 包未签名,安装时出现安全警告,选“更多信息”再“仍要运行”。
- Linux 用户一条命令装好:
flatpak install flathub io.github.chidiwilliams.Buzz- 打开应用,按 Ctrl/Cmd+O 或点工具栏加号导入媒体文件。
- 在任务行里选任务、语言和模型,拿不准语言就留空自动检测。
- 点运行,首次会按选择自动下载模型,在队列里等进度走完。
- 完成后打开转录查看器,核对几段,导出 SRT 或 VTT 进剪辑软件。
如果字幕时长不齐,打开段落调整按标点合并、按目标长度重切,再导出。
附注:开发者也可以用pip install buzz-captions装好再python -m buzz(需 Python 3.12 并已装 ffmpeg);要写进脚本的话,一条命令即可:
buzz add --srt --model-type whispercpp --model-size small meeting.mp3深水区:调参与排错
如果转写速度慢,先检查模型对当前机器是否太大,降到 tiny 或 base,再换成 Whisper.cpp 后端并打开 GPU 加速。
如果专有名词和术语识别错,先给初始提示填几句示例句,语言确定时手动指定,而不是靠自动检测。
如果 Windows 安装弹安全警告,别担心,安装包只是没做代码签名,“更多信息”→“仍要运行”即可。
如果 PyPI 版本 GPU 不生效,先查 torch 是不是装的 CPU 版,Windows 上按 README 说明改装 CUDA 版 torch 及对应运行库。
如果时间戳和语音对不上,打开查看器用段落调整功能手动校正每段的起止点。
多后端各占一个文件,都放在 buzz/transcriber/,想接新后端从这里入手;AI 摘要、DOCX 导出等内置插件在 buzz/plugins/,照它的模板就能扩新插件;CLI 参数全貌查 docs/docs/ 里的 CLI 文档。
文档与 Issue 入口
使用文档和参数细节,遇到问题或有改进想法,直接去项目 Issues 提交,维护者更新频率很高。不如先拿一段长录音跑通一次,再配好监视文件夹,让新文件自己转。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考