如何 3 步装好 faster-whisper:Whisper 语音转写安装配置完整指南
2026/9/5 23:31:08 网站建设 项目流程

如何 3 步装好 faster-whisper:Whisper 语音转写安装配置完整指南

【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper

faster-whisper 是基于 CTranslate2(负责把模型推理跑得快的引擎)重写的 Whisper 语音识别工具,解决原版 openai/whisper 推理慢、显存占用高的问题。faster-whisper 安装只需一条 pip 命令,CPU 或 GPU 都能跑。

📦 一、项目速览

faster-whisper 用 CTranslate2 作为推理引擎重实现了 OpenAI 的 Whisper 语音识别模型,官方基准显示它在同等精度下比 openai/whisper 最多快 4 倍,内存占用更低。项目主体是 Python,CPU 和 GPU 上都可以用 INT8 量化进一步提速。首次加载模型时会自动从 Hugging Face Hub 下载对应的 CTranslate2 转换模型,无需手动转换权重。

依赖项版本或要求说明
Python≥ 3.9主运行环境,3.8 及以下无法安装
ctranslate2≥4.0,<5推理引擎,最新版仅支持 CUDA 12 + cuDNN 9
huggingface_hub≥ 0.23负责从 Hub 下载转换后的模型
tokenizers≥0.13,<1处理语音文本的分词
onnxruntime≥1.14,<2运行内置的 Silero VAD 语音活动检测模型
PyAV (av)≥11自带 FFmpeg 库,无需系统安装 FFmpeg
NVIDIA cuBLAS / cuDNNCUDA 12 + cuDNN 9仅 GPU(cuda)运行时需要

🚀 二、开始安装:一步步装好

第 1 步:确认 Python 版本

做什么:faster-whisper 要求 Python 3.9 及以上,先确认当前解释器版本。

python3 --version

做完的样子:终端输出类似Python 3.9.19或更高的版本号。如果低于 3.9,先升级 Python 再继续。

第 2 步:用 pip 完成 faster-whisper 安装

做什么:从 PyPI 安装主包,依赖会自动装齐。

pip install faster-whisper

做完的样子:pip show faster-whisper输出Version: 1.2.1(当前仓库版本),且import faster_whisper不报错。如果想用最新开发代码或源码安装,执行git clone https://gitcode.com/GitHub_Trending/fa/faster-whisper && pip install .即可,这里不再展开。

第 3 步:GPU 用户加装 NVIDIA 运行库

做什么:用 CUDA 运行时,ctranslate2 还需要 cuBLAS 和 cuDNN 9 这两个库;纯 CPU 用户跳过本步。

pip install nvidia-cublas-cu12 nvidia-cudnn-cu12==9.* export LD_LIBRARY_PATH=`python3 -c 'import os; import nvidia.cublas.lib; import nvidia.cudnn.lib; print(os.path.dirname(nvidia.cublas.lib.__file__) + ":" + os.path.dirname(nvidia.cudnn.lib.__file__))'`

做完的样子:在这个终端里启动 Python,用device="cuda"加载模型时不再报找不到 CUDA 库的错误。

⚠️ 三、常见坑与对策

  • CUDA/cuDNN 版本冲突→ 原因:最新版 ctranslate2 只支持 CUDA 12 + cuDNN 9,老环境会直接报错 → 解法:CUDA 11 / cuDNN 8 用户执行pip install --force-reinstall ctranslate2==3.24.0;CUDA 12 但 cuDNN 8 的用户降到ctranslate2==4.4.0
  • LD_LIBRARY_PATH 没生效→ 原因:export 只对当前终端会话有效,新开终端就丢了 → 解法:在启动 Python 之前的同一个终端里先 export,别指望它跨终端。
  • transcribe() 像没执行→ 原因:返回的segments是生成器,迭代之前不会开始转录 → 解法:用list(segments)或 for 循环把它跑完。
  • 首次加载模型很慢→ 原因:模型首次会从 Hugging Face Hub 自动下载 → 解法:提前用download_model("tiny.en", "./models")预下载,或加载时指定download_root/local_files_only=True指向本地。
  • 担心没装 FFmpeg→ 原因:原版 whisper 依赖系统 FFmpeg → 解法:无需处理,faster-whisper 用 PyAV 解码,FFmpeg 库已随包提供。

✅ 四、验证安装:跑一段代码确认装成功

faster-whisper 安装完成后,把下面这段最小示例跑一遍即可验证(tests/data/jfk.flac替换成你自己的音频路径):

import faster_whisper from faster_whisper import WhisperModel print(faster_whisper.__version__) # 输出 1.2.1 model = WhisperModel("tiny.en", device="cpu", compute_type="int8") segments, info = model.transcribe("tests/data/jfk.flac", beam_size=5) for seg in list(segments): # 必须迭代才会真正开始转录 print(f"[{seg.start:.2f}s -> {seg.end:.2f}s] {seg.text}")

预期输出:先打印版本号1.2.1,随后出现形如[0.00s -> 6.00s] and so we must insure that our democracy...的带时间戳转写文本,说明模型加载与转录链路全部正常。

更多转写参数(VAD 过滤、词级时间戳、批量推理)请直接查 README.md 和 WhisperModel 类源码。

【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询