如何 3 步装好 faster-whisper:Whisper 语音转写安装配置完整指南
【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper
faster-whisper 是基于 CTranslate2(负责把模型推理跑得快的引擎)重写的 Whisper 语音识别工具,解决原版 openai/whisper 推理慢、显存占用高的问题。faster-whisper 安装只需一条 pip 命令,CPU 或 GPU 都能跑。
📦 一、项目速览
faster-whisper 用 CTranslate2 作为推理引擎重实现了 OpenAI 的 Whisper 语音识别模型,官方基准显示它在同等精度下比 openai/whisper 最多快 4 倍,内存占用更低。项目主体是 Python,CPU 和 GPU 上都可以用 INT8 量化进一步提速。首次加载模型时会自动从 Hugging Face Hub 下载对应的 CTranslate2 转换模型,无需手动转换权重。
| 依赖项 | 版本或要求 | 说明 |
|---|---|---|
| Python | ≥ 3.9 | 主运行环境,3.8 及以下无法安装 |
| ctranslate2 | ≥4.0,<5 | 推理引擎,最新版仅支持 CUDA 12 + cuDNN 9 |
| huggingface_hub | ≥ 0.23 | 负责从 Hub 下载转换后的模型 |
| tokenizers | ≥0.13,<1 | 处理语音文本的分词 |
| onnxruntime | ≥1.14,<2 | 运行内置的 Silero VAD 语音活动检测模型 |
| PyAV (av) | ≥11 | 自带 FFmpeg 库,无需系统安装 FFmpeg |
| NVIDIA cuBLAS / cuDNN | CUDA 12 + cuDNN 9 | 仅 GPU(cuda)运行时需要 |
🚀 二、开始安装:一步步装好
第 1 步:确认 Python 版本
做什么:faster-whisper 要求 Python 3.9 及以上,先确认当前解释器版本。
python3 --version做完的样子:终端输出类似Python 3.9.19或更高的版本号。如果低于 3.9,先升级 Python 再继续。
第 2 步:用 pip 完成 faster-whisper 安装
做什么:从 PyPI 安装主包,依赖会自动装齐。
pip install faster-whisper做完的样子:pip show faster-whisper输出Version: 1.2.1(当前仓库版本),且import faster_whisper不报错。如果想用最新开发代码或源码安装,执行git clone https://gitcode.com/GitHub_Trending/fa/faster-whisper && pip install .即可,这里不再展开。
第 3 步:GPU 用户加装 NVIDIA 运行库
做什么:用 CUDA 运行时,ctranslate2 还需要 cuBLAS 和 cuDNN 9 这两个库;纯 CPU 用户跳过本步。
pip install nvidia-cublas-cu12 nvidia-cudnn-cu12==9.* export LD_LIBRARY_PATH=`python3 -c 'import os; import nvidia.cublas.lib; import nvidia.cudnn.lib; print(os.path.dirname(nvidia.cublas.lib.__file__) + ":" + os.path.dirname(nvidia.cudnn.lib.__file__))'`做完的样子:在这个终端里启动 Python,用device="cuda"加载模型时不再报找不到 CUDA 库的错误。
⚠️ 三、常见坑与对策
- CUDA/cuDNN 版本冲突→ 原因:最新版 ctranslate2 只支持 CUDA 12 + cuDNN 9,老环境会直接报错 → 解法:CUDA 11 / cuDNN 8 用户执行
pip install --force-reinstall ctranslate2==3.24.0;CUDA 12 但 cuDNN 8 的用户降到ctranslate2==4.4.0。 - LD_LIBRARY_PATH 没生效→ 原因:export 只对当前终端会话有效,新开终端就丢了 → 解法:在启动 Python 之前的同一个终端里先 export,别指望它跨终端。
- transcribe() 像没执行→ 原因:返回的
segments是生成器,迭代之前不会开始转录 → 解法:用list(segments)或 for 循环把它跑完。 - 首次加载模型很慢→ 原因:模型首次会从 Hugging Face Hub 自动下载 → 解法:提前用
download_model("tiny.en", "./models")预下载,或加载时指定download_root/local_files_only=True指向本地。 - 担心没装 FFmpeg→ 原因:原版 whisper 依赖系统 FFmpeg → 解法:无需处理,faster-whisper 用 PyAV 解码,FFmpeg 库已随包提供。
✅ 四、验证安装:跑一段代码确认装成功
faster-whisper 安装完成后,把下面这段最小示例跑一遍即可验证(tests/data/jfk.flac替换成你自己的音频路径):
import faster_whisper from faster_whisper import WhisperModel print(faster_whisper.__version__) # 输出 1.2.1 model = WhisperModel("tiny.en", device="cpu", compute_type="int8") segments, info = model.transcribe("tests/data/jfk.flac", beam_size=5) for seg in list(segments): # 必须迭代才会真正开始转录 print(f"[{seg.start:.2f}s -> {seg.end:.2f}s] {seg.text}")预期输出:先打印版本号1.2.1,随后出现形如[0.00s -> 6.00s] and so we must insure that our democracy...的带时间戳转写文本,说明模型加载与转录链路全部正常。
更多转写参数(VAD 过滤、词级时间戳、批量推理)请直接查 README.md 和 WhisperModel 类源码。
【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考