Windows 上把录音批量转成文字:FunASR 语音识别最短路径跑通
【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR
手头 10 段会议录音,周五前要交文字稿。FunASR 社区软件包干的就是这件事:本地语音识别,离线转写、流式听写、VAD 切分、标点恢复一条链路走通。它是 Python 工具包,装上就能跑,CPU 也能出结果。
4 步装好并转出第一条文本 🚀
这节只写不跑不通的动作,照着敲就行。
- 装包,并装好匹配版本的 PyTorch(>= 1.11):
pip3 install -U funasr python -c "import funasr; print(funasr.__version__)"- 启动 WebSocket 转写服务,默认监听 10095 端口:
cd runtime/python/websocket python funasr_wss_server.py --port 10095- 另开一个终端,用仓库自带的客户端连上去验证。
--mode 2pass走实时麦克风,换成--mode offline --audio_in .\a.wav就转文件:
python funasr_wss_client.py --host "127.0.0.1" --port 10095 --mode 2pass- 客户端开始往外打识别文本,链路就通了。批量转文件时,对每一段录音各跑一次 offline 模式即可。
这套方案覆盖哪些活 📋
社区软件包对应的服务形态在下面的路线图里一张图看全:
| 能力 | 说明 |
|---|---|
| 离线文件转写 | 音频转带标点文字 |
| 实时语音听写 | 流式识别,句尾二次纠错 |
| 语音端点检测 | VAD 切分长音频 |
| 标点恢复 | 自动补句读 |
| 说话人分离 | 区分不同说话人 |
| 热词定制 | 提升专有词准确率 |
动手前先对一张门槛表
前置条件只有这些,不满足就先补齐再往下走:
| 条件 | 要求 |
|---|---|
| 系统 | Windows 10/11,64 位 |
| Python | 3.8 ~ 3.13,先建好环境 |
| PyTorch | >= 1.11,版本匹配 Python |
| 显存/驱动 | 用 GPU 后端时需最新显卡驱动 |
| 内存 | 4GB 起步 |
| 磁盘 | 2GB 可用空间 |
| 网络 | 首次运行要能访问 ModelScope 下载模型 |
按内存分档设参数
并发和量化档位跟着硬件走,先按表设,跑不动再往下调:
| 档位 | 模型精度 | 并发建议 |
|---|---|---|
| 4GB 内存 | q8 量化 | 单路,短音频 |
| 8GB 内存 | q8 量化 | 2 路起步 |
| 16GB+ | q8 量化 | 逐路加,观察 CPU |
| 有显卡 | CUDA 或 Vulkan 包 | 后端用--backend cuda或--backend vulkan |
量化精度指 GGUF 模型档位。CPU 预编译包默认--backend cpu,不需要额外装运行库;Vulkan 包只用显卡驱动自带组件,不装 SDK。
跑之前先对一下这 5 个坑
Python 版本装不上。根因:3.13 以上暂不支持。解法:python --version确认落在 3.8 ~ 3.13;确认pip --version指向同一份解释器。
CUDA 后端起不来。根因:NVIDIA 驱动过旧。解法:更新驱动到匹配版本;不行就先--backend cpu,结果不受影响,只是慢些。
Vulkan 报没有设备。根因:显卡驱动太老。解法:装最新 AMD / Intel / NVIDIA 驱动后重试。AMD 驱动超时的话,把环境变量GGML_VK_MAX_NODES_PER_SUBMIT设成 16,再降 8 或 1。
10095 端口被占。根因:别的进程占了端口。解法:netstat -ano | findstr 10095查出占用进程,释放或换端口。
首次运行卡住。根因:模型还没下载完。解法:看终端进度;离线环境先把 GGUF 模型放到本地目录,再用-m参数指向它。
出口
- 快速开始:runtime/quick_start_zh.md
- 软件包路线图:runtime/readme_cn.md
- WebSocket 部署:runtime/python/websocket/
- 安装文档:docs/installation/installation_zh.md
跑通第一条之后,剩下的都是调参的事。
【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考