Windows 上把录音批量转成文字:FunASR 语音识别最短路径跑通
2026/9/7 18:36:58 网站建设 项目流程

Windows 上把录音批量转成文字:FunASR 语音识别最短路径跑通

【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR

手头 10 段会议录音,周五前要交文字稿。FunASR 社区软件包干的就是这件事:本地语音识别,离线转写、流式听写、VAD 切分、标点恢复一条链路走通。它是 Python 工具包,装上就能跑,CPU 也能出结果。

4 步装好并转出第一条文本 🚀

这节只写不跑不通的动作,照着敲就行。

  1. 装包,并装好匹配版本的 PyTorch(>= 1.11):
pip3 install -U funasr python -c "import funasr; print(funasr.__version__)"
  1. 启动 WebSocket 转写服务,默认监听 10095 端口:
cd runtime/python/websocket python funasr_wss_server.py --port 10095
  1. 另开一个终端,用仓库自带的客户端连上去验证。--mode 2pass走实时麦克风,换成--mode offline --audio_in .\a.wav就转文件:
python funasr_wss_client.py --host "127.0.0.1" --port 10095 --mode 2pass
  1. 客户端开始往外打识别文本,链路就通了。批量转文件时,对每一段录音各跑一次 offline 模式即可。

这套方案覆盖哪些活 📋

社区软件包对应的服务形态在下面的路线图里一张图看全:

能力说明
离线文件转写音频转带标点文字
实时语音听写流式识别,句尾二次纠错
语音端点检测VAD 切分长音频
标点恢复自动补句读
说话人分离区分不同说话人
热词定制提升专有词准确率

动手前先对一张门槛表

前置条件只有这些,不满足就先补齐再往下走:

条件要求
系统Windows 10/11,64 位
Python3.8 ~ 3.13,先建好环境
PyTorch>= 1.11,版本匹配 Python
显存/驱动用 GPU 后端时需最新显卡驱动
内存4GB 起步
磁盘2GB 可用空间
网络首次运行要能访问 ModelScope 下载模型

按内存分档设参数

并发和量化档位跟着硬件走,先按表设,跑不动再往下调:

档位模型精度并发建议
4GB 内存q8 量化单路,短音频
8GB 内存q8 量化2 路起步
16GB+q8 量化逐路加,观察 CPU
有显卡CUDA 或 Vulkan 包后端用--backend cuda--backend vulkan

量化精度指 GGUF 模型档位。CPU 预编译包默认--backend cpu,不需要额外装运行库;Vulkan 包只用显卡驱动自带组件,不装 SDK。

跑之前先对一下这 5 个坑

Python 版本装不上。根因:3.13 以上暂不支持。解法:python --version确认落在 3.8 ~ 3.13;确认pip --version指向同一份解释器。

CUDA 后端起不来。根因:NVIDIA 驱动过旧。解法:更新驱动到匹配版本;不行就先--backend cpu,结果不受影响,只是慢些。

Vulkan 报没有设备。根因:显卡驱动太老。解法:装最新 AMD / Intel / NVIDIA 驱动后重试。AMD 驱动超时的话,把环境变量GGML_VK_MAX_NODES_PER_SUBMIT设成 16,再降 8 或 1。

10095 端口被占。根因:别的进程占了端口。解法:netstat -ano | findstr 10095查出占用进程,释放或换端口。

首次运行卡住。根因:模型还没下载完。解法:看终端进度;离线环境先把 GGUF 模型放到本地目录,再用-m参数指向它。

出口

  • 快速开始:runtime/quick_start_zh.md
  • 软件包路线图:runtime/readme_cn.md
  • WebSocket 部署:runtime/python/websocket/
  • 安装文档:docs/installation/installation_zh.md

跑通第一条之后,剩下的都是调参的事。

【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询