FunASR 完全指南:从会议转写到实时字幕,一套免费开源语音识别工具搞定
2026/9/7 4:39:49 网站建设 项目流程

FunASR 完全指南:从会议转写到实时字幕,一套免费开源语音识别工具搞定

【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR

一场两小时的会议纪要、几百段客服录音、需要实时字幕的直播——这些场景背后都是同一个需求:把语音准确、快速地变成文字。FunASR 是阿里巴巴达摩院开源的端到端语音识别(ASR)工具包,一条AutoModel调用就能串联起 VAD 语音端点检测、ASR 识别、标点恢复和说话人分离,并且支持离线转写、流式实时识别、OpenAI 兼容 API 部署,甚至纯 CPU 的边缘设备。与"单个模型"不同,FunASR 提供的是一个可按需组合的模型工具箱:有 GPU 就用旗舰 Fun-ASR-Nano 追极致精度,纯 CPU 就用 SenseVoice-Small 跑 17 倍实时,需要低延迟就用 Paraformer 流式模型。

为什么说 FunASR 值得放进你的技术栈

选语音识别方案时,大家最常纠结三件事:准确率够不够、跑得快不快、部署省不省钱。FunASR 给出的答卷是(数据来自项目自带的 184 条长音频、共 192 分钟基准测试):

模型中文 CER ↓GPU 速度CPU 速度
Fun-ASR-Nano(vLLM 加速)8.20%340 倍实时
SenseVoice-Small7.81%170 倍实时17 倍实时
Paraformer-Large10.18%120 倍实时15 倍实时

更直观的一句话:FunASR 的模型跑在 CPU 上,比 Whisper 跑在 GPU 上还要快。同时它自带说话人分离、情感与音频事件标签(SenseVoice 提供)、流式 WebSocket 服务,而这些都是"Whisper + 额外组件"要自己拼出来的。工具包源码为 MIT 协议,模型权重按各自模型卡许可使用,整体免费自托管。

按场景看:FunASR 能帮你解决哪些问题

长音频一次转写成结构化文本

丢进去一整段会议录音,返回的不是干巴巴的一行字,而是带时间戳、说话人编号和标点的句子列表——AutoModel会自动协调 ASR、VAD、说话人模型完成整条流水线。

多人会议与客服录音的说话人区分

通过spk_model="cam++"参数即可开启说话人分离,配合 FSMN-VAD 切分语音段,"谁在什么时候说了什么"直接落进结果里,无需再引入额外的分离工具。

实时字幕与呼叫中心流式转写

Paraformer 流式模型按 600ms 小块逐段输入、逐段输出,配合项目内置的 WebSocket 运行时服务(详见 运行时文档),可以支撑直播字幕、通话质检这类长连接场景。

私有化部署一套"语音识别 API"

funasr-server一条命令就能起一个 OpenAI 兼容的/v1/audio/transcriptions端点,LangChain、Dify、n8n 等现有客户端几乎零改动接入,音频不出内网。示例代码在 examples/openai_api/。

让 AI 智能体"听"懂语音

仓库自带 MCP Server(examples/mcp_server/),把本地语音识别能力直接暴露给 Claude、Cursor 这类 Agent,实现"对 Agent 说话"的交互入口。

两个关键设计,帮你看懂它是怎么做到的

流水线编排:一次调用背后的"装配线"

FunASR 的核心思想是把语音理解拆成可插拔的工序:VAD 负责"哪里有声音",ASR 负责"说了什么",CT-Transformer 负责"加标点",CAM++ 负责"谁说的"。你只需在AutoModel里声明用哪些工序,框架负责调度、批处理和结果合并。这就是为什么它既能一行代码做最简转写,也能一行代码做带说话人的生产级转写。

上下文增强解码:旗舰模型如何提升准确率

最新的 Fun-ASR-Nano 采用"编码器 + LLM 解码器"结构,并引入三路上下文注入:音频上下文(Audio Context)、CTC 预测上下文(CTC Predicting Context)和基于 RAG 的用户热词(User Hotword)。简单说,模型在解码每个词时,既参考前面已识别的语音与文本,也能检索你提供的业务热词库,因此对专有名词、人名、方言场景的识别明显更稳。

FunASR 最快上手:安装 + 第一段识别

一键安装步骤

pip install torch torchaudio pip install funasr

要求 Python ≥ 3.8,Linux / Windows / Mac 均支持;从源码安装则为git clone https://gitcode.com/GitHub_Trending/fun/FunASR && cd FunASR && pip install -e .,详细环境说明见 安装文档。

最短识别示例

有 GPU 的场景,三行代码出结果:

from funasr import AutoModel model = AutoModel(model="FunAudioLLM/Fun-ASR-Nano-2512", device="cuda") result = model.generate(input="meeting.wav") print(result[0]["text"])

纯 CPU 或想同时要情感和说话人标签,换成 SenseVoice 流水线:

model = AutoModel(model="iic/SenseVoiceSmall", vad_model="fsmn-vad", spk_model="cam++", device="cpu") result = model.generate(input="meeting.wav")

不想写 Python 也没关系,装完就有 CLI 可用:

funasr audio.wav # 最简转写 funasr audio.wav --spk --timestamps -f json # 说话人 + 时间戳,JSON 输出 funasr audio.wav --output-format srt # 直接生成字幕

不同场景的典型用法

你想做的事推荐路径
GPU 上追求最高精度(中/英/日 + 方言)Fun-ASR-Nano,吞吐敏感时配 vLLM(AutoModelVLLM
CPU 环境 / 多语言 + 情感事件标签SenseVoice-Small
中文生产环境 + 时间戳 + 热词Paraformer-zh(hotword参数直接传热词)
长音频 + 匿名说话人标签一步到位MOSS-Transcribe-Diarize
直播 / 呼叫中心实时字幕Paraformer 流式模型 + WebSocket 服务
批量处理录音存档参考 examples/batch_asr_improved.py
字幕生成examples/subtitle/generate_subtitle.py

选不定模型时的完整对照表在 模型选择指南,从 Whisper 或云端 ASR 迁移过来的评估方法见 迁移指南。

无 GPU、无 Python:单二进制跑在边缘设备上

通过 llama.cpp 的 GGUF 路线,SenseVoice / Paraformer / Fun-ASR-Nano 都能编译成单个自包含二进制,内置 FSMN-VAD,Linux / macOS / Windows(含 Vulkan、CUDA 包)都有预编译版本,中文错误率比 whisper.cpp 低约 3 倍。相关实现见 runtime/llama.cpp/。

版本演进与近期亮点

  • Fun-ASR-Nano(V2 架构):LLM 式 ASR,支持中英日与中文方言/口音,配合 vLLM 达到 340 倍实时
  • MOSS-Transcribe-Diarize:一次离线请求同时返回转写、时间戳和匿名说话人标签,支持 Docker / Kubernetes / vLLM 工作流
  • FunASR 1.4.x:完善 Model Zoo 发现机制,提升实时服务稳定性
  • 部署生态:OpenAI 兼容 API、MCP Server、Gradio 演示、Kubernetes 模板、llama.cpp 边缘包一应俱全

延伸资源:继续深入 FunASR

  • 模型源码:funasr/models/(Paraformer、SenseVoice、FSMN-VAD 等全部模型实现)
  • 训练与推理流水线:funasr/auto/auto_model.py
  • 工具包与 CLI 入口:funasr/cli.py、docs/cli.md
  • 故障排查:docs/troubleshooting.md
  • 使用场景合集:docs/use_case_showcase.md
  • 社区集成项目:docs/community_projects.md

从一段会议录音到一整套私有语音识别服务,FunASR 提供的不是"又一个模型",而是一条从研究、推理到生产部署的完整通路。先用 Colab 或上面的三行代码试出感觉,再按 部署矩阵 选择适合你的落地路径,就是最快的开始方式。

【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询