Audio8 ASR Infinite Torch 推理完整指南:从 WAV 到实时文本,一行命令搞定
【免费下载链接】Audio8-ASR-Infinite项目地址: https://ai.gitcode.com/hf_mirrors/Edge0/Audio8-ASR-Infinite
Audio8 ASR Infinite是一款原生流式语音识别(ASR)模型,主打低延迟实时转写。本文带你用 Torch 推理方式,只需一行命令,就能把本地 WAV 音频转成逐字实时输出的文本——支持中文/英文双语、可选 80/120/160 ms 音频时钟,甚至可用 24/7 全天候运行不漂移。
它强在哪?3 个亮点先看
🎯超快响应:原生流式架构每秒解码 12.5 次,边说边出字 ♾️无限时长:滚动 KV Cache 让内存和延迟保持恒定,7×24 小时连续转写不漂移 ⚡延迟可调:转写延迟 240–560 ms 自由选择,用延迟换准确率
Torch 推理:一行命令从 WAV 到实时文本
不需要 Docker、不需要部署服务端,Torch 模拟流式解码是最快的上手方式。一条命令即可:
python -m audio8_asr_infinite.examples.torch_streaming_decode \ --checkpoint /path/to/checkpoint \ --audio sample.wav --language zh --transcription-delay-ms 480命令说明:
| 参数 | 含义 | 示例 |
|---|---|---|
--checkpoint | 模型权重目录 | 本仓库所在目录 |
--audio | 输入音频(16 kHz 单声道 WAV) | sample.wav |
--language | 识别语言 | zh或en |
--transcription-delay-ms | 转写延迟(毫秒) | 480 |
该命令对应 README 中的 Torch 推理章节,详见 README.md。如果你希望用代码精细控制批量解码,可参考其中给出的simulated_streaming_greedy_decode_batch用法,见 README.md。
音频时钟怎么选?一张表看懂参数搭配
模型支持三种音频时钟(流式帧长),不同时钟可搭配的延迟不同。以下组合经过后训练优化,推荐直接使用:
| 音频时钟 | frame_len | streaming_n_left_pad_tokens | 可选target_delay_ms |
|---|---|---|---|
| 80 ms | 4 | 18 | 240 / 320 / 480 / 560 |
| 120 ms | 6 | 12 | 240 / 480 |
| 160 ms | 8 | 9 | 320 / 480 |
💡 经验法则:追求最低延迟选 80 ms 时钟 + 240 ms 延迟;追求更高准确率选 480 ms 延迟。延迟必须是所选时钟的整数倍。
参数解析逻辑可参考 configuration_audio8_asr_infinite.py 中的resolve_frame_len与resolve_num_delay_tokens方法。
仓库文件导览:每个文件是干什么的
| 文件 | 作用 |
|---|---|
| config.json | 模型配置:音频塔、解码器、延迟映射等 |
| model.safetensors | 主权重(约 8.17 GB,bfloat16) |
| model.safetensors.index.json | 权重索引文件 |
| semantic_vad_heads.safetensors | 语义 VAD 头,区分思考停顿、口误与真正说完 |
| modeling_audio8_asr_infinite.py | 模型定义与延迟条件化推理核心 |
| configuration_audio8_asr_infinite.py | 配置类,负责帧长/延迟校验 |
| tokenizer_config.json | 分词器配置(Qwen2Tokenizer,含流式特殊 token) |
| preprocessor_config.json | 音频特征提取参数(128 mel 频谱、16 kHz) |
| generation_config.json | 生成参数(BOS/EOS/PAD token) |
架构上,模型继承 Voxtral Realtime 音频塔 + Qwen2.5-3B-Instruct 解码器,延迟通过「正弦时间嵌入 → 逐层自适应 MLP」注入,详见 modeling_audio8_asr_infinite.py 的文件头注释。
效果如何?480 ms 延迟下的真实数据
在 80 ms 时钟、480 ms 延迟的贪心解码下,与同类流式模型对比(错误率,%):
| 测试集 | 指标 | Audio8 ASR Infinite | Voxtral-Mini-4B-Realtime | nemotron-3.5-streaming |
|---|---|---|---|---|
| aishell1/test | CER | 1.750 | 16.795 | 12.927 |
| aishell4/test | CER | 2.893 | 16.456 | 14.677 |
| librispeech test.clean | WER | 3.042 | 2.210 | 3.353 |
| 平均 | 3.623 | 10.253 | 9.524 |
中文测试集上优势明显,是双语流式识别的高性价比选择。
小结:三步完成你的第一次转写
- 准备一条 16 kHz 单声道 WAV 音频
- 运行上面那一行
torch_streaming_decode命令 - 观察逐 token 实时输出的转写结果
想体验 24/7 不间断的实时场景?仓库还支持 vLLM + Docker 部署方案,可参考 README.md。Torch 推理作为入门首选,足以让你最快感受 Audio8 ASR Infinite 的实时流式魅力 🚀
【免费下载链接】Audio8-ASR-Infinite项目地址: https://ai.gitcode.com/hf_mirrors/Edge0/Audio8-ASR-Infinite
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考