多人说话场景难题待解,小米开源 CocktailASR - 1 模型精准定位目标语音!
2026/9/11 23:37:16 网站建设 项目流程

【导语:在 ASR 模型面临多人同时讲话场景难题时,小米开源了 CocktailASR - 1 模型。它采用目标说话人语音识别技术,在多场景测试中表现出色,还具备负样本拒识和思维链推理等特性,意义重大。】


创新思路:从根本改变 ASR 任务输入

人类听觉能轻松从嘈杂人群中剥离人声,但 ASR 模型在多人同时讲话场景难题待解。小米的 CocktailASR - 1 没有做“更好的降噪”,而是从根本上改变任务的输入,采用目标说话人语音识别,先给模型参考音频定位目标说话人,再让其只转录该人的语音,过滤其他人说话内容、混响和背景噪音。

端到端架构:单模型搞定多场景

CocktailASR - 1 是端到端 LLM 架构,即 D2V2 音频编码器 -> Adapter -> LLM 解码,所有权重放在一个 checkpoint 里。输入格式是参考音频和目标音频拼接,中间插一秒静音分隔,为 16kHz 单声道。它无需针对不同场景切换模型,单人或多人场景都能应对。

测试领先:精度远超同赛道竞品

基准测试结果显示,CocktailASR - 1 表现优异。在多说话人模拟测试中,LibriMix 2mix 的 WER 只有 4.11%,LibriSpeechMix 2mix 更是低至 2.90%;在 LibriMix 3mix 测试中,Qwen3 - ASR、Gemini、StepAudio 全军覆没,而 CocktailASR - 1 为 12.29%。在真实会议录制测试中,AMI SDM 的 WER 是 21.81%,AliMeeting Far 是 20.63%,大幅领先已有方案。单人场景下,在 LibriSpeech 等数据集上也全面领先。

附加特性:负样本拒识与思维链推理

该模型具备负样本拒识能力,当参考音频对应的人不参与当前对话时,输出空文本。在 LibriSpeech 负样本上拒识率达 79.59%,Aishell 上是 75.35%,小米自有的中文测试集上是 68.54%,而 Qwen3 - ASR 和 StepAudio 无此能力。同时,它还具备思维链推理功能,可在输出答案前展示推理过程,对调试和可解释性有意义,且对精度影响不大。

编辑观点:小米 CocktailASR - 1 模型在技术上创新突破,多场景测试表现亮眼且有实用特性,从“所有声音”到“一个声音”的转向为行业发展提供新思路。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询