首页 > 开源 > 小米开源工业级目标说话人语音识别大模型 CocktailASR-1,解决鸡尾酒会难题

小米开源工业级目标说话人语音识别大模型 CocktailASR-1,解决鸡尾酒会难题

OSChina资讯 2026-09-11 17:00 3 阅读 查看原文

把一个人声从嘈杂的人群中剥离出来,人类的听觉系统做这件事毫不费力。但对 ASR 模型来说,多人同时讲话的场景至今是一个未被充分解决的难题。小米刚刚开源的 CocktailASR-1,做出了一个有意思的尝试:不是做"更好的降噪",而是从根本上改变任务的输入——先告诉模型你要听谁说话,再让模型只输出那个人的话。

这就是目标说话人语音识别(target-speaker ASR)。给一段参考音频,模型用声纹嵌入定位目标说话人,在多人混合音频里只转录他的语音。其他人说话时的内容、混响、背景噪音,模型一概不输出。

从 GitHub 放出的技术报告看,CocktailASR-1 是一个端到端 LLM 架构:D2V2 音频编码器 → Adapter → LLM 解码,所有权重(D2V2 + Adapter + LLM)放在一个 checkpoint 里。输入格式是把参考音频和目标音频拼接,中间插一秒静音做分隔,16kHz 单声道。不同场景不需要切换模型——无论是单人还是多人,同一个模型全搞定。

基准测试结果很扎实。在多说话人模拟测试上,LibriMix 2mix 的 WER 只有 4.11%,LibriSpeechMix 2mix 更是压到 2.90%。同赛道对比,Qwen3-ASR、Gemini、StepAudio 在混合场景下全军覆没——LibriMix 3mix 上这三个模型的 WER 分别是 106.04%、76.10% 和 121.08%,CocktailASR-1 是 12.29%。

不是"比它们好",是"它们做不了这件事"。

在真实会议录制上,AMI SDM 的 WER 是 21.81%,AliMeeting Far 是 20.63%。尽管真实场景比模拟数据难得多,但依然大幅领先已有方案。

单人场景也没拉垮。LibriSpeech 上 WER 1.73%,比 Whisper Large-v2 的 2.06% 和 Gemini 的 2.25% 都好。WenetSpeech 和 CommonVoice-zh 上也全面领先。

除了识别精度,这个模型还做了两件事值得单独提出来说。

第一件是负样本拒识。当参考音频对应的人不参与当前对话时,模型输出空文本。这在工程上有实际价值——智能音箱、车载助手这些场景里,如果旁边有人在说话,设备不应该被误触发。CocktailASR-1 在 LibriSpeech 负样本上做到了 79.59% 的拒识率;Aishell 上是 75.35%;小米自有的中文测试集上是 68.54%。对比之下,Qwen3-ASR 和 StepAudio 的负样本拒识率是零——它们根本没有这个能力,任何时候都会输出文字。

当然,拒识能力也有反效果:正样本偶尔也被误拒,产生虚假拒识率(FRR)。不过从数据上看 FRR 控制得可以接受——LibriSpeech 上 0.36%,AliMeeting-near 上 0.38%,AMI-ihm 上 0.01%。

第二件是思维链推理。模型可以在输出最后答案前先跑一段 <thinking> 标签包裹的推理过程,解释它是怎么判断说话人的。这个功能对终端用户的实用价值有限——你不会想在对话中看它怎么推理——但对调试和可解释性很有意义。从报告数据看,CoT 对精度的影响不大,LibriMix 2mix 上只降低了 0.24 个 WER 百分点,其他数据集上基本持平。说明推理能力是副产品,不是用精度换来的。

没有标注具体参数量和训练数据规模,但从"所有权重放一个 checkpoint"和 D2V2 编码器的选择来看,模型尺寸应该在可部署的范围内。推理代码已经放在 GitHub 上,Apache 2.0 协议,minimal 依赖(torch、torchaudio、transformers、soundfile),从 HuggingFace 加载。

小米在语音方向布局已久,从声学前端到语音唤醒到远场 ASR,这次 CocktailASR-1 把注意力从"所有声音"转向了"一个声音"——这个转向本身比任何一个 benchmark 数字都更有信号意义。

来源: