ithome
科技
采集 2026-09-11T10:13:48+00:00
小米开源工业级目标说话人语音识别大模型
原始标题:小米开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1
来源
ithome
发布时间
2026-09-11T06:51:39
采集批次
2026-09-11-10
字数
394
URL 指纹
781306d3f1255755
📌 AI 总结(223 字)
小米正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,旨在解决「鸡尾酒会」难题。该模型采用端到端 LLM 架构,以目标说话人的参考音频作为声纹提示,能在多人同时说话的复杂环境中精准提取并仅转录目标用户语音,在多个主流多说话人测试集上达到 SOTA,显著领先现有方案。同时其单人识别性能比肩标准 ASR 模型,能拒识非目标说话人干扰,并在目标不在场时输出空文本以避免误触发,还支持思维链推理模式提供可解释过程。
📄 正文(394 字)
IT之家 9 月 11 日消息,小米技术今日发文宣布,小米正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1。 官方表示,Xiaomi-CocktailASR-1 旨在解决「鸡尾酒会」难题(IT之家注:当前语音识别技术已经可以以较高精度识别一个人所讲的话,但是当说话的人数为两人或者多人时,语音识别率就会极大地降低,这一难题被称为鸡尾酒会问题)。 该模型采用端到端 LLM 架构,以目标说话人的一段参考音频作为声纹提示,可在多人同时说话的复杂环境中,精准提取并仅转录目标用户的语音。在多个主流多说话人测试集上均达到 SOTA,大幅领先现有方案。 同时,其单人识别性能比肩标准 ASR 模型,可无缝兼顾单人说话场景;具备拒识非目标说话人干扰语音的能力,目标不在场时输出空文本,有效避免误触发;此外还支持思维链推理模式,为识别结果提供可解释推理过程。