小米发布目标说话人语音识别大模型Xiaomi-CocktailASR-1

CNMO科技
 来自北京

【CNMO科技消息】9月11日,小米正式发布并开源工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1。CNMO科技从@小米技术 官微获悉,该模型面向多人同时说话的复杂语音场景,重点解决语音识别中的“鸡尾酒会”难题,即在嘈杂环境下从多名说话者中识别并转录指定目标用户的语音内容。

小米

小米

据介绍,Xiaomi-CocktailASR-1采用端到端LLM架构,使用目标说话人的一段参考音频作为声纹提示,在多人重叠发言的情况下,可提取并仅转录目标说话人的内容。官方表示,该模型基于大规模多说话人数据训练,在AliMeeting、AMI、LibriMix等多个主流多说话人测试集上达到最优性能。与此同时,其在单说话人场景下的识别表现也可与主流单人ASR模型相媲美,能够通过同一模型兼顾单人与多人场景,无需在不同语音识别模型之间切换。

除目标说话人识别外,该模型还具备负样本拒识能力。对于音频中不存在目标说话人的情况,模型可输出空文本,以降低非目标语音带来的误识别和误触发风险。小米同时提到,Xiaomi-CocktailASR-1支持思维链推理模式,可为识别结果提供具备可解释性的推理过程。

目前,Xiaomi-CocktailASR-1的模型权重与推理代码已经开源。

“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。

Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”

热点新闻