小米开源工业级语音识别模型,攻克多人同时说话的鸡尾酒会难题

【软盟资讯 · 7×24快讯】(2026年09月12日) 小米团队开源工业级目标说话人语音识别大模型CocktailASR-1,旨在攻克多人同时发言环境下的”鸡尾酒会难题”。与传统盲源分离和降噪思路不同,该模型允许用户预先指定目标说话人的声学特征,模型仅输出对应说话人的语音转录,实现”指定谁、就只听清谁”。这一方案为车载智能座舱、会议转录、复杂环境拾音等嘈杂场景提供了极具实用价值的开源声学方案,大幅降低多人嘈杂环境中的语音识别与转写门槛,便于开发者和车企在真实噪声场景中部署与二次开发。

软盟观察: CocktailASR-1破解”鸡尾酒会难题”的取巧之处,在于它不再试图把所有人的声音都分离干净——那在物理上既难又耗算力,而是换了个思路:让用户先指定’我要听谁’,模型只专注转录这一个人的声音。这个’目标说话人’的转向,恰恰是让语音识别从’实验室炫技’走向’真实场景可用’的关键。它的商业落点也很实在:车载语音、智能座舱、会议转写,全是AI语音最赚钱也最头疼的痛点。而小米选择开源,等于给整个行业的嘈杂场景语音方案开源了一个现成底座,对车载和IoT生态的带动值得期待。

上一篇:

下一篇:

发表回复

登录后才能评论