小米发布并开源 Xiaomi-CocktailASR-1
昨天
小米正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,该模型采用端到端 LLM 架构,以目标说话人参考音频为声纹提示,可在多人同时说话的复杂环境中精准提取并仅转录目标用户语音,旨在解决「鸡尾酒会」难题。
体验专业版特色功能,拓展更丰富、更全面的相关内容。
小米正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,该模型采用端到端 LLM 架构,以目标说话人参考音频为声纹提示,可在多人同时说话的复杂环境中精准提取并仅转录目标用户语音,旨在解决「鸡尾酒会」难题。