摘要
本发明公开了一种基于统一架构的声音分离与目标声音提取方法,涉及音频信号处理技术领域,包括:在第一训练阶段,采用吸引子网络估计混合音频信号中的声源数量,生成吸引子嵌入;将吸引子嵌入输入到分离主干网络,生成分离后的声音;在第二训练阶段,采用多模态线索处理网络处理多种模态的线索信息,生成线索嵌入;随机选择吸引子嵌入或线索嵌入作为分离主干网络的输入;在训练阶段,计算吸引子嵌入和线索嵌入之间的对齐损失函数;在推理阶段,如果没有线索信息,执行声音分离任务;如果有1至3个线索信息,执行目标声音提取任务。本发明根据输入的线索情况灵活选择执行任务,具有更好的适应性和灵活性,适用于复杂的声音场景。