一种基于神经网络模型的多声音事件检测定位方法及装置
申请号:CN202510880793
申请日期:2025-06-27
公开号:CN120544597A
公开日期:2025-08-26
类型:发明专利
摘要
本发明涉及人工智能技术领域,特别涉及一种基于神经网络模型的多声音事件检测定位方法及装置。方法包括:创新设计时间‑频率多尺度残差卷积块,与Conformer模块和十字绣单元模块组成网络模型,多尺度提取特征、加强长序列建模及促进任务协同优化,提升性能与准确性;数据处理方面,预加重、分帧加窗提升特征质量,音频通道交换与频谱增强增加数据多样性,减少过拟合,采用SALSA‑Lite特征增强了特征表达;训练策略上,运用多元损失函数兼顾任务需求加速收敛,借助验证集灵活调整超参数。这使得本方法训练效率高、实际性能优,在未知数据上泛化能力强,能精准应对复杂多变的实际场景,有效克服传统方法的不足。
技术关键词
神经网络模型
检测定位方法
联合损失函数
音频
多声源
声音检测
检测定位设备
检测定位装置
数据
计算机可读指令
多尺度
特征提取模块
训练集
误差
人工智能技术
频率
采样模块
处理器
通道