摘要
一种多模态音视频检测和智能交互方法,机器人与人的多模态感知和互动,在听力测试模式,对不同的人群进行听力测试;先识别出人脸,再对面部进行定位,计算并输出面部的距离;当识别人脸与相机的距离等于基准值时,进行听力测试;听力测试对在声源定位:先是对多路麦克风输入的音频信号进行带通滤波,滤除部分噪声,采用PHAT加权函数,消除混响干扰,抑制局部峰值,接着进行声源定位:在该模式下,机器人根据人体识别和语音大小进行移动;由主控模块分别采集图像信号和音频信号,通过YOLOv算法识别出人体,同时检测出音量大小;当音频信号较小时,检测出人体的方位,将机器人移动方向发送给底盘,从而控制移动底盘向人体移动。