摘要
本申请提供适用于群聊的多模态交互方法及装置,其中所述适用于群聊的多模态交互方法包括:识别采集到的视频中的人物目标,并确定采集到的音频中的音源方向;根据所述音源方向,将所述音频中包含的音源与所述人物目标匹配,确定人物音源关系;对所述音频进行语义分析,并结合所述人物音源关系,构建交互综合信息;基于所述交互综合信息,与所述人物目标进行交互。显著拓宽了机器人交互的使用范围,能够应用于机器人与多人群聊的场景,使机器人能够区分每句话分别是场景中的哪个人说的,并且提供给机器人交互过程中充分的场景信息以及其它相关信息,从而使机器人能够充分理解交互内容,给出准确的、个性化的回复。