摘要
本发明属于机器人抓取技术领域,公开了一种基于多模态融合与强化学习的复杂场景抓取方法及系统,包括获取用户的语言指令和抓取场景RGB图像;基于语言指令和抓取场景RGB图像,获得文本特征、图像特征、位置特征和抓取特征进行特征;基于交叉注意力机制,对文本特征、图像特征、位置特征和抓取特征进行特征融合操作,获得交叉注意力特征;将交叉注意力特征作为状态空间,抓取位姿作为动作空间,将抓取序列规划问题建模为马尔科夫决策过程,采用强化学习方法进行求解,获得最终的复杂场景抓取模型。本发明通过多模态联合建模与预训练模型先验融合,不仅提升了机器人在面对复杂环境中的适应能力,还显著提高了方法的泛化性和现实世界中的执行效果。