摘要
本发明提供了一种信息推荐方法、系统、设备及介质,属于计算机领域,其方法包括如下步骤:获取用于信息推荐的基本数据,通过基本数据构建多模态知识图谱;获取用户选择的多模态知识图谱的初始状态s,在用户和物品对之间,使用策略网络的分层注意力机制计算用户邻接邻居的注意力权重,再使用值网络的ReLU层和TanH层生成一个动作a,智能体通过动作a与多模态知识图谱进行交互,并产生奖励r作为反馈信号,智能体根据反馈信号为用户推荐候选物品。本发明能够将注意力集中在用户最感兴趣的物品上,降低强化学习中智能体与环境交互的复杂性,从而使强化学习行为空间的数量大大减少,快速准确的获得最有效的信息。