摘要
本申请提供了一种图形用户界面的交互方法及相关装置,该方法包括:获取包括多个原则的指导原则集;根据指导原则集对原始智能体进行强化微调训练,得到用于执行图形用户界面操作的目标智能体;强化微调训练的过程包括:针对目标交互任务的目标交互轨迹的每一时间步,通过生成式奖励模型,根据指导原则集对原始智能体在时间步下输出的动作和思维链文本上下文进行评估,得到所述时间步下各原则对应的奖励分数;根据所述时间步下各原则对应的奖励分数确定总奖励,并根据总奖励对原始智能体的参数进行优化;基于目标智能体执行图形用户界面操作。本申请在智能体的训练过程中提供了更加精细且密集的奖励信号,有效提高了性能。