摘要
本申请涉及一种模型训练方法、查询方法、装置、服务器和存储介质。所述大模型训练方法包括:基于样本查询问题,从文档库中检索与样本查询问题相关的辅助文档;将样本查询问题、辅助文档和样本候选文档输入至初始生成式模型中,得到样本查询问题的样本回复信息;样本回复信息为初始生成式模型基于样本查询问题和辅助文档,确定样本查询问题对应的用户意图信息,并基于用户意图信息和样本候选文档输出的;根据样本回复信息,得到目标奖励;基于目标奖励和强化学习算法对初始生成式模型进行训练,得到目标生成式模型。采用该模型训练方法能够提高生成式模型输出的推荐内容的准确度。