摘要
本申请公开了一种回复策略的输出方法,应用于大语言模型,大语言模型包括预先训练的价值函数,价值函数是基于历史输入数据、历史输入数据对应的历史回复策略,以及针对历史回复策略的用户响应数据训练得到的,用户响应数据与多个标签中的目标标签匹配,目标标签用于指示用户响应数据所对应的情感类别,包括:获取待处理的输入数据;对输入数据进行处理,生成回复策略;基于价值函数对输入数据和回复策略进行处理,得到回复策略属于多个标签中的每个标签的概率;基于回复策略属于每个标签的概率和回复策略,确定目标回复策略并输出。这样可以有效降低计算成本。