摘要
本公开提供了一种数据处理方法、装置、电子设备、介质及产品。该方法包括:确定第一训练对话数据集中多个第一训练对话数据的质量分值;将多个所述第一训练对话数据进行聚类分析,获得多个数据簇,每个数据簇中的第一训练对话数据的语义相似度符合相似度条件;根据多个所述数据簇,对多个所述第一训练对话数据进行多样性分析,确定多个所述第一训练对话数据的多样性分值;根据所述质量分值以及所述多样性分值,从所述第一训练对话数据集中筛选出符合预设条件的第二训练对话数据集,所述第二训练对话数据集用于模型训练,这样可以自动化筛选出更高质量和更高多样性的训练对话数据。