摘要
本申请实施例提供一种基于动态结构感知的跨模态知识蒸馏方法及系统,通过接收目标任务数据集,从目标任务数据集中划分得到训练集,将训练集输入至预设教师模型和预设学生模型得到文本特征和视觉特征;基于模型之间的参数规模差异实时确定结构差异指标,基于结构差异指标得到投影矩阵;基于实时的投影矩阵得到对应的传输矩阵,并提取预设教师模型的注意力分布信息,基于注意力分布完成预设教师模型至预设学生模型的知识蒸馏并对目标任务数据集进行语义分割,得到语义分割结果。该方法有效解决了不同深度的网络模型之间难以对齐方面的不足,显著减少用于处理目标任务的模型的体量。