摘要
本申请实施例涉及人工智能领域,提供一种多轮实时多模态大模型交互方法、相关装置及存储介质,多轮实时多模态大模型交互方法包括:将第一目标音频转换为文本,得到第一目标任务描述文本;基于第一目标视频确定第一关键帧图像集合;对第一关键帧图像集合中的各个关键帧图像进行图像分割,得到第一关键帧图像集合中各个关键帧图像的图像分割结果,图像分割结果包括多个图像分割区域和对应的区域标签;基于目标多模态大模型处理第一目标任务描述文本和第一关键帧图像集合中的各个关键帧图像的图像分割结果,得到第一输出文本;将第一输出文本转换为语音,得到第一输出音频。本申请能够提高多模态大模型交互的准确率。