基于多粒度跨模态耦合的音频引导视觉分割方法及装置

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
基于多粒度跨模态耦合的音频引导视觉分割方法及装置
申请号:CN202510918328
申请日期:2025-07-03
公开号:CN120953601A
公开日期:2025-11-14
类型:发明专利
摘要
本发明涉及人工智能与多媒体技术领域,特别涉及一种基于多粒度跨模态耦合的音频引导视觉分割方法及装置,其中,方法包括:提取目标视频帧的多级视觉特征和音频梅尔频谱特征;对多级视觉特征和音频梅尔频谱特征进行模态内增强,以得到增强后的多级视觉特征和增强后的音频梅尔频谱特征;将增强后的多级视觉特征和增强后的音频梅尔频谱特征进行跨模态融合,以生成语义增强查询向量;利用语义增强查询向量对预先构建的Transformer注意力解码器进行训练,以生成像素级分割掩膜,并将像素级分割掩膜与多级视觉特征进行融合,以得到掩膜预测结果。由此,解决了现有视听分割方法存在模态内噪声干扰、音频引导不足、多源声音纠缠等问题。
技术关键词
视觉特征 频谱特征 跨模态 分割方法 时序特征 注意力 语义 多级特征 分割装置 噪声抑制 混合损失函数 音频特征提取 掩膜 图像分割模型 查询模型 视频帧 通道 解码器