一种基于跨模态对齐机制的可控视频配乐生成方法
# 热门搜索 #
大模型
人工智能
openai
融资
chatGPT
验证码登录
×
发送
登录即代表您已同意AITNT
用户协议
和
隐私政策
登录
登录成功后会自动刷新界面
AITNT公众号
AITNT APP
AITNT交流群
搜索
未登录
首页
AI中心
退出
首页
AI资讯
AI技术研报
AI监管政策
AI产品测评
AI商业项目
AI产品热榜
AI 源力市场
寻求报道
一种基于跨模态对齐机制的可控视频配乐生成方法
申请号:
CN202510999352
申请日期:
2025-07-21
公开号:
CN120510556B
公开日期:
2025-10-03
类型:
发明专利
摘要
本发明公开了一种基于跨模态对齐机制的可控视频配乐生成方法,该方法通过解构视频内容得到具有明确语义与构图属性的对象区域的面积、起始位置、色彩和运动向量特征,并通过特定的编码使上述特征能够进行融合,使得用户能够主动引导模型关注视频中的特定画面区域(如人物、动作、色彩)或实现音乐风格(如情绪、节奏)的定制调整,能够实现个性化创作,还能够在在时间维度(如镜头切换、动态节奏)和空间维度(如画面构图、主体位置)的联合建模,使得音乐在情绪变化与节奏动态方面与视频内容精准匹配。
技术关键词
配乐生成方法
音乐特征
跨模态
运动向量
面积特征
编码
视频
色彩
镜头
融合特征
对象
注意力机制
序列
语义
动态
图片
三通道
红绿蓝