基于合成文本和全局混合线性专家的视频描述生成方法
# 热门搜索 #
大模型
人工智能
openai
融资
chatGPT
验证码登录
×
发送
登录即代表您已同意AITNT
用户协议
和
隐私政策
登录
登录成功后会自动刷新界面
AITNT公众号
AITNT APP
AITNT交流群
搜索
未登录
首页
AI中心
退出
首页
AI资讯
AI技术研报
AI监管政策
AI产品测评
AI商业项目
AI产品热榜
AI 源力市场
寻求报道
基于合成文本和全局混合线性专家的视频描述生成方法
申请号:
CN202511032714
申请日期:
2025-07-25
公开号:
CN121033722A
公开日期:
2025-11-28
类型:
发明专利
摘要
本发明公开了一种基于合成文本和全局混合线性专家的视频描述生成方法,旨在通过创新的模型架构和数据构造策略,实现高质量的视频内容自动描述。本发明方法适用于视频辅助字幕系统、教育视频内容摘要或视频内容平台智能分析场景中,能够自动生成高质量的视频描述文本。其通过架构创新,在模型层面实现了首个全网络MoE化的Transformer框架,从而构建了全局混合线性专家模型,为视频描述任务构建了强有力的模型基础。该模型能够高效融合多模态信息与多样化内容特征,并为后续训练提供了良好的支持与扩展能力。
技术关键词
线性
文本
生成方法
视频编码器
关键帧
数据
融合多模态信息
定位文字区域
计算机电子设备
sigmoid函数
网络
局部时空特征
动态
风格
自动语音识别
场景
频率
参数
字幕系统