多模态AI驱动的短视频自动翻译与语音合成系统

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
多模态AI驱动的短视频自动翻译与语音合成系统
申请号:CN202511107005
申请日期:2025-08-08
公开号:CN120856930A
公开日期:2025-10-28
类型:发明专利
摘要
本发明公开了多模态AI驱动的短视频自动翻译与语音合成系统,本发明涉及音视频技术领域,涵盖视频获取、处理、翻译及合成等模块;视频获取端接收用户提交的各类音视频数据并检测违规内容;初步处理端对合规数据识别格式、转码、分离音频视频流,进一步分离人声与背景音;视频翻译端提取人声信号生成目标语言文本,结合韵律特征和人声模组生成音频流并与背景音拟合;视频合成端对视频帧提取唇部图像帧序列,按音频帧序列生成匹配唇部顶点位移坐标并渲染,最终将音视频同步序列压缩封装输出;各模块运用多种AI技术,实现短视频的自动翻译与语音合成,提升跨语言视频内容的生成效率与质量。
技术关键词
音视频 音频 序列 人声 视频帧 韵律特征 模组 视频流 翻译语言 图像 数据 语音 文本 编码规则 机器翻译模型 非标准格式 信号