淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作
7014点击    2026-10-02 12:46

TaoMate-H3 是由阿里巴巴 TaoLive AIGC 团队研发的音视频联合流式生成模型。基于 MiniMax H3,TaoMate-H3 将三步 LoRA 推理与自回归生成相结合,能够根据文本描述,连续生成包含人物对白、歌声或环境音的视频,支持分钟级续写,以及 480p、768p、1080p 级横竖屏输出。


与整段视频反复去噪的生成方式相比,TaoMate-H3 以小片段为单位推进,每个片段仅需三步去噪,无需等待整段视频完成生成。这一方式显著缩短了首段内容的产出时间,也为直播讲解、虚拟角色表演和交互式视频应用提供了新的技术基础。


目前,TaoMate-H3 推理代码与 LoRA 权重已正式开放。开发者可通过 GitHub 和 Hugging Face 下载体验,在此基础上开展应用开发与流式生成研究。以下是本次发布的演示效果。


淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作


  • 开源代码: github.com/TaoLiveAIGC/TaoMate-H3
  • 模型权重: huggingface.co/TaoLiveAIGC/TaoMate-H3


什么是 TaoMate-H3?


TaoMate-H3 面向需要持续生成声音与画面的创作场景。用户可以用一条提示词描述完整场景,也可以按段安排台词、动作和情节;模型在保留历史上下文的基础上继续生成,使相邻段落共享人物、声音和场景信息。


这次发布主要围绕三个核心能力展开。


  • 三步流式生成,降低等待时间


通过少步 LoRA,TaoMate-H3 将每个小片段的去噪过程压缩为三步。模型优先完成当前片段,再生成后续内容,无需等待整个视频完成去噪。对于需要及时反馈的内容生产,这种逐段产出方式有助于缩短等待,并为边生成边播放提供基础。


  • 音视频联合生成,丰富人物与场景表现


TaoMate-H3 在同一生成过程中处理声音与画面,既支持人物讲话、歌唱和角色对白,也支持海浪、车辆运动、爆炸等环境与动作音效。声音参与模型的生成过程,为口型、表情和动作提供时间上的配合。


  • 分钟级连续续写,支持分段内容编排


借助持续更新的音视频 KV 缓存和分段音频引导,模型能够跨越提示词边界延续前面的内容。创作者可以逐段调整讲解重点或表演内容,组织更完整的商品介绍和角色叙事。


应用效果


  • 电商讲解:从商品展示到完整介绍


商品介绍通常包含外观展示、功能细节和使用场景等多个环节。TaoMate-H3 支持用分段提示词编排这些内容,在连续镜头中推进讲解,适用于商品短视频、选品介绍和品牌内容制作。


本次展示包含一分钟的竖屏背包介绍,以及横屏木梳讲解。两组案例呈现了不同画幅下的人物口播与商品展示效果,其中背包视频保留了完整的一分钟生成结果。


淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作


背包讲解


淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作


木梳讲解


围绕同一件商品,创作者还可以针对不同人群调整讲解内容,例如突出通勤收纳、旅行携带或日常使用等需求。分段编排让卖点顺序与台词节奏更容易控制,也便于制作不同版本的商品内容。


  • 演唱与角色表演:声音、表情和动作共同呈现


除了商品口播,TaoMate-H3 还支持包含歌声与音乐的表演场景。窗边演唱案例展示了写实人物的歌唱过程,将旋律、口型和身体动作组织在同一段视频中。


淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作


窗边演唱


  • 动漫对白:拓展风格化角色创作


音视频联合生成同样适用于动漫内容。在月夜少女与白狐的案例中,风格化的人物、场景与角色对白共同构成了一个短剧情片段。创作者可以通过提示词设定角色形象、环境氛围与台词,再逐段推进故事情节。


淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作


月夜少女与白狐


  • 环境与特效:让场景拥有自己的声音


TaoMate-H3 的生成范围还包括没有人物对白的场景。日落海岸案例以海浪和环境原声表现空间氛围;电影爆炸案例则将人物运动、建筑爆炸与冲击音效结合起来,呈现更强烈的视听节奏。


淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作


日落海岸与海蚀拱门


淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作


人物向前,身后建筑爆炸


这些案例覆盖了商品讲解、人物演唱、动漫对白、风景与电影特效等不同内容类型。模型提供横竖画幅和多档分辨率,便于适配移动端内容与横屏展示。


TaoMate-H3 整体流程


从提示词到最终视频,TaoMate-H3 的推理流程主要包含四个环节:


  • 分段组织内容:根据目标时长读取提示词序列,确定每个段落的场景、动作和声音描述。
  • 准备音频引导:为当前段落生成音频去噪轨迹,并利用上一段尾部的声音信息衔接音色与语气。
  • 联合流式生成:将段落拆成小片段,每个片段执行三步音视频去噪,并持续更新历史 KV 缓存。
  • 解码输出:生成的 latent 通过 VAE 解码为画面与声音,完成媒体输出。公开推理入口会自动运行整套流程并保存最终视频。


其中,latent 是模型生成过程中使用的音视频压缩表示。模型先在这一表示空间中完成生成,再通过解码得到可观看、可收听的内容。


TaoMate-H3 关键技术


  • 三步 LoRA:减少每个片段的生成开销


TaoMate-H3 通过少步 LoRA 适配,将流式推理压缩到三个去噪区间。在当前五秒提示词配置下,每个段落分为四个 chunk,主体 chunk 约为 1.4 秒,尾部片段较短。模型依次完成这些片段,并利用历史上下文继续生成。


三步更新沿 0→16→33→49 的时间状态推进。每个片段完成后,模型基于最终生成的音视频状态更新 KV 缓存,供下一片段使用。少步生成减少了反复迭代的计算量,分块处理则使模型能够更早产出第一段内容。


Self Forcing:面向连续续写的自回归训练


在训练阶段,TaoMate-H3 采用 Self Forcing 的自回归训练思路,让模型以自身生成的历史片段为条件,继续生成后续内容。这使训练过程能够接触实际续写中的历史状态,缓解仅依赖真实历史训练所带来的训练与推理分布差异。


淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作


https://arxiv.org/pdf/2506.08009


这一训练方式与少步推理、KV 缓存共同构成了流式续写的基础:模型既学习当前片段的生成,也学习如何利用此前的输出延续人物、动作和场景。


  • 音视频 KV 缓存:支持长视频连续记忆


为维持长视频的一致性,TaoMate-H3 持续复用音视频 KV 缓存,将已生成内容的上下文传递给后续片段。人物状态、近期动作和声音信息因此能够随时间延续,在切换提示词时仍参与后续生成。


缓存采用「起始视觉参照 + 近期音视频上下文」的组织方式。起始参照保留人物与场景的初始信息,近期上下文随生成进度滚动更新,使模型能够跟随最新的动作与声音继续创作。


这种方式将历史缓存控制在固定规模内,避免其占用随视频时长不断增长,为分钟级连续生成提供了稳定的上下文支持。


  • 连续时间编码:改善跨提示词衔接


在长视频中,提示词可以变化,媒体时间线仍需连续。TaoMate-H3 使用全局连续的 RoPE 位置编码,随音视频进度移动当前文本的时间坐标,并将文本右边界对齐到当前媒体的起点,使新提示词对应正在生成的内容。


切换提示词时,系统保留已有音视频 KV,同时区分新生成内容与编解码所需的尾部上下文。历史内容仅用于衔接,不重复生成。针对长时间续写中的亮度和色调变化,模型还以首个片段的视觉统计为参照,对后续视频 latent 进行均值与方差对齐,减轻画面观感的漂移。


  • 音频轨迹引导:稳定台词节奏与音色


流式生成将视频拆成了短片段,但一句台词的停顿、语速和结束位置需要在完整段落内安排。TaoMate-H3 在内部先准备覆盖当前提示词段落的音频去噪轨迹,再将对应时间位置的音频 latent 用于引导各个小片段,使局部生成始终具有段落级的声音参照。


三次去噪更新分别对齐音频轨迹中的三个状态,最终音频 latent 与引导轨迹的干净终点保持一致。音频引导贯穿生成过程,有助于稳定台词的展开节奏,减少短片段续写时的重复起句。


为衔接不同段落的音色与语气,系统将上一段最后约一秒的干净音频作为只读参考。新音频在这一参考下继续生成,参考本身保持不变;最后统一解码各段音频 latent,得到连续的声音输出。


性能表现


在同一台 8 × NVIDIA H20 96 GB 机器上,我们对原版 MiniMax H3 与 TaoMate-H3 进行了测试,输出均为 480 × 864、十秒视频。


TaoMate-H3 的纯 DiT 计算耗时由 169.572 秒降至 14.810 秒,加速 11.45 倍;首段最终 latent 的就绪时间由 170.052 秒缩短至 6.148 秒,加速 27.66 倍。首段 latent 就绪对应模型完成第一段生成、可交给 VAE 解码的时间。


淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作


在上述十秒配置下,TaoMate-H3 共生成八个小片段,执行 24 次生成前向和 8 次 KV 更新。单机八卡采用 TP2 × Ulysses4 并行,并结合高效注意力、算子融合及部分线性层的选择性低精度计算,降低推理开销。


这些优化既提升了整段内容的生成效率,也缩短了首段内容的产出时间,为分块解码、播放和交互应用开发提供了基础。


快速体验


  • 环境与硬件


项目支持 Linux、Python 3.10/3.11、CUDA 12.8 与 PyTorch 2.8,提供单机 4 卡或 8 卡推理入口。已验证的运行配置为 8 × H20 96 GB,完整安装步骤见仓库 README。


  • 运行示例


  • 获取代码:git clone https://github.com/TaoLiveAIGC/TaoMate-H3.git cd TaoMate-H3


按照 README 完成环境安装和 MiniMax H3 基础权重下载后,即可运行仓库内的十秒示例。TaoMate-H3 LoRA 权重会在首次使用时自动下载:


python -m taomate_h3 \

  --model-root models/MiniMax-H3 \

  --prompt-json examples/prompts_10s.json \

  --duration 10\

  --resolution 768x1376 \

  --gpus 8\

  --output outputs/demo_10s


结果保存在 outputs/demo_10s/video.mp4 。替换提示词文件即可修改场景、台词与动作;通过时长和分辨率参数,可以进一步生成更长的视频或切换横竖画幅。


  • 开源与后续计划


本次发布包含推理代码、LoRA 权重及示例提示词,欢迎开发者下载体验,也欢迎围绕流式推理、音视频生成和应用集成与我们交流。


项目基于 MiniMax H3,遵循 MiniMax H3 Community License。感谢 MiniMax H3 及相关开源工具的贡献者。


团队仍在持续优化推理速度,进一步缩短首段内容与后续响应的等待时间。我们也计划在不久的将来陆续发布并开源新的 FL2AV 流式模型,进一步拓展到 Ref2AV,并同步开放相应权重,支持更丰富的音视频创作方式。


期待与社区一起推进音视频流式生成,让这项技术走进更多实际的创作场景。


文章来自于微信公众号 “机器之心”,作者 “机器之心”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

2
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales