AI资讯新闻榜单内容搜索-Diffusion

Hallo-Live 让文本驱动音视频数字人迈入实时流式生成

最近，来自上海创智学院、复旦大学等机构的研究者提出了 Hallo-Live，试图正面解决这个矛盾。论文于 2026 年 4 月 26 日发布在 arXiv。该方法将异步双流扩散（Asynchronous Dual-Stream Diffusion）与人类偏好引导蒸馏（Human-Centric Preference-Guided DMD）结合起来

来自主题: AI技术研报

8873 点击 2026-05-24 10:20

扩散模型也有「Skills」了！魔搭开源11个现成模板，风格、修图、超清一键搞定

近期，专为Diffusion模型设计的插件框架——Diffusion Templates正式开源发布。这个框架能大幅降低可控生成技术的训练和使用难度，让开发者能够通过丰富的Templates来精准控制模型的生成结果。

来自主题: AI技术研报

9335 点击 2026-05-17 11:14

Siggraph 26 | 视频版Vision-Banana来了？大一统框架UniVidX刷新多项视频任务SOTA

近日，由香港科技大学 MMLab 及合作团队完成的研究工作「UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors」被计算机图形学顶级会议 SIGGRAPH 2026 正式接收。

来自主题: AI技术研报

10455 点击 2026-05-12 08:53

盛大AI研究院新作：流式生成超越非流式，一句话让虚拟人动作丝滑如真，推理延迟仅1帧

文本驱动的人体动作生成是游戏NPC、虚拟主播、机器人控制等实时交互系统的核心技术。

来自主题: AI技术研报

7025 点击 2026-04-14 14:58

扩散语言模型总是均匀发力，华为诺亚教它「抓重点」

这两年，扩散语言模型（Diffusion LLM）一直是个很有讨论度的方向。

来自主题: AI技术研报

6739 点击 2026-03-23 09:51

告别噪声初始化：NTU MARS Lab提出A2A新范式，实现机器人高性能单步动作生成

在机器人领域，扩散策略（Diffusion Policy）已经成为了标准模仿学习策略和 VLA 动作生成范式，但其「从随机噪声中迭代解噪」的机制带来了不容忽视的推理延迟。如果机器人不再从随机高斯噪声开始「盲猜」，是否可以基于「刚刚做了什么」来预测「下一步做什么」呢？

来自主题: AI技术研报

6750 点击 2026-03-20 09:39

复旦北大联合美团LongCat提出TDAR：用“粗思考，细求证”破解Block Diffusion的速度精度悖论

近期，复旦大学 NLP 实验室（FDU NLP）、北京大学知识计算实验室（KCL）联合美团 LongCat Team 提出了一种 Block Diffusion 推理模型 Test-Time Scaling 新框架 TDAR，通过引入 “粗思考，细求证” (Think Coarse Critic Fine, TCCF) 范式与有界自适应置信度解码

来自主题: AI技术研报

8351 点击 2026-03-14 08:39