ECCV 2026 | 实时导演多镜头长视频! 港中文&快手可灵发布ShotStream
ECCV 2026 | 实时导演多镜头长视频! 港中文&快手可灵发布ShotStream为了打破多镜头长视频面临的高延迟、零交互困境,香港中文大学与快手可灵团队联合提出了首个实时流式多镜头长视频生成框架 ——ShotStream。该研究打破了传统双向架构的限制,将多镜头合成定义为基于历史上下文的下一镜头生成任务,用户可以通过动态流式提示词在运行时动态指导叙事走向!更令人振奋的是
搜索
为了打破多镜头长视频面临的高延迟、零交互困境,香港中文大学与快手可灵团队联合提出了首个实时流式多镜头长视频生成框架 ——ShotStream。该研究打破了传统双向架构的限制,将多镜头合成定义为基于历史上下文的下一镜头生成任务,用户可以通过动态流式提示词在运行时动态指导叙事走向!更令人振奋的是
本文发现图生视频(I2V)模型天然适合重构动态交互过程,并提出 SCPE(Self-Correcting Process Editing) 多智能体系统自纠错框架:利用视频生成过程暴露失败原因,再通过分析、反思和工具书更新迭代增强提示,使 I2V 模型在复杂 HOI 编辑中显著提升交互准确性与推理能力。
研究团队提出了 XG-Guard (eXplainable and fine-Grained safeGuarding framework), 一个基于 GAD 且兼具可解释性和细粒度检测能力的无监督安全防护框架。目前工作已被 ACL 2026 Main Conference 接收。
来自清华、上交、北邮的学者们提出了一个面向个性化幻灯片生成和多轮局部修改的记忆驱动Slides Agent框架——MemSlides。它专门针对AI PPT痛点而生,不仅能够为你量身定制私人专属的PPT生成风格,还能够贴心地记住你在制作过程中随口提出的新要求
乐鑫信息科技 (688018.SH) 推出 ESP-VISION,一款面向 ESP32-P4、ESP32-S31 以及 ESP32-S3 系列芯片的低代码边缘 AI 与机器视觉框架。ESP-VISION 基于 MicroPython 提供统一的 sensor、image、display、espdl 等 Python API,整合摄像头采集、图像处理、视频编解码、
但2026年春招里,她一口气投递了两百多家企业的市场、品牌岗,其中不乏头部互联网公司和4A公关公司,支撑她跨界的底气,是AI工具。改变始于2025年的一段外企实习。当时主管交给她一项任务:对全国3000家线下门店的销售数据做透视分析,输出用户画像报告。放在以前,纯文科背景的她根本接不住这样的需求,但那次她一边找行业案例参考框架,一边对着ChatGPT和Claude边问边学,
这个问题,在 AI 行业有一个专业的说法:无状态(Stateless)。而解决这个问题,正是 EverMind 过去一直在做的事情。今天,这个探索走到了一个新的节点:基于自研记忆系统 EverOS 的自进化Harness——Raven Agent 正式发布。
大语言模型在代码生成上的能力不断增强,但在复杂算法题,尤其是竞赛编程场景中,仍然容易因为算法选择错误、边界条件遗漏、复杂度判断失误或隐藏测试覆盖不足而失败。Solvita是一款面向竞赛编程的智能体框架,通过四个角色(Planner、Solver、Oracle、Hacker)形成闭环系统,并利用可训练的图结构知识网络积累经验。
现在的 AI Agent 动辄需要处理超长上下文,既要看系统提示词、工具说明,又要翻阅历史对话和检索文档。为了省钱、省算力并降低延迟,很多开发者会给系统加上 “提示词压缩”(Prompt Compression)模块,把冗长的上下文浓缩后再喂给大模型。
朋友,听说你还不会搭不会用Loop?别慌!现在直接来抄作业!有位大神直接在GitHub开源了整套Loop Engineering框架,目前已累计收获4.5k Star。Loop是最近爆火的概念,简单解释就是不用再像以前一样一次次输提示词指挥AI干活。