最适合机器人的视频基座模型,被中国团队开源了
最适合机器人的视频基座模型,被中国团队开源了蚂蚁灵波选择了后一条路:开源 LingBot-Video。这是一个面向具身智能的视频生成基座模型,也是一套专为机器人场景设计的 DiT 视频预训练范式。通用视频模型更多学习画面变化、镜头运动和视觉风格;LingBot-Video 则把重点放在动作、任务、交互和物理环境变化上,面向世界预测、动作理解和机器人训练构建视频生成基座。
搜索
蚂蚁灵波选择了后一条路:开源 LingBot-Video。这是一个面向具身智能的视频生成基座模型,也是一套专为机器人场景设计的 DiT 视频预训练范式。通用视频模型更多学习画面变化、镜头运动和视觉风格;LingBot-Video 则把重点放在动作、任务、交互和物理环境变化上,面向世界预测、动作理解和机器人训练构建视频生成基座。
独家获悉,由上海人工智能研究院孵化的灵境智源已完成超亿元的天使轮和天使 + 轮两轮融资,由经纬创投领投,上海闵行国资战略跟投。在这之前,企业尚属“水下”状态,两轮均实现了超额认购。据透露,在未对外释放公开融资的消息的情况下,
6 月 30 日,深度机智团队发布论文 Human-as-Humanoid。他们在自研拟人机器人 PrimeU 上,实现了完全没有目标任务真机示范数据的情况下,仅凭从人类视频中转换而来的动作监督,零样本完成了倒水、放环、装袋、叠杯等复杂真实操作任务。
当机器人后空翻刷屏时,代表小脑已经在快速进展。但你是否意识到,让机器人真正干活卡脖子的从来不是小脑,而是大脑?蚂蚁灵波刚刚开源的LingBot-VLA2.0,用同一套模型「驯服」了20种的机器人构型。行业终于有人开始认真算重复适配成本这笔账了。
手术 AI 正在从 “单帧感知” 迈向 “全流程视频理解” 的全新时代!近日,由中国科学院香港创新研究院人工智能与机器人创新中心领衔,发布了全球首个十亿级参数、最大规模数据集练成的手术视频原生基础模型 ——SurgMotion!
VLA 大模型看似强大,却被一个致命弱点扼住喉咙——相机稍微挪动几毫米,操作成功率就能暴跌一半。招商局先进技术研究院下属实验室提出新的移动数据范式,首次在真实机器人系统上证明:让相机动起来采集数据,就能以极低成本破解 VLA 的空间泛化瓶颈,且效果普适于多种主流架构。被一个致命弱点扼住喉咙——相机稍微挪动几毫米,操作成功率就能暴跌一半。
General Intuition 做的事听起来有点绕:用游戏数据训练现实世界里的 AI Agent。换成更直白的话说,General Intuition 做的是让 AI 先在游戏里学会“怎么行动”,再把这种能力迁移到机器人、无人机、自动驾驶、仿真环境里。
近日,深穹星核正式发布首款高仿真人脸机器人 Nova S1,搭载 VLIA 一体化端侧交互大脑,面向家庭、日常交互与协作场景。继上周天使 4 轮融资后,公司再次完成新一轮数千万元天使 5 轮战略融资,持续加码意图理解与情感交互技术的研发落地。
7月6日,至简动力宣布,其首款全场景机器人i7 Pro完成首批百台交付。这也是具身智能行业最快的百台交付纪录,用时不到一年。当天,至简动力全球首个CNC智能化具身机器人产线也同步亮相。
UC Berkeley团队提出的端到端流程旨在解决该问题,研究团队跑通了首条能够从网络视频生成真实灵巧手实机执行轨迹的完整链路:先从真实场景中的单目RGB视频中重建4D手-物交互过程,再将这些交互轨迹重定向到拥有22个自由度的Sharpa Wave灵巧手上。