主动理解物理世界:ROMA让机器人学会交互探索物体
主动理解物理世界:ROMA让机器人学会交互探索物体人大高瓴 GeWu-Lab、智源研究院与燧行 AresoX 等机构提出 ROMA,构建 ROMI-2K、ROMA Bench 及 ROMA-7B,使机器人融合视听触力主动探索物体,并在 ROMA Bench 上以 72.9% 总体任务成功率基本追平 GPT-6 Astra。
搜索
人大高瓴 GeWu-Lab、智源研究院与燧行 AresoX 等机构提出 ROMA,构建 ROMI-2K、ROMA Bench 及 ROMA-7B,使机器人融合视听触力主动探索物体,并在 ROMA Bench 上以 72.9% 总体任务成功率基本追平 GPT-6 Astra。
近日,OpenAI Codex产品负责人Alexander Embiricos与开发者体验负责人Romain Huet做客Peter Yang的播客,围绕Codex团队的产品开发实践、产品规划、AI对职业的重塑,以及团队协作与招聘理念等核心问题展开了深度对话,还提到了前段时间加入OpenAI的龙虾之父Peter Steinberger。
近日,OpenAI Codex 产品负责人Alexander Embiricos和OpenAI 的开发者体验(Developer Experience)负责人Romain Huet 一起做客播客,聊了不少 Codex 背后的故事。
近期,FlashLabs 发布并开源了其实时语音模型 Chroma 1.0,其定位为全球首个开源的端到端语音到语音模型。Chroma 1.0 发布之后,便在社媒爆火,吸引了大量的关注。X 上的官推帖子已经突破了百万浏览量。
Louis Amira,Stripe 前加密货币与 AI 合作伙伴关系负责人,和 David Noël-Romas,Stripe 前加密货币工程负责人,刚刚为他们的新创公司 Circuit & Chisel 筹集了 1920 万美元。他们的第一个产品是 ATXP 协议,Louis 将其描述为"AI agent 支付领域的 HTTP"。
国内知名“果链”公司立讯精密,被曝与OpenAI达成协议,共同打造未来的OpenAI硬件。The Infromation消息,OpenAI盯上了苹果优选的“果链”企业,如立讯精密、歌尔等,为它酝酿已久的AI新硬件做准备。
Chroma,一家致力于为移动设备打造新型音频视觉娱乐的初创公司。
为应对公司在大规模文本、图像等非结构化数据处理上的业务增长需求,笔者着手调研当前流行的开源向量数据库。主要针对查询速度、并发度和召回率这几大核心维度进行深入分析,以确保选定的数据库方案能够在实际业务场景中高效应对大规模数据检索和高并发需求。通过全面对比不同数据库的表现,得出可靠的调研结论。
当前,多模态大模型 (MLLM)在多项视觉任务上展现出了强大的认知理解能力。 然而大部分多模态大模型局限于单向的图像理解,难以将理解的内容映射回图像上。 比如,模型能轻易说出图中有哪些物体,但无法将物体在图中准确标识出来。 定位能力的缺失直接限制了多模态大模型在图像编辑,自动驾驶,机器人控制等下游领域的应用。针对这一问题,港大和字节跳动商业化团队的研究人员提出了一种新范式Groma