3B模型碾压英伟达谷歌后,Om AI端侧原生VLX模型:小参数实现物理世界精准感知

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
3B模型碾压英伟达谷歌后,Om AI端侧原生VLX模型:小参数实现物理世界精准感知
8826点击    2026-08-06 16:06

具身智能圈,又传来两条重磅消息。


刚刚,Om AI联汇完成数亿元融资,前海母基金领投。


同一天,该公司旗下全球首款端侧原生模型VLX-Seek 1.5宣布正式开源。


3B模型碾压英伟达谷歌后,Om AI端侧原生VLX模型:小参数实现物理世界精准感知


表面看,这是融资、开源两件事。


资本在下注一种新路线,开发者正在获得一个新入口。


但放在一起看,很难不让人想起20年前亚马逊AWS开启云计算时代的那一刻。


当年,AWS一边全面开放API吸引海量开发者接入,一边获得资本投入验证路线价值。


最终,云计算没有成为简单的服务器租赁生意,而是演变成一套新的基础设施范式。


如今的物理AI,也在寻找自己的「原生时刻」


Om AI联汇定义了一种怎样的范式?在物理AI的全局坐标轴中,它处于什么位置?


全球物理AI,图谱更新


过去几年,AI行业的竞争经常围绕更大的模型、更多的数据、更强的云端算力展开。


从大语言模型到多模态模型,参数规模一度成为衡量能力的重要指标。


但当AI走向真实世界,机器人面对的不是一张张静态图片,也不是一次次文本问答。


它需要在工厂、仓库、家庭、户外等复杂环境中持续运行。


这时,竞争规则也发生了变化。


决定模型价值的不再只是参数量,而是几个更加现实的问题:


响应延迟够不够低?端侧算力能不能承受?部署成本能不能规模化?设备能不能脱离云端独立运行?


因为在物理世界里,每增加一台机器人、无人机或智能终端,都意味着真实的硬件成本、能源成本和维护成本。


如果我们把今天全球物理AI模型的路线放在一张地图上会发现,围绕「如何让AI理解并行动于物理世界」这一大命题,全球玩家正在形成几条不同方向。


NVIDIA Cosmos选择的是「云端世界模型」路线


它的核心目标,是帮助AI理解物理环境,通过世界模型能力构建更加丰富的空间认知基础。


Physical Intelligence的π系列,则探索「云端通用机器人策略模型」,希望通过大规模训练让机器人具备跨任务泛化能力。


Google Gemini Robotics则沿着「云端VLA」方向推进,将语言理解、视觉感知和机器人动作连接起来,让机器人能够根据自然语言完成任务。


而另辟蹊径的Tesla Optimus,更强调模型与机器人本体之间的闭环,通过自有硬件平台推动机器人能力迭代。


这些路线并没有谁绝对领先。


它们分别回答了不同问题:如何让AI理解世界?如何让机器人获得通用能力?如何让模型与硬件协同?


但在这张图谱里,有一个关键坐标此前并未有过专门的回答,那就是:


如何让一个AI模型从诞生开始,就适应端侧环境?


这是Om AI联汇想填补的位置。


其自研的VLX端侧流式多模态模型系列强调「端侧原生」路线,它不依赖云端大算力,也不绑定单一硬件平台。


模型也并非先在云端训练完成,再被压缩部署到设备。


而是在模型设计阶段,就把端侧算力、延迟、功耗和部署成本作为约束条件。


这两者看似只是部署方式的不同,本质上却是两种不同的技术哲学。


前者是在问:如何让一个强大的AI模型跑到设备上?


后者是在问:如果AI生来就在设备上,它应该长成什么样?


这也是「端侧部署」和「端侧原生」最大的区别。


毕竟机器人真正进入千家万户、进入大量工业场景,不可能永远依赖远端的云端大脑。


当前,在全球物理AI模型竞争版图中,端侧原生正在成为一个新的关键方向。


而Om AI联汇最先看到图谱上的缺口,用VLX补上了。


拆解“端侧原生第一家”


对于「端侧」的探索,不少AI模型很早就展开了。


大家都清楚,云端大模型虽然强大,但也有天然限制。


机器人如果每一次感知都需要上传云端,再等待结果返回,就像让一个人在运动时,每个动作都要先打电话询问远方的大脑。


网络延迟存在,数据传输成本存在,隐私问题也存在。


但工厂里的机器人,需要全天候工作;巡检无人机,需要在没有稳定网络环境的地方执行任务;家庭机器人,需要保护用户隐私。


这些场景决定了,物理AI不能永远依赖云端大脑。


业内之前的解决方案通常是:先训练一个大模型,再通过压缩、蒸馏、量化等方式,让它适配端侧。


这种「迁移式部署」的方式,模型本身仍离不开云端,只是努力让自己「变得更轻」。


Om AI联汇想彻底打破限制。


3B模型碾压英伟达谷歌后,Om AI端侧原生VLX模型:小参数实现物理世界精准感知


VLX从模型架构层就开始考虑端侧环境,把延迟、功耗、算力、部署成本作为设计前提,而非优化目标。


也就是说,模型不是一个被迫「减肥」的大模型,而是一个天生适合端侧环境的AI。


这个区别决定了物理AI能不能大规模、快速地走出实验室。


端侧原生带来的价值是直接的:更快响应、更低成本、更强自主性,以及让物理AI进入工厂、家庭、无人机巡检、智能终端。


而这种大规模落地要求模型具备本地理解能力、持续交互能力和低成本部署能力。


这也是为什么端侧原生并非一个营销概念。


它实际上代表了一条新的架构路线,决定着未来物理AI如何进入千千万万个真实设备。


不过,路线判断最终需要技术验证。


一个面向端侧设计的模型,是否真的能挑战更大的模型?


VLX-Seek 1.5:我能!


3B模型碾压英伟达、谷歌


VLX-Seek 1.5有3B、10B两个版本,参数规模都不大。


如果说端侧原生架构是其战略选择,那么流式多模态就是其以小搏大的战术优势。


传统VLM的工作流是这样的:摄像头拍一张照片,上传到云端,等待模型推理,返回结果。


这是典型的批处理模式,英伟达、Google等巨头的路线本质上都是这个逻辑。


由此带来的问题则是延迟高、带宽依赖大、隐私不可控。并且,它把物理世界的连续感知切割成了一帧帧的静态快照。


VLX-Seek 1.5的流式多模态架构完全不同。


它接收的是视频流持续输入,在端侧实时理解,动态输出决策。三层心智链路构成了完整闭环:


  • Flow=持续注意力,让模型从看不见到看得清;
  • Seek=精细推理,让模型从看不准到看得准;
  • Go=执行控制,让模型从动不了到自主行动。


3B模型碾压英伟达谷歌后,Om AI端侧原生VLX模型:小参数实现物理世界精准感知


从「拍照识别」到「视频流理解」的范式变化,反向验证了同参数级别能赢巨头的关键,不在参数,而在架构。


在VLX-Seek 1.5公开的评测中,Om AI联汇测试了3B和10B两个版本,覆盖通用目标检测、指代表达理解、无人机视角感知、具身空间推理以及目标幻觉等多个方向。


同场比较的模型,不仅包括自家上一版的VLX-Seek,还有英伟达的LocateAnything等检测增强型VLM,以及多个更大的开源或闭源模型。


结果显示,VLX-Seek 1.5不仅提升了细粒度视觉理解能力,同时在无人机定位、具身设备空间推理等场景中展现出竞争力。


其中,最具代表性的,是3B参数版本与同规模模型(LocateAnything-3B)的比较。


在通用检测任务中,VLX-Seek 1.5-3B在LVIS Mean指标(衡量开放集定位模型对上千种物体,包含大量稀有物体的框选能力)达到57.5,相比LocateAnything-3B(50.7),提升13.4%。


3B模型碾压英伟达谷歌后,Om AI端侧原生VLX模型:小参数实现物理世界精准感知


这意味着,在复杂长尾目标识别中,小参数模型并没有因为规模限制而退化。


在更接近真实交互的指代表达理解任务中,VLX-Seek 1.5-3B在RefCOCOg test Mean(语言描述定位目标物体)达到80.2,相比LocateAnything-3B,提升3.4%。


简单来说,人类说一句:找到那个靠近桌角的小盒子。


模型不仅要识别盒子,还要理解空间关系。这考验的不是单纯视觉能力,而是视觉和语言之间的深层关联。


真正拉开差距的是无人机视角场景。


对于无人机来说,目标往往非常小、距离远、视角高、环境复杂。传统模型很容易出现漏检或者误判。


而在RefDrone测试中,VLX-Seek 1.5-3B的F1指标达到73.2,相比LocateAnything-3B的52.3,提升40%。


实例准确率Acc达到58,相比LocateAnything-3B(35.6)提升62.9%。


3B模型碾压英伟达谷歌后,Om AI端侧原生VLX模型:小参数实现物理世界精准感知


这些结果说明,在极端视角和小目标场景下,端侧原生架构正在展现不同于传统路线的效率优势。


VLX-Seek 1.5验证了一件事:巨头路线依靠更大规模解决问题,但端侧原生路线通过更适合物理世界的架构,也能提高单位参数价值。


不过,在实际部署时,仅有强识别能力还不够。


模型最大的风险是「过于自信」。


对于聊天机器人,有时候过于自信的结果,就是给出一次错误的回复。


但对于机器人、无人机和安防系统,模型的一次错误判断可能直接触发错误动作,对真实世界安全造成不可挽回的影响。


为了解决这个问题,VLX-Seek 1.5引入目标幻觉指标,用于衡量模型是否会产生不存在目标的误报。


该指标定义为:Object Hallucination = FP/Number of GT Objects。


其中,FP代表针对实际不存在请求目标产生的假阳性检测,数值越低,说明模型产生的目标幻觉越少。


在RefDrone目标幻觉评测中,VLX-Seek 1.5的FP/GT为18,而LocateAnything-3B为71.3。


3B模型碾压英伟达谷歌后,Om AI端侧原生VLX模型:小参数实现物理世界精准感知


这意味着,在同等条件下,VLX-Seek 1.5能够显著减少错误目标判断。


它选择了一条不同的智能路线:不强行给答案,且在信息不足时,敢说「我不知道」。


拒绝识别,并不是模型变弱。恰恰相反,知道什么时候说不知道,反而才是智能走进真实物理世界的重要标志。


在安防机器人、无人机巡检等高可靠场景中,乱报警可比漏报危险得多。


融资、开源与商业化


资本对范式投票,往往比技术社区的判断更早。


Om AI联汇此次完成数亿元的融资,释放的信号很明确:资本市场开始为端侧原生范式定价。


类比云原生早期,投资人押注的,也不是某一款PaaS产品,而是范式迁移本身。


而Om AI联汇要做「定义标准」的那个。


这与Kubernetes的逻辑一致:不靠售卖标准赚钱,靠免费把标准做成行业共识。


当全行业都遵循这套标准,定义方的云基础设施、托管服务就获得巨大商业增益。


目前,VLX-Seek 1.5的这套能力已向开发者开放。


当越来越多的开发者接入VLX-Seek 1.5,这套模型在更多真实场景被验证,数据反馈、持续迭代。


飞轮一旦转起来,生态位就稳了。


VLX-Seek 1.5开源,本质上是在争夺未来物理AI的基础能力标准的定义权。


除了模型本身,OmAI联汇也在基于VLX模型基座构建更大的端侧智能生态。


其「一脑多形」智能体平台OmAgent,试图推动AI走进物理世界。


在具身场景的商业化验证上,OttoPlex御行已经落地


3B模型碾压英伟达谷歌后,Om AI端侧原生VLX模型:小参数实现物理世界精准感知


消费端,OttoBox携手联想、苹果推出AI PC「OttoBox AI Studio」。


同时,其自研可穿戴AI视觉中枢Homer AI,已经服务全国近10万视障用户,平台月均AI调用达到千万次。


3B模型碾压英伟达谷歌后,Om AI端侧原生VLX模型:小参数实现物理世界精准感知


这些探索,表明Om AI联汇并不只是想成为一家模型公司,更希望成为端侧原生智能时代的基础设施提供者。


从云计算到云原生,产业真正的跃迁从来不是简单堆算力,而是找到更适合新世界的架构。


如今,物理AI也走到了类似节点。


融资,是资本对新路线的投票。开源,是生态对新范式的第一次接入。


当模型开始离开云端,进入千千万万个真实设备,端侧原生或许会成为物理AI走向规模化的关键答案。


下一场竞争,不只是大模型之争。


未来真正拥有最大价值的,也未必是参数最多的模型,而是那个让机器人、无人机和智能终端真正规模化运行的基础设施。


文章来自于"量子位",作者 "田晏林"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md