深度|Physical AI的数据之争:际数押注质量基础设施,下一个千亿级机会

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
深度|Physical AI的数据之争:际数押注质量基础设施,下一个千亿级机会
8685点击    2026-08-04 11:03

深度|Physical AI的数据之争:际数押注质量基础设施,下一个千亿级机会


导语


无论是李飞飞教授持续强调的空间智能,还是黄仁勋在演讲与行业峰会中反复描绘的Physical AI,2026年的科技产业正在传递一个无比明确且强烈的信号:AI正在跨越纯软件与数字比特的边界,全面走向真实的物理世界。


回顾人工智能发展史,技术范式的每一次跃迁,都遵循着一条清晰的产业共性规律:每一轮AI技术架构与应用场景的迁移,都不只带来模型架构的变化,也会在数据层沉淀出新的基础设施机会。模型能力越复杂,行业对于数据规模、质量、结构和生产效率的要求也越高。大语言模型时代,Scale AI、Mercor这类超百亿美金独角兽的跑出已经验证了这一规律。


这一次,Physical AI时代,属于数据的下一个基础设施级的机会在哪里?


01 Physical AI的数据之争,真正的变量是质量


不同公司给出了截然不同的答案,尤其是具身领域,数据的路线正处于一种高度分化、尚未达成共识的状态,有人赌仿真合成,有人押注真机,还有人主张第一人称数据,各类流派各执一词。


然而,在际数科技CEO周源看来,这种喧嚣恰恰掩盖了行业当下最大的集体盲点。绝大多数人都在争论数据的类型与规模,却忽略了那个最为根本的问题——数据质量。现实情况却是,单纯依靠堆数量的粗暴逻辑正在失效——模型架构定义了智能边界,数据质量则决定了智能上限。他的判断是:“人工智能终究要进入物理世界,而进入物理世界,必然需要极高质量的空间数据作为底座。”


所以,际数科技从创立之初便选了一条不同的路,锚点不是某条具体路线,而是打造高质量的空间数据模型。


这种立足于“质量”的战略选择,恰恰精准地预判并切中了整个AI产业演进的底层规律。回顾大语言模型与自动驾驶的演进史,一条清晰的商业与技术规律已被反复验证:行业早期必然依赖规模效应完成冷启动,但在向高阶泛化能力迈进的后半程,决定胜负的必然是数据质量。


这种从“追求数量”向“追求质量”的范式转移,在LLM时代的数据独角兽身上已经给出了最直观的案例验证:早期以Scale AI为代表的标准化数据平台率先完成规模化跑通,并以290亿美元估值被Meta收购了近一半股份;随着通用模型向高阶推理与专家能力演进,通用粗标注边际效益递减,专注于高阶专家数据精细对齐的Mercor迅速爆发,两年估值飙涨80倍,已经达到200亿美元。这是行业发展的必然,Physical AI领域也不会例外。


既然“高质量”已成必选项,那么接下来的关键问题便是:谁有能力来定义并生产这种极高标准的三维空间数据?这也是际数科技敢于切入这一赛道的核心底牌——团队深厚的测绘基因


他们朴素地意识到,测绘这门学科百年来不断精进的核心本质,就是通过严密地评价误差、精准地描述空间的确定性,从而将杂乱无章的现实世界转化为绝对可靠的数据表达。当AI面临从数字世界向复杂真实物理世界跨越的痛点时,这套原本用于丈量世界的测绘技术与评价体系,恰恰能在Physical AI(空间智能)的数据治理中发挥不可替代的底层作用——用测绘级的精度,重新定义空间数据的底座。


循着这一底牌与技术脉络,际数科技在当前的产业链条中,找到了一处极其精准且克制的生态卡位,成为在“场景方”和“本体/大脑厂商”之间,打造真实世界数据进入模型前的质量基础设施。


02 高质量空间数据,首先是一场流程革命


现阶段高质量空间数据的瓶颈,不是简单地体现在数据量不足,而是原始数据规模与真正可用的高质量数据规模不成比例。在周源看来,在真实的物理世界中,数据中的时空对齐偏差与空间几何失真,会导致这种误差在机器人的感知与控制闭环中被同比例甚至几何级放大——就像自动驾驶早期因2D标注缺乏三维空间一致性,引发了屡见不鲜的“幽灵刹车”一样。


既然堆叠规模无法解决物理世界的误差,那么行业真正需要的,是一套能够从源头控制数据纯度的系统性工程。针对这一诉求,际数科技从链路、标准到底层架构,进行了彻底的重构。


传统的数据生产流程是“先采集、后加工、最后质检”的串行模式。周源的判断是,这种模式在Physical AI时代存在致命的滞后性——问题发现得太晚。一旦前期的场景选择偏离任务需求,或采集过程出现传感器错位,后期加工再精细、质检再严格,也无法挽回这批数据的价值。


际数科技由此对传统流程进行了重构:以客户的模型任务为起点,把数据的质量问题前置,先判断什么场景值得采、什么数据真正影响模型能力,再据此定义质量标准并指导采集。数据进入系统后,则按照统一的时空关系进行组织,在生产过程中持续完成评估、问题定位与修复。到了资产沉淀环节,每一批数据还会保留场景标签、质量记录和版本信息,以支持伴随客户模型升级重新筛选与二次生产。


深度|Physical AI的数据之争:际数押注质量基础设施,下一个千亿级机会

多模态数据处理流程,quality-aware模型感知场景内的可靠锚点,经由4D重建形成时空自洽的多模态传感数据关联,进而促进下游仿真生成任务的处理效率和处理效果


这意味着,数据生产不再是一条采完即结束的流水线,而是围绕模型任务持续迭代的质量工程。为了支撑这套工程体系,际数将高质量数据进一步拆解为八个维度:场景质量、采集质量、多模态质量、监督质量、片段质量、跨本体质量、质量解释和资产质量。


其中,最难解决的并不是某一条数据是否达标,而是场景质量和场景多样性。机器人数据采集很容易陷入一种“规模幻觉”:数据量迅速增加,但真正影响模型泛化能力的长尾场景依然没有被覆盖。因此,际数科技得出了一个关键的核心判断:数据质量的评价,绝不能孤立地只看单条数据是否合格,而必须将其置于具体的应用上下文中,看它对当前的模型任务是否真正具备提升价值。


为了支撑起如此庞大且精细的高质量数据工程,际数科技在底层构建了一个独特的核心引擎——高质量空间数据模型


不同于机器人大脑模型不同,这个数据模型所学习的对象,是数据中的残次、偏差与质量问题。它的核心能力是模拟人类专家的质检行为,解决那些非标准化、高度依赖相对判断的质量解释难题。无论是面对不同传感器的配置、不同形态的机器人本体,还是差异化的客户任务,这个引擎都能从海量“未通过验收”的数据中总结共性,持续提升自身的自动评测、诊断和修复能力。


03 一张图、一把尺、一个飞轮:高质量空间数据如何形成壁垒


要理解高质量空间数据模型如何发挥作用,首先要回答三个关键问题:质量标准如何定义,数据偏差如何度量,系统又如何在真实项目中持续进化。


围绕这三个问题,际数科技搭建了“一张图、一把尺、一个飞轮”的技术框架。


“一张图”,对应质量因子库。它描述场景、物体、材质、动作等因素与数据质量之间的关系,它相当于一本详尽的病理词典,明确了“检查什么、问题出在哪、为什么会影响模型训练”。


深度|Physical AI的数据之争:际数押注质量基础设施,下一个千亿级机会

GData Quality Factor Library (QFLab),超亿帧多模态数据积累,经由专家质检甄别千余种高质量因子


“一把尺”,对应高质量场景基座。依托高精度的测绘、三维重建与时空对齐能力,这把“尺”为系统提供了一个绝对的空间真值与统一参照系,以此来严苛校验多模态数据之间的一致性,剔除偏差。


“一个飞轮”,则对应质量数据的持续积累。每一个长尾问题及其上下文、专家判断和修复结果,都会重新进入质量基础模型,推动系统进一步演进。项目越多,系统看到的失败样本越丰富;失败样本越丰富,自动识别和修复问题的能力也越强。


深度|Physical AI的数据之争:际数押注质量基础设施,下一个千亿级机会

多模态数据处理动态工作流,质量因子库持续集成人类质检专家经验,一方面提供不同场景下的质量因子KV参考,另一方面推动质量模型飞轮闭环


这套体系带来的变化,首先体现在工程效能上。通过将质量问题前置,并引入自动化评测、诊断与修复,际数将数据生产成本降低至原来的十分之一,同时将生产规模提升了10倍。更重要的是,它减少了前端无效采集和后端重复加工,让原始数据中真正能够进入模型训练的比例得到提升。对于Physical AI而言,决定数据效率的,不是采集了多少,而是最终留下了多少有效数据。


际数科技的真正壁垒,并非停留在某一个单点算法的领先,而是整套以模型为核心的闭环工程系统——在质量因子库层,沉淀出一套物理世界的“病理图谱”;在长期的大规模项目交付中,不断沉淀着最宝贵的“失败数据”与长尾问题,并积累了海量的人类专家判断与修复反馈。将第一层的理论知识与第二层的真实样本进行融合,最终内化为高度自动化的评测、诊断与修复能力。


这三者之间形成了一个不断自我强化的飞轮:质量因子知识指导数据的收集与校验,真实项目数据反哺质量模型,质量模型又进一步扩展和完善因子库。这种极度依赖长期项目经验与dirty work积累的体系,是数据质量基础设施最难复制的部分。算力和工程团队可以在短期内补齐,但跨越不同传感器、本体、任务和项目所形成的质量认知,只能依靠长期实践逐步建立。


一切战略与壁垒的落地,最终都要回归到人的身上。际数科技之所以能选定并走通这条差异化之路,其最底层的支撑来自于三位联合创始人高度互补的复合型基因。


公司的三位联合创始人分别来自空间测绘、智能驾驶和汽车产业商业化领域,能力覆盖基础研究、工程研发与项目交付。这种组合,与际数当前所处的位置高度相关:既要理解空间数据背后的精度与误差问题,也要熟悉复杂数据如何进入模型闭环,最终还要将技术能力转化为可规模复制的商业交付。


际数科技首席执行官周源博士,由武汉大学与俄亥俄州立大学联合培养,师从李德仁院士,长期从事测绘与空间定位研究。他曾参与NASA/JPL火星车空间定位与制图,并参与主持多项国家重大项目与国家标准制定。目前,周源主要负责公司战略方向,以及空间智能质量基础模型的定位。这段经历决定了际数对数据质量的理解,并不是从传统标注或数据加工出发,而是建立在测绘学对于误差、坐标、空间关系和确定性的长期研究之上。


首席技术官叶文凯博士由同济大学与佐治亚理工学院联合培养,师从李荣兴院士,曾参与南极冰川研究等国家重大科研项目,后在华为、极氪从事智能驾驶研发。目前,他负责际数的技术体系搭建与产品实现。这也让际数能够将测绘方法转化为面向Physical AI的数据产品,而不只停留在研究层面。


负责商业化与项目交付的邹小弟,则拥有超过20年的汽车行业经验,曾任博世中国销售总监、百度IDG销售总监,长期参与复杂产业客户的销售、合作与交付。


空间测绘提供质量方法,智能驾驶提供数据闭环经验,汽车产业背景则补齐规模化交付能力。三者共同构成了际数在高质量空间数据赛道上的团队基础,也解释了这家公司为何选择从一个并不显眼、却足够底层的问题切入。


04 从10000公里道路到10000户家庭:高质量空间数据的规模化路径


当数据质量被转化为一套可评估、可度量、可持续迭代的工程能力,下一步的问题是:这套能力如何进入真实产业,并形成可规模复制的商业模式?


际数科技给出的答案,首先落在两种产品形态上:高价值场景租赁与高质量数据集。背后底层逻辑是先判断什么场景值得采,再保证生产出来的数据能够真正服务模型训练。


第一种形态,是高价值场景租赁。一个场景是否足够典型、是否包含有效长尾、能否补足模型当前的能力缺口,往往要等到数据采集完成甚至进入训练后才能判断。一旦场景选择错误,前期投入便会转化为难以挽回的沉没成本。际数提供的因此不只是物理场地,而是一套经过场景价值评估、质量建模和基础设施改造的数据生产环境。换句话说,客户租用的不是一间房,而是一个能够稳定生产高质量数据的环境。


第二种形态,是高质量数据集。这是一种更接近“交钥匙”的标准化产品。际数从模型任务出发,完成场景定义、数据采集、质量治理与后处理,最终向客户直接交付可用、可训、可验收的成品数据。这一模式解决的是另一类问题:不少机器人公司具备模型和本体能力,却缺少寻找场景、组织采集和搭建数据生产链路的资源。际数试图把这部分复杂性封装起来,让客户无需重新搭建一套数据工程体系,也能获得与自身模型任务匹配的空间数据。


这一能力也已经在智能驾驶场景中得到验证。


2024年,一家头部智能驾驶算法企业找到际数科技,希望生产一批高精度车道感知数据。该项目包含7路环视相机、1路激光雷达和1路GNSS观测,难点并不在于简单标注,而在于多模态数据之间的空间一致性:激光雷达中的标注结果需要精准反投至多路环视图像,同时满足亚像素级反投精度、3厘米以内空间误差、100%要素完整率以及超过99%的分类准确率。


在此之前,客户已经自建数据平台,并依托真值车投入半年以上时间进行生产能力建设,但始终无法达到算法团队验收标准。际数以“一张图、一把尺、一个飞轮”的方法重构数据生产流程:通过质量因子库判断哪些场景和特征真正影响模型训练,通过高精度空间基座提供统一参照系,再将项目中的质量问题与专家经验沉淀为质量模型参数。最终,团队仅用约35天完成从需求对齐、POC验证到首批10万组数据交付,四项核心指标全部达到客户要求。


更重要的是,这次合作并没有停留在一次性数据交付。首期项目完成后,客户持续追加订单。从2024年6月至2025年10月,双方累计完成六期合作,共交付395万组次多模态数据。随着客户技术路线变化,际数也可以基于此前沉淀的高精度场景基座和原子化数据结构,对历史数据进行二次挖掘与升级,超过60%的历史数据被重新调用。


这也体现了高质量空间数据区别于传统数据生产的核心价值:一次采集并不是终点,而是形成可持续复用的数据资产。对于Physical AI而言,真正稀缺的并非一次性的数据供给,而是能够伴随模型迭代持续产生价值的数据基础设施。


在业务落地上,际数并没有急于求成,而是清晰地规划了一条稳扎稳打的“三步走”演进路径。


第一步,是智能驾驶。这是空间智能最早进入规模化应用的领域,目前,际数已服务20余家智能驾驶客户。在实际项目中,其需要解决的问题包括远距离感知的一致性、点云与图像之间毫秒级不同步带来的空间位移,以及多传感器数据在统一坐标系下的偏差等。截至2025年底,际数自有场景样例库及质量因子资产已经覆盖一万多公里去重后的道路场景。这些自有数据可以用于展示和验证,不涉及历史客户的数据权属。


第二步,是具身智能。围绕家庭这一具身智能最重要、也最复杂的长期场景,际数启动了“万家灯火计划”,计划签约并数字化1万个具有代表性的家庭空间。这背后是一项更长期的判断:对于具身智能而言,场景价值在现阶段甚至高于单批数据本身。际数的做法,是对家庭场景进行数字化建模,并通过传感器同步、光源控制和空间基准等基础设施改造,将其转化为可反复使用的数据生产节点。未来长期再将这些经验进一步迁移至物流、康养、酒店和工业制造等领域。


场景可以变化,传感器和机器人本体也可以变化,但数据进入模型前所要解决的质量问题具有共性。这也是际数能够从智能驾驶进入具身智能,并进一步向更多行业扩展的基础。


黄仁勋曾判断,Physical AI将重塑制造、物流等价值约50万亿美元的实体产业。真正支撑这一进程的,不只是更强的模型和更成熟的机器人本体,也包括一套能够持续覆盖多场景、多本体和多任务的数据基础设施。


这并不是Physical AI发展过程中的短期需求,而是支撑通用物理智能持续进化的长期基础设施。围绕这一基础设施级机会,新的行业竞逐也将随之开启。


文章来自于"Z Potentials",作者 "Z Potentials"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费