「仿真派」落地真产线!苏度WAIC首秀,CEO韩铮:99%+成功率

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
「仿真派」落地真产线!苏度WAIC首秀,CEO韩铮:99%+成功率
7308点击    2026-07-20 15:00

一个月前的CVPR现场,一家中国具身智能公司的展台被围得水泄不通。


没有真机调试,没有遥操作采集,一台机器人直接从仿真里「毕业」,Zero-shot首次抓取成功率约98%


如今,他们来到了WAIC。


苏度科技——成立一年估值破人民币200亿元,苏昊担任联合创始人、董事长兼CTO的具身新星——首次在国内大型展会亮相。


「仿真派」落地真产线!苏度WAIC首秀,CEO韩铮:99%+成功率


这一次,他们带来的不只是Picking。展台上同时跑着四组Demo:


  • 精密装配:双手协作,以亚毫米级精度完成模具组装;
  • 柔性打包:布料随形,双手协同;
  • 移动操作:移动场景下的感知-决策-执行全链路闭环;
  • 电池模组产线:四机协同,复刻与宁德时代联合开发的真实工业流程。


「仿真派」落地真产线!苏度WAIC首秀,CEO韩铮:99%+成功率


每一组Demo,都在尝试回应同一个行业终极之问:


仿真训练出来的模型,到底能不能在真实世界干活?


对此,苏度科技联合创始人兼CEO韩铮的回答是:


能,而且一旦放出来,就是99%+成功率。


高可靠性是具身走向商业化的前提。


我们内部的标准99%+成功率,在此基础上再谈泛化性。


这点在现场也得到了印证。


量子位发现,苏度是场馆内极少敢让观众自带物体「盲测」的展台——给啥抓啥,来者不拒


甚至有让抓骰子的……


「仿真派」落地真产线!苏度WAIC首秀,CEO韩铮:99%+成功率


我跟工作人员小哥调侃:诶,能抓手机吗,抓坏了咋办?


小哥嘿嘿一笑:赔你(doge)。


也是对模型能力绝对自信的一种体现吧。


苏度WAIC首秀,四组Demo拉开能力光谱


一刚一柔,两场「极端考试」


自苏度亮相以来,外界一直在追问同一个问题——


Picking对精度要求不高,Sim2Real在抓取上能跑通。但contact-rich(接触密集型)操作呢?


WAIC现场的亚毫米精密装配与双手柔性打包,就是苏度对此的正面回应。


这两项任务,恰好代表了物理交互的两个极端。


精密装配,难在精度。


看似简单的玩具组装,背后是极小的容错率,稍有偏差便无法嵌入,对力控和位姿估计的要求近乎苛刻。


我在现场亲手试了一下,很难Zero-shot。纯靠视觉只能对准一个大概位置,真正咬合靠的是指尖的力觉反馈,在接触中实时微调。


「仿真派」落地真产线!苏度WAIC首秀,CEO韩铮:99%+成功率


柔性打包,则难在不确定性。


布料没有固定形状,每一次抓取、每一次受力,都会彻底改变下一步面对的状态。这类柔性物体在仿真中极难精确建模。


「仿真派」落地真产线!苏度WAIC首秀,CEO韩铮:99%+成功率


结果呢?


苏度用同一套基座模型,两场考试全部通关。


「仿真派」落地真产线!苏度WAIC首秀,CEO韩铮:99%+成功率


不仅做到了,还保持了与Picking同等级的闭环抗干扰能力。


关于这一点,不知道大家有没有发现一个细节——苏度在这些操作时用到了两只手。而展会上,绝大多数机器人展示时只用一只。


原因很简单,双手场景下,一只手的动作会立即改变另一只手的约束条件、可行空间和下一步选择,变量太复杂,模型必须依据真实反馈持续协同。


苏度选择双手协作来做Demo,是主动亮剑。


「仿真派」落地真产线!苏度WAIC首秀,CEO韩铮:99%+成功率


并且也是和Picking一样欢迎现场出题的。


我问现场工作人员:能不能伸手干扰一下?


小哥的回答只有两个字:


欢迎。


然后展台的两位小姐姐直接开始现场「捣乱」了(bushi)


「仿真派」落地真产线!苏度WAIC首秀,CEO韩铮:99%+成功率


一刚一柔。前者考验精度,后者考验柔顺。两项极端任务,均做到了与抓取同等级别的泛化能力。


苏度用这两个场景正面回应了一件事:


「仿真搞不定contact-rich操作」——这个判断,该改了。


移动操作:边走边抓,彻底不做模块拼接


听上去理所当然,但现实是:绝大多数机器人至今仍做不到。


原因藏在数据里。


移动操作的遥操作数据极难采集,底盘式机器人尤其如此。用摇杆或脚踏控制底盘,再同时操控手臂,操作方式本身就反人类。


因此,目前主流的遥操作方案往往固定操作者下肢,许多系统甚至把上肢、躯干和头部也基本锁死,只允许一只手臂运动。


靠真机数据走通移动操作,几乎是一条死胡同。


苏度用仿真路线翻过了这座山——


端到端的全身控制策略。感知、底盘、躯干与手臂不再被拆成独立模块,策略根据实时变化的相对状态,统一生成全身动作。


「仿真派」落地真产线!苏度WAIC首秀,CEO韩铮:99%+成功率


看着好玩,像在遛机器人。但背后对应着大量真实应用场景:开柜门、上下料、搬运大件物体……几乎所有涉及大范围空间的操作任务,都需要移动操作能力来支撑。


解锁这项技能点,意味着机器人的作业边界被大幅拓宽。


四机协同跑产线:从技能到任务


最重磅的Demo,压轴登场。


苏度与宁德时代合作,现场复刻了一条电池模组产线,完整还原锂电产线从上料到下料的全流程:上料→电芯装配→扫码→下料。四台同型号机器人分守不同工位,协同作业。


「仿真派」落地真产线!苏度WAIC首秀,CEO韩铮:99%+成功率


流水线作业是人类工业最成熟的生产组织方式,但对机器人而言,这类多机协作任务对泛化能力的考验极为严苛。


关键在于状态传递:每一步的执行结果,就是下一步的起始条件。前一台机器人完成上料与装配后,任务状态和工件向后流转,下一台必须准确「接住」结果,再完成扫码与下料。


这类长程任务场景下,任何一环出错,整条链路都会中断。


「仿真派」落地真产线!苏度WAIC首秀,CEO韩铮:99%+成功率


苏度为何敢在线下实时展示?


秘诀在于一套「任务智能体」。


大部分公司的Demo往往为展示设计,需要为特殊场景专门采集多条真机数据,这样当然也能交付,但也将模型框死在了一个工位、一道工序、一个固定任务,靠这种方式打通一串长程任务,成本相当高。


苏度的选择是,预训练阶段不进入具体场景,优先将Picking这类可迁移的底层共性技能做到极致,同时保证泛化性。


这样到了交付阶段,只需少量真机数据后训练,任何工作流都能基于已有技能库的自主组合打通,像搭积木一样。


如果说四个月前的惊艳首秀只是单点突破,那这次WAIC则是一次通用泛化能力的全面亮剑。


一机多能、双手精细操作、多机协作、长程任务编排……当初的Picking王牌,已然裂变为10余项操作技能。


而这一切,究其本源,仍然指向团队自亮相之初便坚定的技术主线——


仿真之路。


仿真的底层逻辑


数据,至今仍是具身智能行业百家争鸣的开放问题。


真机数据自然是所有人求知若渴的,但无法Scaling。人力、设备、时间成本层层叠加,数据量级始终进展缓慢。


仿真数据量大管饱,却绕不开一个现实:Sim2Real的Gap。


今年4月的亮相中,苏度将抓取的Zero-shot成功率做到了约98%。但现实场景中,客户的验收标准是99%+。


这1%的鸿沟,仅靠仿真数据很难逾越,必须补上真机数据的微调。


这促使苏度打造了一套虚实融合的数据链路系统


核心思路是各取所长:以大规模虚拟仿真数据为主体,有效融合少量真实采集数据,在数据效率与泛化精度之间找到最优平衡。


这也是目前业内较有共识的、真正可Scaling的落地路径。先在预训练阶段用仿真数据构建一个泛化性强的基座模型,再在交付阶段结合客户的少量示教数据微调,达到可实际部署的成功率。


「仿真派」落地真产线!苏度WAIC首秀,CEO韩铮:99%+成功率


基于这套虚实融合的数据基座,苏度设计了自己的世界模型。


李飞飞曾将世界模型分为三类:渲染、模拟与规划。但在苏度CEO韩铮看来,这三类并不能覆盖具身大脑的全部任务。


先说规划类世界模型,这是上层,当用户要做一道菜、它负责分析厨房空间和冰箱内容、判断是否需要下单买菜。


但要将这些高层推理落地,还得看底层的渲染和模拟能力是否扎实。


这也是苏度一直瞄准的生态位。


目前,纯2D视频生成主要解决渲染问题,3D生成主要解决模拟问题。它们可以服务于自动驾驶、室内导航、商用清洁等场景,但几何精度不足,无法直接用于精细操作任务。


在此背景下,苏度提出了第四类世界模型——


极致颗粒度的渲染与仿真,对环境与物体的高精度几何理解与预测。包括材质属性、表面摩擦系数、几何约束、动力学约束,以及接触后的状态变化。


具体而言,在苏度的仿真基础设施中,世界模型会参与指导环境构建、数据生成与任务定义,同时参与策略训练过程中的监督与评估。


这背后,是苏度在底层模型中系统性地实现了世界模型&强化学习一体化。模型不再只是拟合输入输出映射,而是在有几何结构、空间关系、接触力学的环境中真「干活」,通过实践学习可迁移的物理规律。


最终的结果,就是一个遵循真实物理定律的虚拟世界。机器人能在这里面无限轮回,最终完成属于它自己的进化。


「仿真派」落地真产线!苏度WAIC首秀,CEO韩铮:99%+成功率


写到这里,一个词突然从脑海中跳出来,也是我对苏度所有印象的最终浓缩:


反主流。


最直观的体现是对数据的思考。


虚实融合的方向虽已渐成共识,业内越来越多Omni方向的工作也在涌现,但真正把仿真当作基座而非辅助工具的,仍是少数派。大多第一梯队选手还是会重金搭建自己的真机数据壁垒。


在这一背景下,苏度始终坚持仿真,并围绕仿真搭建了自己的全栈技术体系,毫不FOMO。


这条明线不难察觉,但我觉得,在此之下还有一条更本质的暗线——


这是一家极为长期主义的公司。


他们不会为了做出一个fancy的Demo交付而牺牲底层架构的完整性。而是先解决范式问题:先把通用能力做大、做通,再面向具体场景做小、做稳、做可部署。


无论是泛化Picking,还是此次与宁德时代合作的电池模组方案交付,都是苏度在这条技术主线上行进过程中,顺手点亮的技能点。


这无疑与主流打法形成了鲜明差异。


如此「逆向运行」,却一次又一次惊艳交卷,持续获得投资人押注。成立仅14个月,估值即达人民币200亿元


这究竟是一家怎样的公司?


量子位找到了苏度科技CEO韩铮,为我们揭开这家新兴具身智能独角兽的面纱。


「仿真派」落地真产线!苏度WAIC首秀,CEO韩铮:99%+成功率


对话苏度CEO韩铮


让机器人在仿真中进化


量子位:很多团队倾向于搭建「数据金字塔」,各类数据都采集一些,再用真机数据做消融实验。为什么苏度很早就选择了以仿真为主?


韩铮:尝试各种数据源并不断调整配比,符合直觉,也容易在短期内看到效果。但真正的框架突破背后需要大量Dirty work,一个团队可能三到五年都发不出一篇论文。这对多数高校研究组、大厂研究院和追求短期回报的创业公司来说,是很难接受的。


大模型的诞生背后有一个朴素的原理——尽可能完整地复现世界。语言模型要覆盖人类对话的全貌,视觉模型要覆盖图像与文字的各种形态,自动驾驶要覆盖千变万化的路况和Corner case,而机器人则要覆盖人在不同环境中对各种物体的操作方式。


构建这类模型,不可能靠在大量受限Case上过拟合的小模型拼接完成。而要从零开始完整地构建数据、框架和算法,需要长期的基础性投入。这类工作天然不适合承受强论文压力的研究组,也不适合从零起步、急于验证商业模式的创业公司。


国内许多具身智能团队进入这一领域不过三到五年,通常从自己擅长的单点切入。而苏昊瞄准这个方向已经超过十年,早期又参与过ImageNet这类大型基础性项目,因此有底气、也有耐心做长期投入。


量子位:自动驾驶的仿真和Scaling路线似乎遇到了瓶颈,并没有让模型真正达到L5。具身智能走仿真路线会重蹈覆辙吗?


韩铮:自动驾驶的难点在于高速场景下的多智能体博弈。机器人通常不在高速、多机协作的环境中运行,前方有人时可以完全刹停,等对方离开后再恢复动作,也可以低速绕行。


但它对contact-rich操作的要求远高于自动驾驶:


几何形状、摩擦力、密度分布、接触后的状态预测……每一项都需要极高的物理保真度。


冷启动的方式也不同。


如果每个人都能穿上一套符合人体工程学、成本足够低的「钢铁侠式」外骨骼盔甲,机器人也许能直接从海量真实操作中获取数据。但现实显然并非如此。


量子位:李飞飞将世界模型分为渲染、模拟和规划三类。苏度的世界模型在这个框架中承担什么角色?


韩铮:World Model这个词在Sora出现后重新进入大众视野,但在机器人领域,我们还需要第四类世界模型——它需要对环境和物体形成高精度的几何理解与预测能力,涵盖材质属性、表面摩擦系数、几何约束、动力学约束,以及接触后的状态变化。


具体来说:纯2D视频生成主要解决的是渲染问题;3D生成解决的是模拟问题,可以服务于自动驾驶、室内导航、扫地机器人或商用清洁机器人等场景。但这类表征的几何精度不够,它们只能生成视觉上相似、但物理上不可信的2D或3D结果,无法直接用于contact-rich的物体接触仿真与理解。


这也是为什么AIGC生成的视频与现实之间总有微妙的「违和感」。打个比方,它类似于手绘3D动画基于真实3D建模、材质贴图和物理渲染制作的动画之间的差距,即使画面精美,人眼依然能分辨出区别。


规划类世界模型则处于更上层。比如:理解用户要做一道菜,分析厨房空间和冰箱里的食材,判断是否需要从电商或本地生活平台下单补货。这些属于high-level planning(高层规划)


我们更关注的,是下层的执行模型。面对不同款式的冰箱门把手,机器人如何决策上肢与下肢的协同动作?如何准确取出鸡蛋、碗和其他食材?如何在随机、复杂、布局各异的厨房环境中保持高成功率?——这需要的是另一类世界模型。


量子位:一个沙盒?


韩铮:从推理侧看,可以把它理解为一种隐空间表达(latent space representation)。但在预训练阶段,它是可以输出显性表达的;只是到了推理阶段,没有必要保留全部显性信息。


世界模型还承担着一项关键职能——训练数据的生成。我们在2021、2022年开展的model-based RL(基于模型的强化学习)、RPG和TD-MPC等研究工作,核心就已经涉及这些问题。


这里需要澄清一个常见误解:世界模型和仿真之间,并不存在泾渭分明的边界。仿真更像是机器人进化的基础设施(infra)或集成开发环境(IDE),而世界模型在其中负责指导环境搭建、数据生成和任务设计,同时也参与监督等多个环节。它们的关系类似于Transformer与Python,属于不同层次的技术栈,而非互相替代的关系。


而一个高效、实用的仿真器,是渲染、3D模拟、规划以及我们所说的第四类世界模型,都绕不开的底层基础设施。


量子位:苏度强调「预测下一个physical dynamics」。人类完成日常操作时,并不需要显式地掌握物理定律,模型为什么需要如此高颗粒度的物理信息?


韩铮:人类做物体操作不需要大学水平的物理和数学知识,是因为人类经历了漫长的生物进化,出生后再通过少量尝试就能完成感知与行动的对齐。但机器人无法跳过前面那段「进化」的历程。


我们在仿真器中构建物理规律、物理解算引擎和大规模可微仿真环境。为了实现大规模并行加速,还需要在精度与效率之间做大量的取舍和优化。


你可以把它理解为建造一个遵循物理定律的虚拟世界,让机器人以类似人类进化的方式,完成属于它自己的进化。


从工业到民用的技能复用


量子位:与宁德时代合作的电池模组场景,基于什么考虑设计?


韩铮:标准电芯的生产和组装,自动化程度已经很高了,大概率不需要具身机器人再介入。具身机器人真正适合的,是两类任务:


第一类,是自动化设备之间的「缝隙」。物料的上下料与流转。这些环节往往连接着不同的自动化设备,却缺少标准化的衔接方案。


第二类,是柔性生产任务。比如一条产线需要兼容多种型号,或者涉及接插、插线、安装电芯等传统工业自动化难以胜任的操作。这类任务的难点在于:物料的初始状态、插入对象的位置和姿态无法被严格标定,必须依赖闭环感知与实时策略调整。


此外,这类任务对工人本身也存在危险。操作高压电芯时,工人需要穿戴大量防护装备,即便如此,检测和擦拭过程中仍然有安全风险。具身机器人可以替代或协助工人完成这些环节,让一个工人同时管理多台机器人,既提升安全性,也提升效率。


完整的电池组装涉及多家集成商协同分工。我们专注于其他技术路线暂时难以完成的柔性、精密操作,不参与同质化竞争。过去工业机器人难以覆盖的危险、重复工位,可以用多种技能组合与机器人集群来系统性地解决。


量子位:苏度的仿真路线,在电池模组场景中有什么独特优势?


韩铮:一句话概括——极致的可靠性


其他技术路线把模型部署到某条具体产线时,如果缺少大量针对性的后训练数据,成功率通常很低。团队不得不让产线停机来采集数据,再用真机做强化训练,消耗大量电芯或物料,才可能将成功率提升到99%+。


但这种方案依然非常脆弱。对电芯规格、产线环境甚至光照条件都有严格限制。


现实是,工厂很难长期停线来配合数据采集,大量潜在客户也无法提供可供开放测试的产线。有些合作可以依靠商务关系或投资纽带推动,但这种方式既不可扩展,也缺乏效率。


我们的目标,是让自动化团队和集成商完全不需要掌握真机数据采集、真机强化、模型训练和调参这些复杂流程。每次更换型号或切换产线,也不必从头再来。未来的使用体验应该接近大语言模型的prompt输入,或者协作机器人的拖拽示教


量子位:如果更换电芯型号或电池组装型号,适配需要多长时间?


韩铮:内部调试通常在一天以内。主要工作是工艺逻辑的示教,例如一次抓取几组电芯、安装的先后顺序等。这些信息可以通过视频、动作捕捉、人工示教或编程等方式输入。


如果将与宁德时代合作的方案迁移到另一家电池厂,已经熟悉系统的集成商只需调用我们公开的技能库,大约一到两天就能完成部署。产线工艺也可以重新组合成新的workflow,不需要与原产线完全一致。


自研本体是被倒逼的


量子位:苏度会坚持自研本体吗?


韩铮:我们并没有在创立之初就认定必须自研本体。如果市面上的机器人本体足够好用,我们原本完全可以不造硬件。


但从2022年筹备公司开始,我们测试了机械臂之外的各类移动底盘和全身机器人,发现它们的底层架构、硬件选型和规格参数都无法满足我们的算法要求。


我们也尝试过让第三方公司做定制开发,但现实是:擅长某一部分硬件的公司,很难统筹完成整机设计、控制器开发和底层接口打通,开发周期也会被拉得很长。因此,公司成立后我们很快调整了策略,决定亲自下场自研本体。


从长期来看,我们会采用类似「iPhone+iOS」的软硬一体形态,同时开放SDK,让合作伙伴在我们的平台上开发应用。而对于大型工业机器人、特种异形机器人等与人形差异较大的平台,我们也可能通过输出预训练模型、核心芯片和执行器,去赋能第三方机器人本体。


量子位:所以追求SOTA具身模型,自研本体是必选项?


韩铮:对。行业现在越来越关注机器人的自研自产,以及模型、数据采集设备与本体之间的深度兼容。缺少这种兼容性,最终效果一定会打折扣。


这里有一个很残酷的「木桶效应」:如果「大脑」只有50%的泛化能力和成功率,那么无论搭配50分还是90分的硬件,整体表现依然只有50%。它或许能偶尔完成任务,但距离真正的商用落地还差得很远。


但客户对99%+这条商用底线的要求是很难改变的。在「大脑」突破有限的阶段,很多团队往往会退回到接近传统工业自动化的老路,不断增加对物体和环境的物理约束,或者在单一场景中用大量后训练数据去强行拟合。


量子位:苏度想打造具身行业的iOS,但「具身的iPhone是什么」这一点都尚未形成共识,您认为具身智能的「iPhone时刻」应该是什么?


韩铮:会是我们第一次系统性地向市场提供量产设备的时候。


按照很多同行的标准,现在的设备或许已经能拿出来卖了,但它还没有通过我们自己内部的严苛标准。这次WAIC展示的新构型,也依然不是最终的定型版本。


我们目前正在进行高强度的内部测试,同时也在建设开发者中心让合作伙伴上手体验。


首先要让大家确认一件事:硬件和底层基础模型能够高效协同,合作伙伴可以在这个底座上搭建自己的模型和新的具身agent。


在此之后,我们还要验证设备能否在安全、可靠的条件下实现长时间无故障运行,以及线下的售后支持体系是否已经铺设到位。


量子位:如何看待行业里的「自由度军备竞赛」?


韩铮:这正是仿真路线带给我们的巨大优势。我们可以在仿真器中低成本地测试成百上千种构型,让机器人去执行目标任务,然后横向比较不同方案对电机扭矩、自由度数量、成功率、工作空间以及散热性能的极限要求。


仿真最大的价值,在于它能帮我们跳出纯粹的仿生学思维。从A点移动到B点,轮子通常比四足更高效;动物受限于肌肉、血液供氧和供能结构,很难进化出轮式结构,但机器人不需要受这种生物学限制。


同样的道理,即使人类社会周边的物体都是为人类双手设计的,电机驱动的机器人是否一定需要「五指灵巧手」,目前在学术界和工业界都没有定论。


得益于仿真,我们的试错成本远低于同行。可以先在虚拟世界里测试上百种构型,最后只挑出两三种最优解来做实体试验。


99%+成功率是一切的前提


量子位:行业商业化仍处于早期,也没有出现类似GPT-3.5那样的「破圈时刻」。这个阶段,资本市场在期待什么?


韩铮:资本市场很清楚机器人是一个巨大的机会。大家担心错过窗口期,所以中国市场涌现了大量同质化的公司。


这在某种程度上很像高校里不同的机器人实验室或CV实验室各自孵化成商业公司,每家公司都在自己的单点上向前推进。


量子位:在研究突破与商业化场景之间,苏度如何分配精力?


韩铮:商业化方面,即使我们已经拥有不少产业方股东和海外工业客户,在选择合作对象时仍然非常克制。


我们的核心目标始终是打磨基础模型和上层开发工具。让技能和技能组合能够作为标准品,快速复用到多个行业,体验上就像搭建App一样直观。


合作方可以在我们的平台上参与应用层开发,既无需触碰基础模型,也无需重新造一套操作系统。


量子位:如果基础层持续Scaling,会不会挤压上层应用公司的生存空间?


韩铮:行业一定会走向模型分层与上下游分工。


工业领域有大量需要深厚行业经验的工作——MES系统、库存系统与传统自动化系统的整合,工装夹具的定制,认证安规与服务体系的建设——这类工作我们不会向上延伸,也不应该去做。


与此同时,基础模型之上还有非常广阔的空间。做多模态模型的、从CV转型VLM的团队,都可以与我们形成上下游合作。基于我们提供的skills,上层可以构建reasoning、planning和长程规划能力。


举一个具体的例子:用户给机器人一个抽象任务——「做一道菜」。


上层模型可以负责读取菜谱、参考视频、调用语言模型生成操作步骤,也可以理解厨房空间布局、厨具位置,甚至连接电商或本地生活平台完成食材下单。这些边界我们不会去碰。


苏度的工作,是让机器人可靠地打开冰箱、取出多种原材料、打开柜子拿锅、操作灶具或微波炉,在任意房间和厨房中,对不同物体实现99%+以上的操作成功率,并将多个技能串联成同样高可靠的长程任务。合作方可以通过我们的SDK、API和虚拟调试工具来调用这些能力。


量子位:紧贴应用场景能拿到数据飞轮,光做底层技能很容易陷入红海竞争。如果同行未来也达到了99%+的成功率,苏度的护城河是什么?


韩铮:从长期来看,任何技术都不会只有一家公司掌握。但我们搭建的Sim2Real技术栈和系统复杂度,远高于市面上大多数真机路线。


真机路线在某种意义上更像早期的大模型训练——有经验的人可以快速迁移,调整参数后就能做出一篇实验室paper或一个新demo。


但要真正达到99%+的可靠性,同时对物体和环境保持强泛化能力,背后需要极其复杂的系统工程。


团队中必须同时具备多种强背景:数据理解、仿真搭建、物理解算、渲染、机器人系统、硬件设计、操作系统……这些能力很难集中在一两个人身上,也不是简单招人就能补齐的。


我们很多团队成员是在美国大厂和领先创业公司工作或实习之后,才选择加入苏度的。因为能完整走通这条AI路线的团队,在全球范围内都屈指可数。


关于数据飞轮:大客户的核心数据通常不会回流——SaaS、CV模型和语言模型行业也都有类似情况,私有化部署的需求会长期存在。


但我们的数据飞轮转得更快。对于安全要求较低的数据,可以脱敏后回收继续使用;客户在仿真调试环境中的使用数据,也有助于数据分类和系统的持续改善。


量子位:苏度选择了一条相对少见的数据路线。这个过程中,有什么Takeaway可以和社区分享?


韩铮:对机器人来说,Research与商业化之间最大的分水岭,就是99%+的可靠性。达不到高可靠性,就很难真正超越传统工业自动化。


但具身智能也无需替代所有工业自动化。它应该解决的,是那些传统自动化成本过高、难以覆盖或根本无法完成的任务。


如果行业能在这个前提上形成共识,就能更清晰地判断什么样的具身方案是可行的、什么样的公司路线是靠谱的、什么样的商业化选择是理性的。


文章来自于"量子位",作者 "Jay"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
AI 3D建模

【开源免费】LGM是一个AI建模的项目,它可以将你上传的平面图片,变成一个3D的模型。

项目地址:https://github.com/3DTopia/LGM?tab=readme-ov-file

在线使用:https://replicate.com/camenduru/lgm

5
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

6
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0