灵巧智能算法科学家陆逸文:数据驱动灵巧手通用能力,打造可规模化的具身智能底座

七颜百科 °C 栏目:历史大事记
灵巧智能算法科学家陆逸文:数据驱动灵巧手通用能力,打造可规模化的具身智能底座

  2026世界机器人博览会(WRC)于8月19-23日在北京亦创国际会展中心举行。“AI大模型赋能机器人与具身智能产业新范式专题活动”在博览会同期举办。灵巧智能算法科学家陆逸文出席并演讲。

  以下为演讲实录:

  陆逸文:大家好,我是陆逸文,来自灵巧智能。

  今天想跟大家讨论的一个问题,现在我们的机器人已经能看、能听,甚至能跟人对话,但是依然拧不好一个瓶盖,这是为什么,以及我们想怎么样解决这个问题。

  过去几年大模型已经能让机器人理解指令,识别各种各样的物品,使用夹爪进行抓拿操作,甚至可以进行一些长程的任务规划,然而要拧开一瓶矿泉水的话往往做不到,这不是算法不行,也不是算力不够,而是机器人从来就没有真正学过怎么样使用一只手。

  所以具身智能的瓶颈正在从理解转移到执行,而灵巧操作正是解决这一瓶颈的核心。

  很多人问我们为什么不先做更全局更宏观的导航运动规划这些问题,其实我们的判断恰好相反,我们先解决manipulation,再去解决Locomotion的问题,而灵巧操作要求的是数据精度、接触建模、力控的能力,这些恰恰又是灵巧操作中最难的子集。所以你再处理了最难的基座以后,往简单的方向去泛化这是很自然的,反过来如果我们只解决夹抓的问题再反过来向灵巧手泛化的话,这里面的经验很多时候几乎不可复用,因为它们的自由度差了一个量级,手跟物体接触的模式也完全不同,所以专注灵巧操作是我们灵巧智能核心的一个战略选择。

  我们来看现在具身模型的结构,预训练赋予了这个模型视觉理解、语言理解以及一些基本的操作能力,后训练可以打磨特定任务上的熟练度,实现真正的场景落地。但是中间缺了一层--通用的灵巧操作能力,模型还不会用手你就让它学会怎么拧瓶盖,顺序就错了,这里的空缺不是算法造成的,而是数据造成的,像经典的遥操作范式在20多个自由度的灵巧手上会有严重的精度退化,采到的不是真正的灵巧操作信息。像我们在夹抓领域有π0等等基模,近年来也有一些适配灵巧手的基模出现,但真正原生适配精细灵巧操作的目前几乎没有。

  我们对这个问题的回答是构建灵巧操作的基座模型,其中有三个核心理念,在数据上我们觉得人是万物的尺度,优先使用人类原生的操作数据。在训练上我们专注于刚才提到的中央空缺的中训练这一环节,教模型怎么去用手,而在工程上我们相信架构不是最重要的,沉淀数据和基础设施才是真正的重点。接下来对这些维度逐个展开。

  我们可以回顾一下自动驾驶的初始数据是怎么来的,靠人去开一个车去收集数据,其实灵巧操作也是一样的,灵巧操作的数据应该来自于人,并且应该是人用手真正做事,而不仅仅是通过操作间接地控制一个机器人。对灵巧操作来说遥操作最大的问题不是贵,而是一些信号本身退化,人类在正常操作一些东西的时候精度应该是亚毫米的级别,而我们做的动作捕捉系统在指尖采集人的原始动作的时候可以达到0.5mm这样的精度。但是因为一些人机映射的精度、控制的延迟、缺乏反馈等等问题,遥操作的精度通常只能到厘米级别,跟人直接操作差了整整一个量级。去采一些遥操作精细操作的数据其实采到的只是一些降级以后的粗糙模仿,这就是为什么过去很多人使用遥操作可以控制灵巧手完成一些简单的抓拿任务,但精细操作几乎做不到。这也是为什么我们重度使用无本体的人类数据会混合第一人称的异构视频来提升覆盖面,通过高精度的动作捕捉进一步提升数据精度。

  我们用人手参数化模型做中间表示而不绑定任何硬件,让数据跟着人走,人不会像硬件本体那样常常需要更新换代,现在采的人类数据可能几年以后仍然可以用于模型训练。

  有了这个数据理念以后,接下来的问题就是怎么把一些原始的数据转成可用的训练数据。我们有一套异构数据的标注管线,同一段第一人称的视频可以产生四层的标注输出,包括原始视频、人手网格拟合、手部的骨相以及手和物体在世界坐标下的位姿以及接触的关系,整个过程端到端,不需要人工标注,在一些开源的基本数据集上,手部位置误差可以达到5-10mm,显著优于行业基线2-3mm。这套管线的意义在于规模化,第一视角的手部操作视频的采集现在已经非常丰富,我们的标注管线是把它们一些相对粗糙的视觉信息变成结构化的训练数据,瓶颈就变成了算力,而算力是一个更容易scalable的东西。

  接下来的问题就是数据有了以后怎么进行训练?传统上我们通过预训练可以完成90%底层感知和理解工作,传统做法是直接跳到预训练训特定的任务,如刚才所说我们认为中间还应该有一步,就是用大规模灵巧操作数据获得通用的让机器人学会怎么用手的能力,把预训练的基数从90%的程度推到99%,表面上的增量只是区区9个百分点,但是留给后训练的工作量只剩1%,把整个后训练的压力降低90%。。这就意味着面对新任务新场景可以让微调变得更加轻松,少量数据少量算力就可以完成适配,整个交付的速度和成本也可以大幅改善。

  具体怎么样落下来,分成三个阶段,第一步是在仿里,用人手模型学习一个通用的操作能力,包括动捕数据和异构数据都天然对应于人手,第二步通过对接触敏感的重定向算法迁移到具体的灵巧手,这里不只是一个传统几何上的映射,而是保持了任务语义,尤其是接触语义从序列到序列的翻译。第三步是做Sim2Real上实机的硬件,人手是一个通用的中间表示,同一套数据统一套方法论可以通过这样一套管线适配到不同构型的灵巧手,这是灵巧智能做能力平台而非单一产品的底层逻辑。

  在架构理念上,我们觉得不管是VLA还是WAM还是未来可能出现的新范式,架构都会迭代,但是数据管线和基础设施能够沉淀下来,所以我们测的是架构无关,换架构时这套数据和管线尽可能能无缝承接。

  这里还需要补充一点是,我们目前大量在使用Lora在进行微调,Lora的作用在具身中我们认为可能被低估了,根据我们的经验,在正确的配置上可以匹配全量微调的结果,这样就可以让有限的算力做更多的实验。当然这里也有一个开放的问题,当数据的规模真正逼近一个预训练量级的时候,参数高效的微调的表达力是否够用,这也是我们正在通过实验去回答的问题。

  这是我们一套完整的工程管线,从动捕和异构数据出发,通过参数化人手模型上的强化学习得到仿真中的人手操作策略,通过重定向算法映射到灵巧手的仿真模型上再次进行强化学习进行增强,通过这套仿真管线目前可以达到10倍左右的有效数据扩增,扩增以后的数据最终使仿真数据和实机和采集数据合在一起,进入到一个VLA的微调训练。

  这里的强化学习不是目的,而是工具,我们通过强化学习修正原始数据中的一些问题,比如穿模、虚接触这样的问题,可以补全原始端侧中所缺失的接触力,同时也可以扩增不同的物体和场景。最关键的还是底下这条线,我们实际部署反馈,模型上真机,反过来反哺算法和数据,再进行下一轮数据迭代。

  上述这套管线只是一次性的,但是一旦形成一个飞轮之后就可以形成自我增强自我进化的效果。每一次训练模型告诉我们哪里数据不够,哪种操作失败率最高,我们会进行针对性的数据补强,并且在仿真环境里进行数据合成。这不是一个静态的数据集,而是越转越快的数据引擎。

  前面主要讲的是视觉和运动学的问题,但是灵巧操作其实有两个通道,一块是我们更熟悉的视觉,一块则是力学,力学在一些更精确的操作中更为重要。我们通过视觉可以看到手在动,但是不能直接看到接触力,所以在做一些滑动、拧、捏、插这些动作的时候,它的成败就会非常取决于施加了什么力。

  我们也在做触觉的表示学习,给不同的触觉数据赋予语义表示,让它和视觉语言一起进入模型,我们知道人手能感受到物体的微小滑移,这种手感也正是灵巧操作的维度,也正是我们在布局的前沿方向。我们的模型不只活在仿真里,也不只活在实验室里,我们已经在自研灵巧手的实机上完成了视觉引导的自主操作,并且在工业电力等场景中得到实际落地。

  另一件我们投入很大精力的事情就是标准化评测,有了量化标准才能诚实地判断每一轮的进步,所以我们关注的是评测、训练、部署、反馈这一套持续迭代反馈这一套工程闭环。

  我们在方法论上的核心是押注 Scaling law,但是Scaling我相信不仅是简单的堆砌数量,我们所有的工作都是围绕灵巧操作如何高效高质量地去进行Scaling而展开。我相信灵巧操作不是一个终点而是起点,我们从手延伸到臂,延伸到身体到移动,我们把地基打在最难的地方, 向上的泛化是自然的,同时也有很多开放的问题要留给实验回答,比如像刚才提到的数据逼近预训练量级的时候,训练的方法论要怎么样演化,仿真里头的接触经验多大程度可以无缝迁移到真实世界,灵巧操作的skilling curve最后会长成什么形状,我相信这些都是任何人都没有确切答案的问题,也是我们持续在探索的方向。

  灵巧智能的目标是进行灵巧操作能力的基础设施研发,不只是一款灵巧手,或者一个单点的demo,而是让任何的机器人都能获得精确操作的能力,然后我们通过数据管线、基座模型、评测标准、跨本提前来实现整个一套底座。

  这就是我今天分享的内容,谢谢大家,欢迎交流。