2026世界机器人博览会(WRC)于8月19-23日在北京亦创国际会展中心举行。“AI大模型赋能机器人与具身智能产业新范式专题活动”在博览会同期举办。复旦大学未来信息创新学院教授,眸深智能联合创始人、首席科学家陈涛出席并演讲。
以下为演讲实录:
陈涛:大家下午好!很高兴给大家介绍一下我们眸深智能最近做的具身智能世界运动模型。
这里面我们给它起了个题目,叫做具身智能4.0,是因为我们的团队从2019年开始就在针对机器人的大脑去做一些工作,最近我们专注在世界机器人里面最重的一块,就是运动这一块来去做模型。
我们这个公司创始团队大概有这么几个成员,首先我是首席科学家,之前也在华为工作过,大概有3年。我们的CEO是复旦的本科,他之前也曾经创业过两家企业,还有我们总工程师是来自于原英特尔中国的首席科学家张益民老师,还有我们的CTO,是来自于英伟达的资深架构师余博士,还有我们销售副总裁胡博士,以及我们CFO。
我们第四代模型,大家可以看到整个模型从2021年开始,当ChatGPT进入到我们视角以来,具身智能才开始变得比较火爆,ChatGPT一开始是基于Transformer架构,通过Next Token Prediction的方式来预测我们语言里面的下一个问题。我们在这条路上深耕了大概5、6年,从我们最早做全球第一个在空间里面的动作Diffusion的生成,这也是迄今为止被英伟达、Meta等各大企业引用量最高的一款动作世界模型。
到2023年,我们又提出来了E2E的一个3D世界模型,到2024年、2025年、2026年,你可以看到我们在机器人动作领域里面,我们加入了很多像因果学习、物理约束、长程多任务,一直到今年5月份,我们完成了时空一体的世界动作模型。
蓝色的线是我们在3D环境感知方面做的一系列工作,所以到今天为止,到现在,我们团队给自己模型起了个名字叫做“World Motion Model”。我们和“World Action Model”是有区别的,World Action Model大家都知道是World Model+VLA,但我们World Motion Model实际上是起源于我们最早做的叫MotionGPT这样一个动作领域的大语言模型,或者动作领域的一个智能训练模型。所以我们后来在这样一个模型基础之上,注入了这样四个特点,给它把这个数据的成本降下来,我们称它是一个千倍降本的数据管线配方,我们比一般头部企业的数据成本大概低80%。
第二个,我们是有逻辑的世界模型,我们提出来全球第一个人类思考范式的世界感知模型HL3DWM,我们也获得了ICCV和CVPR等多项全球第一名。
第三个,是我们60倍推理加速,因为团队里面有来自国内的华为、国外的英伟达这样的头部芯片架构,所以我们的模型在一开始诞生的时候,它就跟端侧的芯片和算力深度绑定,可以实现20-60倍的推理加速。经过历时5年的累积,我们也获得了像去年IJCAI 2025年全球最佳具身智能大模型轻量化的论文团队。
第四个,是跨本体的数据飞轮,我们已经和腾讯、字节、华为以及国家人形机器人中心等很多企业,包括青龙、宇树、禾川科技等签署了跨本体的战略模型的部署协议,所以我们统称之为正确的数据、正确的感知、正确的硬件部署和更多的本体,才是我们第四代模型的特点。
细化下来,第一点,我们为什么可以带来千倍的数据降本呢?可以看到我们是在2021年,在NeurIPS:Spotlight论文里面,我们第一次提出来要把物理的先验知识和我们的数据生成融合起来,来去做对于环境的特征表征学习。所以在2021年,也就是6年前,我们就用80%的互联网视频数据来学习,来给模型注入它对于这个世界的通用认知,之后我们再用像10%的关节动捕和去年以来10%的真机,来去做模型参数的对齐和映射。
在今年CVPR里面我们也发了一个工作,叫做EGM,这里面可以看到,我们把人形机器人的本体分成了上半身和下半身,它上半身动作训练和下半身动作训练的数据量需求是不一样的,所以我们充分解耦它以后,来实现了只有十二分之一的数据,我们就可以训练出能够让机器人人形本体达到最好的动作跟随和生成的通路策略,也获得了很多媒体和公众号的报道。
这个就是我们最早发布的全球首个人形动作和控制的具身大模型,这个也是我们提出来,我们在2022年的时候,首次把自然语言和三维动作在隐空间里面进行了统一,并且获得了英伟达GENMO的引用,后来我们又在MotionChain,就是怎么样把它做得更长程,我们在2024年的时候发布了一个基于ChatGPT一个语言模型的多轮长程的动作生成,就是它第一次动作生成并不太理想,你可以不停的给它提示和引导,去年我们也做了多个动作交互式的生成。
有了这样的动作以后,我们把这样一个生成式的动作模型作为一个规划层,我们在下身接入了它机器人本体的控制层,我们通过上身,就是通过我们的规划来去控制整个全身的运动。在这里面我们实现了人来托引着机器人本体进行左移、右移、往前、往后避障,因为有一个人引导的话,那么这个机器人干起活来和人机协同搬运就会容易很多。
那么我们也做了比如说怎么样把模型来部署到国际的铃珑和青龙这种新的本体上,这个是我们做了除了通过语言,也可以通过视觉的方式来去重定向我们机器人的轨迹,让机器人跟着我们人的动作来实现一个比较好的动作序列生成,这个是我们今年发布的叫MonoMimic这样一个单目视觉人形机器人的操作系统,它完成是用一个十几块钱的摄像头,就可以来实现对于机器人本体的一个运控。
右边可以看到我们同学对着电脑摄像头进行摆臂、拥抱,还有踢腿,我们机器人可以实时的把人的动作通过一个摄像头转化到自己身上。
第二块是三维的空间逻辑,我们2022年的时候最早发布了一个基于三维视觉和语言问答,然后来对这个环境进行感知和规划的模型。在此基础之上,我们又进一步做了一个通过第三视角,来知道我第一视角完成行为评判逻辑的推理模型。我们知道机器人第一视角是看不全面的,那怎么办呢?我就给它加一个第三视角摄像头,来和它的第一视角共同完成一些复杂任务。
这里面我们做了可控性的机器人第一视角物体的属性判定和抓取的方位认知。这个是我们在今年2026年第一次用曲率感知来做一个流式的视频记忆,因为都知道,在具身大脑里面对于长程任务的记忆是比较难的,在这里面我们采用曲率感知,什么意思呢?这个技术我不再讲,但是通过这个视频可以看到,在视频里面,人在转弯拿东西,碰到关键物体的时候,我的模型才会在右边对这些关键的转折点进行一个记忆和选取。在这里面是采用了分层的记忆管理机制,充分模拟我们人脑的思维范式,来实现在机器人大脑里面,用最少的存储、最少的成本来去记住更多的东西。
第三块我刚才讲了,我们去和芯片适配和国产算力适配,应该说我们从四年前就开始做这样一个工作,我们经过一系列的累积,我们现在已经适配了像华为的昇腾芯片、像寒武纪的芯片、地平线的芯片以及国外的英伟达,我们也特意通过我们的模型的压缩,让原本一个只能在A100这种20万人民币上跑通的模型,它可以降到AGX Orin 1万元价格的芯片,也能跑我们这个模型,而且性能是不会降低的。
经过这一系列改进以后,我们不但性能不降低,还可以实现在很多任务上有略微性能的提升。
这样一个加速,也在现在比如说π 0.5做了一些加速的部署,我们解决了这个VLA模型,它这里面什么冗余呢?Token的冗余和动作的冗余,我们可以降低55%的计算量,然后实现36%的加速提升。
这也是我们今年新发布的一个工作,我们应该说在VLA领域里面,第一个自己进化,通过自我学习,来实现怎么样从不需要任何外部数据和外部奖励,就能够实现一个自我的性能提升,所以这个也是我们会在10月份,在主会场,在瑞典去做一个口头的报告。这是我们整个过程当中,全程没有人的外部介入和外部的干涉,通过我们自己设置的Test-time RL来实现一个VLA模型的自举策略优化。
这样一个优化方式,我们也向LIBERO、
RoboTwin还有很多标准的数据集上可以实现10%-30%性能提升,更高的可以到40%,它可以实现跨架构,在离散VLA、连续VLA以及跨场景这些操作类的抓取任务上,都能够实现非常大幅的性能提升,这是我们做的一些基于我们这样一个模型,去做机器人的多形态关节控制,左上角是展示我们的模型,比Naive的VLA要快两倍,左下角是我们实现拧瓶盖的demo。
这个是我们和上海的光明集团联合开发的,基于双臂机器人,来实现机器人调酒的工作。这个机器人也会在上海光明的店里面部署,它接收到人的语言命令以后,比如它要去调哪一种酒,在这里采用触觉和视觉的方式去选取不同的饮料,另一只手会在这里面拿到我们的搅拌棒,然后对这里面的饮料进行一个搅拌,它有搅拌的过程。
因为时间关系,这个视频我就不放了。
左边这个是我们今年和美的集团,在它们的洗衣机后面,我们实现了把我们大脑配上去以后,一只手把螺丝,在5毫米误差范围以内插准,另一只手找准孔径位置以后,把我们这个螺丝进行拧紧。这样一台机器人也是在宇树无锡的工厂里面得到了很好的适用。
另外一个是我们的升级版,它在一个机器人的双臂上同时来进行插拔和拧紧这样的操作,而这一块任务也是目前在美的洗衣机工厂里面是唯一一个没有实现机器人自主作业的一个环节。
我们也获得了一些头部企业的认可,和很多头部的机构签署的一些战略协议,我们也获得了学术界包括颠覆性大赛的优胜奖,还有上海市的一些荣誉称号。
中间这个也是和安徽的劲旅科技今年实现了一个大概有几千台的捡拾垃圾的机器人。这个本体是他们自己做的,我们做的事情就是在里面的芯片上,把我们的模型经过压缩裁剪,来实现一个垃圾的分拣和分拾,也获得了央视的报道和关注。
我们的商业模式有两类,一类是端侧域控的大脑,把我们模型和芯片进行适配以后来进行供货,另一类,我们也可以直接和机器人本体厂商进行合作,然后去做一些分拣机器人。今年,我们虽然成立只有一年半,但我们现在估值大概有30亿,而且半年之内我们也融资了5轮。
这个就是我们眸深的愿景,希望能够让每一个机器人拥有可以自主进化的具身智能大脑,这是我们在通用的数据路线、具身端侧做轻量化的模型压缩和适配,包括我们在核心的芯片里面怎么样去做具身大脑的编译和实现推理加速,以及我们在跨本体和国内的头部企业以及头部的厂商合作了一些案例。
好,我的汇报大概是这样的。谢谢大家!