2026 年,真实交互数据开始在具身智能行业被单独采购。机器人在真实世界中完成动作的过程,也开始被转化为可用于模型训练的数据。
此前,行业资金更多流向本体、关节、执行器和模型。随着机器人进入工厂和实验室,企业逐渐发现,完成一次演示,不代表模型已经具备稳定复现能力,每一次抓取、旋拧和搬运,仍需要大量真实交互数据支撑。
根据《2026 中国具身智能数据采集与数据产业发展展望》估算,目前高质量真实物理交互数据约为 50 万小时,距离通用具身智能所需的千万小时规模仍有较大缺口。
但数据规模只是第一层问题。真机遥操作数据可以直接用于模型训练,采集成本却会随着设备和人员增加;第一视角视频更容易扩量,却很难直接还原手部动作、物体位姿和接触关系;仿真数据成本较低,进入真实环境后仍会出现偏差。
7 月 30 日,忆生科技发布 EngramTeleOp 和 EngramEgo 两款数据采集产品,分别切入真机遥操作和真人第一视角两条数据来源。
EngramTeleOp 是一套纯视觉真机遥操系统。操作员不需要佩戴动捕手套或使用手柄,只需通过 MR 头显和裸手动作,便可以控制机械臂与灵巧手。除了手部精细操作,系统还支持全身遥操作和远距离控制,以降低传统方案对专用传感设备和复杂标定流程的依赖。
EngramEgo 处理的是另一类规模更大的数据:人类在真实环境中工作和生活时产生的第一视角视频。系统通过视觉重建,将视频中的人体、手部动作、物体位姿和接触过程转化为结构化数据。其手物交互重建指标 W-MPJPE 降至 41.77 毫米,较此前公开最优结果降低 27.8%。
两款产品对应了具身数据采集中的两项主要约束:真机数据质量较高,但扩量成本较高;真人第一视角数据更容易获得,却很难直接转化为机器人能够使用的训练数据。团队把过去依赖硬件设备和人工处理的部分,转移到视觉重建、动作映射和数据生成算法中。
这也使其与常见的数据采集服务商有所不同。当前行业供给主要集中在动捕设备、采集场站和众包服务,成本通常随设备、人员和采集规模同步增加;算法则可以在不同采集任务中重复使用,降低新增数据的生产和处理成本。
“介绍我们这两款产品时,有很多伙伴误会我们是一家数采公司,其实不是。”CEO 石志儒在采访中表示,“我们是一家做自主智能的、做可持续学习的世界模型公司。两款产品是我们算法能力的自然衍生。”
忆生科技(TranscEngram)成立于 2023 年 9 月,由香港大学计算与数据科学学院创始院长马毅与高盛华、杨言超共同创立。团队长期从事计算机视觉、视觉感知与智能系统研究。马毅曾获被誉为计算机视觉领域最高荣誉之一的马尔奖(David Marr Prize),并当选 IEEE、ACM、SIAM 三料 Fellow。近期,公司完成数亿元天使轮融资,投资方包括中生制药、浦东创投和张江科投。
▍高质量具身数据从哪里来
要理解两款产品为什么分别切入真机遥操作和第一视角数据,需要先看当前具身训练数据的主要来源。
从产品架构看,两款新品并非孤立的数据采集工具。公司的产品布局还包括 EngramControl 和 EngramNav:前者面向运动控制,后者负责视觉感知与空间记忆。加上负责真机遥操作数据采集的 EngramTeleOp,以及处理执行者视角运动数据的 EngramEgo,四项产品覆盖数据采集、控制、导航与记忆环节。
目前,具身智能训练数据主要有三种来源。
第一种是真机遥操作。由真人控制机器人完成动作采集,数据质量相对较高,可直接用于VLA模型训练,但采集成本也较高。例如,DROID组织50名采集者耗时一年,积累了约350小时真机数据。
第二种是人类第一视角(Egocentric)或动作捕捉。通过头戴摄像头、动捕服等设备记录人类日常活动中的第一视角视频与运动信号,更容易扩大采集规模,但通常缺少精确的三维动作轨迹、手指关节状态等信息,同时还需要处理人类与机器人之间的本体差异。
第三种是仿真数据。通过物理仿真引擎构建机器人的数字孪生进行训练,成本较低、数据规模较大,但仍存在Sim-to-Real 差距,摩擦、柔性物体和复杂受力等情况也较难准确模拟。
此外,视频蒸馏、互联网视频派生数据和跨本体迁移等方案,也成为当下较受关注的补充路径。总体来看,现有路线在数据质量、采集规模和生产成本之间各有取舍,目前仍难同时兼顾。
根据《Science Robotics》的相关测算,按照目前采集速度,积累 “ChatGPT 级” 规模的机器人交互数据可能需要 10 万年。这一估算指向的并非具体时间表,而是当前数据生产效率与未来训练需求之间的差距。
“我们要把它变成 100 年,甚至 10 年。”CTO 杨言超表示。为提高数据生产效率,团队选择通过算法降低采集过程对专用硬件的依赖,两款产品分别对应真机遥操作与人类第一视角两类数据来源。
EngramTeleOp 主要降低真机遥操作的设备投入、人员培训和部署门槛,同时提高数据的有效率与采集精度;EngramEgo 则将采集主体从机器人扩展到人,通过视觉算法补充第一视角数据中的三维动作与手物交互信息,使数据规模不再完全受机器人数量限制。两款产品共享的底层能力,是从视觉信号中重建人手、人体和物体的三维运动轨迹。
▍EngramTeleOp:用视觉替代动捕手套
要理解这套系统的技术路线,需要先看现有灵巧手动作捕捉方案如何获得精度。目前,市面上主流的灵巧手动捕方案,大致可以分为四类:电磁式、拉伸传感器式、惯性式和外骨骼式。它们的共同点是依赖额外的传感器硬件。
电磁式手套精度较高,但一只手套价格昂贵、容易损坏,且必须全程穿戴;拉伸传感器式虽然出货量较大,但精度容易受到材料迟滞和手型差异影响;惯性式依赖加速度积分推算轨迹,存在漂移累积;外骨骼式精度较高,但结构臃肿、单价较高,长时间穿戴也会增加操作员负担。
这类方案的设备、维护和标定成本,通常会随着操作员数量和适配本体数量增加而上升。
这套系统选择了另一条路线:纯视觉算法。纯视觉映射在学术界已有较长时间的研究,但是忆生科技是业内唯一一家把纯视觉算法做到生产级的精度和延迟的公司。数据精度目前介于拉伸动捕手套和电磁式动捕手套之间。随着算法优化,精度还在持续提升。
操作员只需要佩戴 VR 头显,无需使用手套、手柄或遥控器。系统通过摄像头实时捕捉双手动作,再将其转化为机械臂与灵巧手的控制指令。
降低对手部传感器的依赖后,技术难点转向手部位姿重建和动作重定向。第一个难题是手部位姿重建,即“看清人手在做什么”。系统通过视觉识别重建操作员双手的完整三维姿态,覆盖每个手指关节的角度与位置。
第二个难题是动作重定向,即“让机械手做出同样的动作”,这也是最难的一步。人手与机械手在结构上完全不同,手掌大小、手指长短、关节数量、指节比例都存在巨大差异。传统做法是“点对点映射”,本质是一张查找表:记住人手某个姿态对应机械手的某个姿态。但这种方式的泛化能力有限,遇到未覆盖的姿态时,容易出现错位或失控。
EngramTeleOp 在这一环节使用了自研的“生成式小脑”。
生成式小脑不再依赖固定的点对点映射,而是学习人手姿态与机械手关节状态之间的连续映射关系,使系统能够处理训练数据中未逐一出现的手部姿态。
这套算法可以适配不同手型的操作员,减少逐人标定,以及针对不同机械手重新开发映射规则的工作量。训练后的模型可以重复部署,随着数据积累和模型迭代,系统精度还可以继续提升。
内部测试显示,其采集有效数据率由约 30% 提升至 90%,单人日产能提升 10 至 30 倍,硬件成本降至传统方案的五分之一。
此外,该系统还支持全身多自由度遥操作。在本地部署条件下,系统延迟低于 10 ms。除跨机械手本体适配外,据公司介绍,系统还完成了跨省、跨国远程操控测试,并可完成旋拧、精密对位、柔性物体操作等精细任务。其标定时间压缩至 5 分钟,通过三步完成部署。
▍第一视角数据如何进入训练
传统的低成本第一视角设备可以记录人类工作过程,但标定漂移、遮挡和同步丢帧会造成约 30% 的无效数据;普通视频也很难准确还原手部三维结构、物体位姿和接触过程。
该系统的处理重点,是在完成第一视角采集后,通过 3D 网格重建、CUPID 遮挡物体生成式重建和 4D 手物交互重建,将视频转化为结构化物理数据。
首先是手。EngramEgo 将离散关键点扩展为连续曲面网格,单手包含 778 个顶点,双手包含 1,556 个顶点,可以进一步描述手部形变、接触区域和指节弯曲状态。
其次是全身运动。机器人完成走到桌前、弯腰、伸手、抓握、转身和放置等连续任务时,需要控制的范围会从手臂的 6—7 个自由度扩展到全身数十个关节。仅有手部姿态数据不足以覆盖这类任务,系统因此同步输出全身骨架和人体网格,覆盖头、肩、躯干、腿和足部。
第三是物体信息。传统第一视角方案通常可以给出二维语义分割,模型能够识别物体类别,却难以获得物体在三维空间中的位姿、朝向和形状。EngramEgo 输出物体的三维重建结果与六自由度位姿,补充物体在交互过程中的空间运动信息。
这三类几何信息由自研的 4D 手物交互算法连接起来。系统可以从第一视角视频中恢复手部位置、物体运动和双方发生接触的时间,并进一步将人类动作转化为可迁移到机械本体的训练数据。
在手物交互重建任务中,EngramEgo 将 W-MPJPE 误差降至 41.77 毫米,较此前公开结果 StableHand 的 57.83 毫米降低 27.8%。其物体与位姿联合建模算法 CUPID 入选 CVPR 2026 Highlight;面向第一视角传感条件的人体与手部运动估计算法 EgoAllo,已发表于 CVPR 2025。
硬件方面,EngramEgo 配备 4 颗全局快门相机和 IMU,水平视场达到 300 度,以 60 Hz 记录操作过程。整机重量约 350 克,续航约 8 小时,端侧支持 6 路同时采集。
较轻的设备形态降低了大规模采集的使用门槛。使用者无需佩戴动捕手套,也不需要提前适配机器人本体,可以在商超、药房、办公室和家庭等真实环境中完成日常操作,由系统记录并处理相关数据。
公司还为 EngramTeleOp 和 EngramEgo 搭建了四层数据处理体系,覆盖任务派发、数据审核、标准化和格式转换。
处理后的数据可以按照客户所需格式进入后续训练流程,减少额外的数据整理工作。
据公司介绍,相关数据和算法能力已在多家人形机器人企业及运控上游企业完成运动控制与灵巧操作适配,并正与制造头部制造业企业探索高柔性装配场景。
▍忆生科技的“自主智能”之路
数据采集只是忆生科技技术架构的前端,公司后续的技术布局还延伸至运动控制、记忆系统与世界模型。这套技术路线指向一个概念:“自主智能”,也就是忆生科技所定义的 “AI 2.0”。
创始人马毅教授认为,智能需要像生命一样,在“感知—记忆—预测—交互”的闭环反馈中学习。在长期演化过程中,动物通过感知环境、积累经验和接收行动反馈,不断调整行为与决策。
相比之下,当前的生成式大模型,即 AI 1.0,大多从预先准备的静态数据中学习。模型完成训练后,知识与能力基本固定,也较难根据行动结果持续调整自身。忆生科技所定义的“自主智能”,则需要从开放世界获取信息、形成经验,并在与环境的交互中持续学习。
围绕这一判断,公司模拟人类智能,构建了“大脑 + 小脑”的统一架构:“大脑”的视觉记忆负责感知外部环境、建立物理世界模型并进行推理;“小脑”的运动记忆负责获取本体状态、记录交互规律,并生成高频、稳定的运动控制策略。
两者形成一条闭环:大脑感知环境并预测下一步行动,小脑完成执行,执行结果再反馈给大脑,用于调整后续判断。
这套架构建立在记忆机制之上,“记忆生成”也是忆生科技名称的来源。在此前的采访中,CTO 杨言超表示:“有记忆,才能积累经验;能预测,才能理解交互后果;能持续学习,才能不断适应变化的环境和任务。”
具体到模型层面,这套架构并行推进物理世界模型与具身决策控制模型:物理世界模型对应“大脑”的视觉记忆,用于刻画空间几何结构和环境关系;具身决策控制模型对应“小脑”的运动记忆,用于记录交互过程中的时序规律。
对应到产品层面,两款数据采集产品位于体系前端,EngramControl 与 EngramNav 分别承接运动记忆和视觉记忆。采集后的交互数据继续进入控制与记忆系统,并在后续交互中持续积累。
忆生科技不生产机器人本体,而是通过“数据入口 + 记忆系统 + 世界模型”的工具链,为不同机器人本体提供环境感知、运动控制与持续学习能力。
公司的长期目标,是模拟人类的学习与记忆机制,构建能够从开放世界中积累经验、修正行为并持续进化的机器智能系统。这一长期技术愿景被概括为“硅基生命”。
▍从本体竞争走向自主智能
具身智能行业的关注重点正从本体参数转向真实场景。机器人能否稳定完成任务、适应复杂环境并在使用中持续迭代,开始成为新的衡量标准。
根据 TrendForce 预测,2026 年中国人形机器人产量将同比增长 94%,全球产业也将在下半年进入商业化的重要阶段;而在斯坦福 HAI《2026 AI Index Report》显示,机器人在仿真环境中的操控成功率达到 89.4%,在真实家庭场景中则为 12%。产业规模正在扩大,仿真能力与真实环境表现之间仍存在明显差距。
这意味着,具身智能需要解决的已经不只是数据数量问题,还包括数据能否转化为可以重复使用的能力。忆生科技基于记忆的生成式小脑架构,试图让机器人从任务执行中保留经验,并根据反馈调整后续行为。根据公司内部测试,该架构在多任务平均表现上较传统 VLA 模型提升 3 倍以上,单一模型完成多项任务的成功率超过 95%。
随着数据采集规模扩大,行业竞争还会继续延伸到数据如何进入模型、经验如何被保留,以及控制、记忆与世界模型能否形成闭环。具身智能的竞争也由单一本体能力,逐渐扩展到“本体—数据—模型—场景”组成的完整体系。忆生科技将这一长期方向概括为“自主智能 AI 2.0”:让机器人在真实世界中形成记忆,根据交互反馈调整行为,并在持续使用中获得新的能力。