GCL学术成果:SIGGRAPH Asia 2026-基于统一几何表示的跨形态机器手抓取

近日,SIGGRAPH Asia 2026 接收成果公布,来自中国科学技术大学数学科学学院 GCL 实验室的刘雨萌老师、刘利刚老师,联合中国科学院工业人工智能研究所的徐凯老师与深圳大学的胡瑞珍老师,提出了一种面向跨形态抓取生成的统一几何表示方法——InterMASH。它让人手(如 MANO)与多种机器人手(如 ShadowHand、Barrett、Allegro)共享同一套“描述语言”,并在这套表示上直接用生成模型合成稳定、自然的抓取姿势。

一、问题的起点:让不同形态的手,都能“稳稳抓住”

想象一下:你想让机器人抓起桌上的一个杯子,或者想让数字人自然地握住一个苹果。对人类来说这是再简单不过的动作,但对计算机来说,它必须先“想”出一只手每根手指该怎么摆放——这就是抓取生成(grasp synthesis)。它既是虚拟人、数字人动画的基础能力,也是机器人操作的核心问题。

抓取生成问题示意

图1:抓取生成问题示意。给定目标物体和指定型号的机器手,我们希望生成一个稳定、自然,并且能够由这只机器手实际执行的抓取姿态。

但“手”的形态千差万别:人有高度灵活的 MANO 参数化人手,机器人世界里也有 ShadowHand 五指灵巧手、Barrett 三指手、Allegro 四指手等各种设计,它们的关节数量、尺寸和外形都完全不同。如果为每一种手单独设计一套描述方式和生成模型,不仅重复劳动,数据还无法复用。一个自然的想法是:能不能找到一种统一的“描述语言”,不管是什么手、抓什么物体,手与物体的交互都能用同一套方式表达?这样一来,不同手的数据可以放在一起训练,甚至把人手的抓取经验“教”给机器手。

二、统一的“描述语言”难在哪里?

这个想法听起来很美好,但要真正实现,至少要迈过三道坎。

第一道坎:怎么描述一次抓取? 现有的两类主流表示各有短板。一类是接触图(contact map),它只在物体表面标注“哪里被碰到了”,却不描述参与抓取的手部形状——同一个接触区域可能对应完全不同的手势,容易产生歧义;另一类是稠密的几何表示,比如把手上每个点到物体的距离都存下来,虽然信息完整,却维度高、冗余大、计算昂贵。从里面提取出的点云还常带有噪声,看不清手的结构细节。换句话说,我们需要的表示必须同时做到三点:足够紧凑、足够有表达力,还能在不同手之间保持统一——就像既要给每只手建立一份“档案”,又要让所有档案都使用同一种格式。

第二道坎:不同手之间如何“对上号”? 即使有了统一的描述格式,不同手对应的部位也未必一致——同一个位置,在人类手上可能对应指尖,在机器人手上却可能对应手掌。如果不解决这种“同名不同义”的问题,把不同手的数据混在一起训练反而会互相干扰。

第三道坎:生成的手势必须“物理上可行”。 不能穿透物体、不能自碰撞,接触还要稳定。仅仅看起来像是不够的,手势必须真的能抓住东西。

三、我们的思路:给手—物交互建立一套“通用坐标系”

对上述挑战,我们提出了 InterMASH:让形态各异的人手和机器人手共享同一套描述方式,并在这个统一空间中生成抓取。

InterMASH总览

图2:InterMASH 总览。四种形态各异的手共享同一套锚点表示:每个锚点同时记录附近的物体形状、手部形状和接触信息,因此同一个模型就能生成不同手的抓取。

InterMASH 的做法可以概括成两步:先在物体周围建立一套固定的“坐标系”,再用紧凑的系数为每个位置记录局部“档案”。

具体来说,我们在物体周围的一个球面上固定放置一组采样点(称为“锚点”,实验中为128个)。它们的位置只由物体决定,和是哪只手无关——就像在物体周围架起了一圈位置固定的“摄像头”,不管是人手还是机器人手来抓,看到的都是同一组机位。

每个锚点负责记录三件事:它附近的手部表面形状、物体表面形状,以及接触强度。我们不去存储一整个点云,而是用一小组系数来概括这些局部面片,相当于用寥寥几笔勾出一小片曲面的轮廓。这样一来,每个锚点就变成一条简洁、可解释的“笔记”,一次抓取也就变成了一串长度固定、信息紧凑的记录。

InterMASH方法总览

图3:方法总览。先用统一表示描述手与物体的交互,再用扩散模型生成抓取,最后通过逆运动学得到可执行的关节姿态。

接下来解决“对上号”的问题。我们请人手来当“标准模板”:先为人手的局部面片排好顺序,再根据机器人手的关键点到这些面片的距离特征,自动找出两只手之间最合理的面片配对。这样,同一个锚点在所有手上都指代语义一致的区域——相当于给不同语言的手建立了一本“对照词典”。在这个过程中,同时拟合手和物体的局部系数容易不稳定。我们采用“先粗后细”的策略:先让模型把握整体轮廓,再逐步补齐细节,使重建既稳定又准确。

跨手部的对上号过程

图4:跨手部的“对上号”过程。以人手为参考,通过关键点距离特征为机器人手的局部面片找到语义对应的位置。

四、让模型学会“生成”抓取

有了统一的表示,抓取生成就变成了“在固定格式下填空”:给定物体和一只模板手,让模型生成对应的手部几何和接触信息。我们采用近年来在图像生成中大放异彩的扩散模型(Diffusion)来完成这项任务:从一团随机噪声出发,一步步“去噪”,最终得到一次合理的抓取。

为了让生成的抓取不仅“像”,而且“能用”,我们还做了三件事:

  • 让模型看邻居: 抓取是高度局部化的行为,相邻区域的信息最重要。我们在注意力机制中显式加强了这种局部关联,相当于拼图时优先拼合相邻的碎片;
  • 训练时学物理: 把穿透、自碰撞等物理惩罚加入训练目标,让模型主动避开不合理的手势;
  • 生成时纠偏: 在每一步去噪中估计当前“干净”的几何,并沿着更符合物理的方向微调,好比在整个生成过程中安排一位物理教练随时纠正动作。

最后,生成的几何还需要“翻译”成真实手的关节角度才能驱动机器人。我们用逆运动学(即根据手的形状反推各关节角度)完成这一转换,平均不到0.4秒即可解码一个抓取,成功率超过99%。

五、实验效果

我们在多个公开数据集上进行了系统验证。

单手抓取(DexGraspNet、ShadowHand): 在最常用的“至少一个方向扰动下仍稳定”指标上,我们的成功率达到91.9%,优于所有对比方法;最大穿透深度仅16.2毫米,是所有方法中最低的,说明生成的手势更贴合物体、更少穿模;在更严格的“六个方向扰动都稳定”指标上达到53.5%,与最优方法相当。多样性指标略低,这体现了“质量—多样性”的权衡:我们的方法更偏向物理可靠的抓取。

跨形态抓取(Barrett + ShadowHand 混合训练): 仅用一个模型同时学习两种手,Barrett上的成功率达到90.3%,为该数据集最优;ShadowHand也从“只学一种手”的57.6%提升到64.2%,说明不同形态的手确实能互相促进。不过在样本更少、自由度更高的ShadowHand上,我们与专门方法仍有差距,这也反映出通用表示在数据有限情况下的挑战。

人手的经验能帮到机器手吗? 我们在机器人抓取数据之外,加入了同等数量的人手抓取数据进行微调:成功率从25.8%提升到29.0%,多样性从0.450提升到0.500。这说明人手的抓取经验可以迁移给机器手。穿透指标有所上升,主要因为人手数据本身的穿透更大——迁移效果也取决于“老师”数据的质量。

哪些设计起了作用? 对比实验显示:相比传统的点集表示等方案,我们的统一表示在三种手上都大幅领先;加入物理引导训练后成功率明显提升,再进一步引入物理引导采样和“看邻居”的注意力设计,Barrett与ShadowHand上的成功率最终达到90.3%和64.2%。这几项设计缺一不可。

六、总结与展望

我们这项工作的核心贡献,用一句话概括就是:为手—物交互建立了一套跨形态通用的“坐标系”和“描述语言”,并在此基础上让生成模型直接产出稳定、自然的抓取。它展示了一条有潜力的路径:不同形态的手——包括人手和各类机器人手——可以在同一表示空间中互相学习。

目前我们采用的还是一种较为通用的表示,尚未专门为不同手型定制结构先验,因此在数据较少、自由度较高的场景下,效率仍有提升空间。未来,我们计划引入更高效的数据先验和预训练策略,并解决混合左右手训练中的歧义问题,让这套统一表示在更多形态、更多数据条件下都能稳定受益。

论文发表

该工作已被计算机图形学顶级国际会议 SIGGRAPH Asia 2026 接收。

论文信息

论文标题: InterMASH: A Unified Geometric Representation for Grasp Synthesis

作者: 杨萱泽(1)、刘雨萌(1)、辛海洋(1)、李常颖(1)、沈皓玮(1)、徐凯(2)、刘利刚(1)、胡瑞珍(3)

单位: 中国科学技术大学(1)、中国科学院工业人工智能研究所(2)、深圳大学(3)

项目主页: https://inter-mash.github.io/