[论文解读] Gesture Recognition for Initiating Human-to-Robot Handovers
本文提出一种模块化、以物体为中心的深度学习方法,通过单张RGB图像检测人类向机器人传递物品的手势。该方法使用三个神经网络——物体检测器、人体关键点估计算法和头部姿态预测器——随后通过多层感知机进行二分类。通过将人体关键点相对于物体进行表示,该方法实现了90.6%的准确率,优于端到端和基于骨骼的基线模型。
Human-to-Robot handovers are useful for many Human-Robot Interaction scenarios. It is important to recognize when a human intends to initiate handovers, so that the robot does not try to take objects from humans when a handover is not intended. We pose the handover gesture recognition as a binary classification problem in a single RGB image. Three separate neural network modules for detecting the object, human body key points and head orientation, are implemented to extract relevant features from the RGB images, and then the feature vectors are passed into a deep neural net to perform binary classification. Our results show that the handover gestures are correctly identified with an accuracy of over 90%. The abstraction of the features makes our approach modular and generalizable to different objects and human body types.
研究动机与目标
- 为解决检测人类意图将物品传递给机器人的问题,避免不安全的抓取行为。
- 开发一种感知系统,仅通过单张RGB图像的视觉线索可靠识别传递意图。
- 构建一种模块化且可泛化的框架,独立于物体类型、人类外观以及图像中的空间位置。
- 通过区分有意传递与偶然的物体接近行为,提升人机交互的安全性与可靠性。
提出的方法
- 系统使用Faster R-CNN进行物体检测,输出人类所持物体的边界框坐标。
- 采用Keypoint R-CNN检测17个人体关键点,其坐标相对于物体边界框进行归一化,实现以物体为中心的表示。
- 采用多损失ResNet50模型,以欧拉角(偏航、俯仰、滚转)形式估计头部相对于相机坐标系的姿态。
- 将三个模块的特征拼接成一个26维特征向量,缺失检测时使用占位值(-999)。
- 使用带有二元交叉熵损失的多层感知机(MLP)将特征向量分类为二元输出:传递或不传递。
- 系统在自定义数据集上进行训练,采用5次随机的训练/测试划分,通过使用相对关键点坐标提升鲁棒性。
实验结果
研究问题
- RQ1能否仅通过单张RGB图像可靠检测人类启动机器人传递的意图?
- RQ2以物体为中心的人体关键点表示如何提升在不同人类位置和物体类型下的检测鲁棒性?
- RQ3与端到端或基于骨骼图像的方法相比,模块化特征提取是否带来性能提升?
- RQ4不同特征表示方式(绝对坐标与相对坐标)对分类准确率有何影响?
主要发现
- 所提方法在使用相对于物体表示的人体关键点时,实现了90.6%的准确率,优于所有基线模型。
- 端到端的ResNet50基线模型达到89.4%的准确率,表明仅使用原始RGB输入进行该任务具有较高难度。
- 基于骨骼图像的CNN基线模型准确率为83.3%,表明手工设计的骨骼表示效果有限。
- 基于绝对像素坐标的关节点表示达到90.1%的准确率,表明相对表示提供了微小但一致的性能提升。
- 由于采用以物体为中心的设计,系统即使在人类位于图像角落或未持物时也能正确识别传递手势。
- 观察到部分失败案例,主要由于数据集规模限制和未涵盖的场景,表明在更大、更多样化的数据集上仍有改进空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。