[论文解读] Continual Learning of Hand Gestures for Human-Robot Interaction
该论文提出HAGIL,一种使用单个RGB摄像头和MediaPipe提取的手部关键点,用于静态手势增量识别的持续学习框架。在仅使用每类5个样本的情况下,学习38种手势后平均准确率超过90%,增量训练时间减少至全量微调的10%以下,同时通过iCaRL等有效的回放策略缓解灾难性遗忘。
In this paper, we present an efficient method to incrementally learn to classify static hand gestures. This method allows users to teach a robot to recognize new symbols in an incremental manner. Contrary to other works which use special sensors or external devices such as color or data gloves, our proposed approach makes use of a single RGB camera to perform static hand gesture recognition from 2D images. Furthermore, our system is able to incrementally learn up to 38 new symbols using only 5 samples for each old class, achieving a final average accuracy of over 90\%. In addition to that, the incremental training time can be reduced to a 10\% of the time required when using all data available.
研究动机与目标
- 使机器人能够在不遗忘先前学习内容的前提下,增量学习新的静态手势。
- 开发一种低成本、无传感器的解决方案,仅使用单个RGB摄像头实现实时人机交互中的手势识别。
- 在每类数据有限的实际机器人场景中,评估持续学习策略的有效性。
- 引入一个新的基准数据集,包含4名受试者执行的21种手势,用于持续手势学习。
- 在保持高准确率的同时,最小化计算成本和内存使用,适用于增量学习场景。
提出的方法
- 系统使用MediaPipe的轻量级手部关键点检测器,从RGB图像中提取21个关键点坐标。
- 将手部关键点编码为固定长度的特征向量,输入神经网络分类器。
- 采用改进的FACIL框架,集成增量学习策略,包括iCaRL和IL2M,以支持持续学习。
- iCaRL方法采用最近样本均值分类器和小规模记忆的特征回放机制,每类仅保留5个样本。
- 通过过去类别样本的回放记忆进行增量训练,显著减少灾难性遗忘。
- 通过仅对新类别和少量旧类别样本进行微调,优化训练过程,大幅降低训练时间。

实验结果
研究问题
- RQ1机器人能否仅从RGB图像中增量学习新的静态手势,而不会遗忘先前学习的手势?
- RQ2在持续学习手势识别过程中,小规模回放记忆(每类5个样本)在保持高准确率方面有多有效?
- RQ3在低数据和低计算资源约束下,iCaRL与IL2M哪种增量学习策略表现更优?
- RQ4与其它基于传感器的方法相比,使用单个RGB摄像头提取的手部关键点在准确率和效率方面表现如何?
- RQ5所提出的系统能否实现实时性能,适用于真实世界人机交互场景的部署?
主要发现
- HAGIL在仅使用每类5个样本的情况下,学习38种不同手势后,平均准确率超过90%。
- 增量训练时间减少至全量微调所需时间的10%以下,HAGIL仅用7.76秒完成训练,而联合基线方法需79.73秒。
- 在Kaggle ASL字母数据集上,HAGIL在学习前7种类别后准确率迅速稳定在高水平,而联合基线方法的性能随时间持续下降。
- 在低样本条件下,iCaRL策略优于IL2M,尤其得益于其高效的最近样本均值分类器。
- 系统每推理一次的总延迟为37.5ms,支持约26 FPS的实时运行,适用于真实世界部署。
- 所引入的由4名受试者执行的21种手势数据集,为手势识别中的持续学习提供了新的基准。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。