[论文解读] Learning Social Affordance for Human-Robot Interaction
该论文提出一种基于马尔可夫链蒙特卡洛(MCMC)的弱监督生成模型,用于从RGB-D视频中学习社交功能(social affordances),发现人体关节的潜在子事件和功能分组,以实现人机交互。该方法使机器人能够通过建模代理之间的空间和运动势能,推断并复现自然、上下文感知的全身运动,即使在骨骼数据存在噪声的情况下,合成质量仍可与Kinect真实数据相媲美。
In this paper, we present an approach for robot learning of social affordance from human activity videos. We consider the problem in the context of human-robot interaction: Our approach learns structural representations of human-human (and human-object-human) interactions, describing how body-parts of each agent move with respect to each other and what spatial relations they should maintain to complete each sub-event (i.e., sub-goal). This enables the robot to infer its own movement in reaction to the human body motion, allowing it to naturally replicate such interactions. We introduce the representation of social affordance and propose a generative model for its weakly supervised learning from human demonstration videos. Our approach discovers critical steps (i.e., latent sub-events) in an interaction and the typical motion associated with them, learning what body-parts should be involved and how. The experimental results demonstrate that our Markov Chain Monte Carlo (MCMC) based learning algorithm automatically discovers semantically meaningful interactive affordance from RGB-D videos, which allows us to generate appropriate full body motion for an agent.
研究动机与目标
- 使机器人能够从人类示范视频中学习社交功能——多智能体交互中的动作可能性。
- 在骨骼估计存在噪声的情况下,建模人类交互的复杂时间动态,包括子事件分解和关节运动模式。
- 开发一种弱监督学习框架,无需强人类标注即可发现潜在子事件和功能性的关节分组。
- 通过实时推断人类运动的适当响应,合成逼真、上下文感知的全身运动序列。
- 将人类运动表征迁移至机器人,通过学习代理间的空间和运动势能,实现自然交互。
提出的方法
- 采用双层MCMC算法:外层通过Metropolis-Hastings采样执行子事件的时间解析,内层使用改进的中国餐馆过程(CRP)对关节进行分组。
- 为每个子事件中的关节分组学习空间和运动势能,捕捉身体部位之间的相对运动方式。
- 将社交功能表示为子事件间身体关节的分层运动模式,仅在具有社会意义的情境下激活功能。
- 将机器人视为多智能体交互中的一员,基于观测到的人类运动推断其自身运动。
- 将学习到的社交功能模型应用于未见场景,通过将学习到的关节轨迹与机器人运动学匹配,合成未来的骨骼序列。
- 使用带有估计骨骼的RGB-D视频数据,利用时间与空间约束提升对遮挡和噪声的鲁棒性。
实验结果
研究问题
- RQ1机器人如何从非结构化的交互视频中学习具有社会意义的动作可能性(即社交功能)?
- RQ2需要何种结构化表示,才能建模具有动态关节级协调与子事件分解的多智能体交互?
- RQ3弱监督学习方法如何从未见的、存在噪声的有限人类示范数据中发现潜在子事件和功能性关节分组?
- RQ4所学习的社交功能在多大程度上能生成在感知上与真实数据无法区分的运动序列?
- RQ5机器人如何基于学习到的社交功能表征,实时推断并执行对人类运动的适当响应?
主要发现
- 基于MCMC的学习算法成功从带有噪声骨骼的RGB-D视频中发现语义上有意义的子事件和功能性关节分组。
- 合成的运动序列在人类评分中与基于Kinect的真实数据相当,且在Q1和Q2中,“握手”和“投掷与接住”两项的平均评分高于真实数据。
- 在Q1中,87%的评分在“握手”合成序列中为4或5分,84%的评分在“投掷与接住”序列中为4或5分,表明感知质量优异。
- 由于学习到的关节分组,该模型在手部接触准确性方面优于真实数据,尤其在Kinect无法捕捉接触的遮挡情况下表现更优。
- 该方法在未见交互中泛化良好,等效性检验显示在90%置信水平下,与真实数据无显著差异。
- 该方法生成的运动合成对噪声具有鲁棒性,并能捕捉手接触等关键社交线索,而这些线索对人类感知自然交互至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。