[论文解读] Learning Social Affordance Grammar from Videos: Transferring Human Interactions to Human-Robot Interactions
本文提出一种弱监督框架,从人类交互的RGB-D视频中学习时空AND-OR图(ST-AOG)形式的社会可操作性语法,实现人机交互(HRI)中的实时动作推理。该方法利用Gibbs采样学习分层的长期联合子任务与短期原子动作,成功将类人行为迁移至Baxter机器人,在未见场景中展现出优于基线方法的逼真度与适应性。
In this paper, we present a general framework for learning social affordance grammar as a spatiotemporal AND-OR graph (ST-AOG) from RGB-D videos of human interactions, and transfer the grammar to humanoids to enable a real-time motion inference for human-robot interaction (HRI). Based on Gibbs sampling, our weakly supervised grammar learning can automatically construct a hierarchical representation of an interaction with long-term joint sub-tasks of both agents and short term atomic actions of individual agents. Based on a new RGB-D video dataset with rich instances of human interactions, our experiments of Baxter simulation, human evaluation, and real Baxter test demonstrate that the model learned from limited training data successfully generates human-like behaviors in unseen scenarios and outperforms both baselines.
研究动机与目标
- 开发一种通用框架,从人类交互视频中学习社会可操作性语法,以支持自然的人机交互。
- 通过编码社交礼仪、协作与帮助行为,解决机器人任务规划中缺乏社交规范建模的问题。
- 通过将学习到的语法迁移至未见交互场景,实现实时动作推理,支持人形机器人运行。
- 通过同时建模长期联合子目标与短期个体动作,提升机器人行为的逼真度与适应性。
- 克服先前工作依赖刚性表示或无法泛化至新情境的局限性。
提出的方法
- 将社会可操作性表示为时空AND-OR图(ST-AOG),编码分层子任务与细粒度动作定位(如手势、面向方向)。
- 利用Gibbs采样从RGB-D视频中提取的噪声人类骨骼数据进行弱监督学习,实现端到端的语法构建。
- 通过联合子任务(如牵手)与个体原子动作(如抬手)建模交互,引入时空约束。
- 通过从学习到的ST-AOG中采样解析图,实现实时动作推理,以5 fps生成类人机器人动作。
- 在机器人手部集成压力传感器,以检测抓握关系,并补偿真实部署中Kinect骨骼数据的噪声。
- 通过直接映射与逆运动学,将人类关节约束映射至Baxter机器人的运动学结构,实现尽管存在结构差异仍可成功迁移动作。
实验结果
研究问题
- RQ1如何在弱监督设置下,从未结构化的RGB-D人类交互视频中学习社会可操作性语法?
- RQ2分层的时空语法(ST-AOG)能否有效表示人类交互中的长期联合子目标与短期个体动作?
- RQ3所学语法在未见交互场景中的泛化能力如何?是否能实现逼真的机器人行为?
- RQ4基于ST-AOG的实时动作推理在动作逼真度与任务成功率方面,相较于基线方法表现如何?
- RQ5传感器融合(如压力传感器)是否能提升真实HRI场景中对骨骼追踪噪声的鲁棒性?
主要发现
- 与基线相比,所提方法在机器人与真实人类骨骼之间的平均关节约差值显著更低,表明其生成的臂部动作更接近人类行为。
- 在人类评估中,该方法在Q1与Q2问题上分别获得更高的平均评分(4.3与4.2),且标准差更低,表明行为表现一致且自然。
- 即使人类在不同姿势(如坐姿与站姿)下,机器人仍能成功完成击掌与交接等交互动作,证明其泛化能力。
- 实时动作推理系统以5 fps运行,支持在线交互;而基线B2每条计划需超过10秒,仅能离线评估。
- 在机器人手部集成压力传感器后,显著提升了对牵手关系的检测能力,增强了对噪声Kinect数据的鲁棒性。
- ST-AOG模型成功捕捉了潜在子目标(如相互牵手),并实现对新场景的适应,优于刚性表示与简单IK基线方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。