Skip to main content
QUICK REVIEW

[论文解读] Unified Human-Scene Interaction via Prompted Chain-of-Contacts

Zeqi Xiao, Tai Wang|arXiv (Cornell University)|Sep 14, 2023
Human Pose and Action Recognition被引用 4
一句话总结

本文提出UniHSI,一种统一的人机场景交互框架,通过自然语言指令实现多样化、长时程的物理交互。通过将交互建模为接触链(Chain of Contacts)——即人体关节与物体部件的连续接触对,UniHSI利用基于大语言模型(LLM)的规划器生成任务计划,并通过统一控制器执行,实现无需标注数据的训练,且在真实扫描场景中展现出强大的泛化能力。

ABSTRACT

Human-Scene Interaction (HSI) is a vital component of fields like embodied AI and virtual reality. Despite advancements in motion quality and physical plausibility, two pivotal factors, versatile interaction control and the development of a user-friendly interface, require further exploration before the practical application of HSI. This paper presents a unified HSI framework, UniHSI, which supports unified control of diverse interactions through language commands. This framework is built upon the definition of interaction as Chain of Contacts (CoC): steps of human joint-object part pairs, which is inspired by the strong correlation between interaction types and human-object contact regions. Based on the definition, UniHSI constitutes a Large Language Model (LLM) Planner to translate language prompts into task plans in the form of CoC, and a Unified Controller that turns CoC into uniform task execution. To facilitate training and evaluation, we collect a new dataset named ScenePlan that encompasses thousands of task plans generated by LLMs based on diverse scenarios. Comprehensive experiments demonstrate the effectiveness of our framework in versatile task execution and generalizability to real scanned scenes. The project page is at https://github.com/OpenRobotLab/UniHSI .

研究动机与目标

  • 解决当前人机场景交互(HSI)系统中缺乏多样化交互控制与用户友好接口的问题。
  • 克服现有方法仅支持有限交互类型或依赖大量人工标注运动数据的局限性。
  • 通过统一、可扩展的框架,实现长时程、多轮次的交互转换。
  • 开发一种仅依赖语言输入与场景语义信息即可支持细粒度、多对象交互的系统。
  • 通过利用大语言模型(LLM)生成交互计划,减少对昂贵人工标注交互数据集的依赖。

提出的方法

  • 将人机场景交互定义为接触链(Chain of Contacts, CoC):即人体关节与物体部件在接触状态下的连续配对,以捕捉交互动力学。
  • 使用大语言模型(LLM)规划器,通过提示工程将自然语言指令转化为结构化的CoC任务计划。
  • 设计统一控制器,其中任务解析器(TaskParser)处理关节位姿与物体点云,生成统一的任务观测与目标。
  • 集成对抗性运动先验与物理仿真,确保生成动作的逼真性与物理合理性。
  • 通过利用LLM生成的交互计划,实现端到端无交互标注的训练。
  • 构建ScenePlan数据集,包含基于PartNet与ScanNet场景生成的数千条LLM生成的交互计划,用于训练与评估。

实验结果

研究问题

  • RQ1统一框架能否仅通过自然语言指令支持多样化的人机场景交互?
  • RQ2接触链(CoC)形式化是否能在多种交互类型上实现泛化,包括多轮次与多对象交互?
  • RQ3大语言模型(LLM)能否在无人工标注数据的情况下,有效生成准确且可执行的交互计划?
  • RQ4统一控制器在真实扫描的3D场景(如ScanNet)中的泛化能力如何,是否超越合成训练环境?
  • RQ5该框架在实现细粒度、长时程控制方面表现如何,能否实现对精确关节与物体部件的协调控制?

主要发现

  • UniHSI仅通过语言指令即可实现对多样化交互的统一、长时程控制,包括复杂转换如‘双手搭在扶手上就座’或‘屈膝仰卧于床上’等。
  • 该框架支持对15个全身关节及任意物体部件的细粒度控制,可实现多对象与多接触点交互。
  • ScenePlan数据集包含超过1,000种独特交互计划,涵盖两个版本,对复杂行为(如仰卧于床或肘部搭在扶手上就座)提供详细的接触构型。
  • 实验表明,系统在来自ScanNet的真实扫描场景中展现出强大泛化能力,证明其在真实世界中的鲁棒性。
  • 系统完全无需交互标注,仅依赖LLM生成的计划,与先前方法相比显著降低了数据采集成本。
  • 与现有最先进方法相比,UniHSI首次同时支持统一交互、语言输入、长时程转换、无标注训练与全身关节控制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。