[논문 리뷰] Unified Human-Scene Interaction via Prompted Chain-of-Contacts
이 논문은 자연어 명령어를 통해 다양한 장기적인 물리적 상호작용을 가능하게 하는 통합형 인간-장면 상호작용 프레임워크인 UniHSI를 제안한다. 상호작용을 연속적인 인간 관절-물체 부위 접촉 쌍으로 모델링함으로써 UniHSI는 LLM 기반 계획기와 통합 제어기를 사용하여 작업 계획을 생성하고 실행하며, 상호작용 레이블 없이도 훈련이 가능하고 실제 스캔된 장면에서 뛰어난 일반화 성능을 달성한다.
Human-Scene Interaction (HSI) is a vital component of fields like embodied AI and virtual reality. Despite advancements in motion quality and physical plausibility, two pivotal factors, versatile interaction control and the development of a user-friendly interface, require further exploration before the practical application of HSI. This paper presents a unified HSI framework, UniHSI, which supports unified control of diverse interactions through language commands. This framework is built upon the definition of interaction as Chain of Contacts (CoC): steps of human joint-object part pairs, which is inspired by the strong correlation between interaction types and human-object contact regions. Based on the definition, UniHSI constitutes a Large Language Model (LLM) Planner to translate language prompts into task plans in the form of CoC, and a Unified Controller that turns CoC into uniform task execution. To facilitate training and evaluation, we collect a new dataset named ScenePlan that encompasses thousands of task plans generated by LLMs based on diverse scenarios. Comprehensive experiments demonstrate the effectiveness of our framework in versatile task execution and generalizability to real scanned scenes. The project page is at https://github.com/OpenRobotLab/UniHSI .
연구 동기 및 목표
- 인간-장면 상호작용(HSI) 시스템에서 다양한 상호작용 제어와 사용자 友好的 인터페이스의 부족을 해결한다.
- 기존 방법들이 좁은 상호작용 유형만 지원하거나 광범위한 인간 레이블 기반 운동 데이터가 필요로 하는 한계를 극복한다.
- 통합적이고 확장 가능한 프레임워크를 통해 장기적인, 다중 라운드 전환을 가능하게 한다.
- 오직 언어 입력과 장면 의미 정보만을 활용해 세밀한 다중 물체 상호작용을 지원하는 시스템을 개발한다.
- 비용이 많이 드는 인간 레이블 기반 상호작용 데이터셋에 대한 의존도를 줄이기 위해 LLM을 활용해 상호작용 계획을 생성한다.
제안 방법
- 인간-장면 상호작용을 체인 오브 컨택츠(Chain of Contacts, CoC)로 정의한다: 연속적인 인간 관절과 물체 부위 간의 접촉 쌍으로 상호작용 역학을 포괄한다.
- 대규모 언어 모델(Large Language Model, LLM) 플래너를 사용해 프롬프트 엔지니어링을 통해 자연어 명령어를 구조화된 CoC 작업 계획으로 변환한다.
- 작업 파서(TaskParser)를 갖춘 통합 제어기를 설계하여 관절 자세와 물체 포인트 클라우드를 처리해 통일된 작업 관측치와 목표를 생성한다.
- 적대적 운동 사전 지식과 물리 시뮬레이션을 통합해 현실적이며 물리적으로 타당한 운동 생성을 보장한다.
- LLM이 생성한 상호작용 계획을 활용해 상호작용 레이블 없이도 종단 간(end-to-end)으로 시스템을 훈련시킨다.
- PartNet와 ScanNet 기반 장면에서 생성한 수천 개의 LLM 기반 상호작용 계획을 포함하는 ScenePlan 데이터셋을 구축하여 훈련 및 평가에 활용한다.
실험 결과
연구 질문
- RQ1통합 프레임워크는 오직 자연어 명령어만으로 다양한 인간-장면 상호작용을 지원할 수 있는가?
- RQ2체인 오브 컨택츠(CoC) 공식화는 다중 라운드 및 다중 물체 상호작용을 포함한 여러 상호작용 유형으로 일반화될 수 있는가?
- RQ3인간 레이블 기반 데이터 없이 LLM이 정확하고 실행 가능한 상호작용 계획을 효과적으로 생성할 수 있는가?
- RQ4통합 제어기는 합성 훈련 환경을 초월해 실제 스캔된 3D 장면에 얼마나 잘 일반화되는가?
- RQ5이 프레임워크는 얼마나 정교한, 장기적인 제어를 가능하게 하는가? 특히 정확한 관절과 물체 부위의 조율이 가능한가?
주요 결과
- UniHSI는 자연어 명령어만으로도 다양한 상호작용을 통합적이고 장기적인 방식으로 제어하며, 팔을 팔걸이에 올리고 앉는 것이나 무릎을 들어 침대에 눕는 것과 같은 복잡한 전환도 가능하다.
- 이 프레임워크는 15개의 전신 관절과 임의의 물체 부위에 대해 세밀한 제어를 가능하게 하여 다중 물체 및 다중 접촉 상호작용을 지원한다.
- ScenePlan 데이터셋은 두 가지 버전에서 1,000개 이상의 고유한 상호작용 계획을 포함하며, 침대에 눕거나 팔을 팔걸이에 올리고 앉는 복잡한 행동에 대한 구체적인 접촉 형성 정보를 포함한다.
- 실험 결과는 합성 훈련 데이터를 초월해 ScanNet의 실제 스캔된 장면으로의 강력한 일반화 성능을 입증한다.
- 시스템은 상호작용 레이블 없이도 작동하며, 오직 LLM이 생성한 계획에 의존하므로 이전 방법에 비해 데이터 수집 비용을 크게 절감한다.
- 기존 최고 성능(SOTA) 방법들과 비교해 UniHSI는 오직 유일하게 통합적 상호작용, 언어 입력, 장기적인 전환, 레이블 없는 훈련, 전신 관절 제어를 모두 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.