[논문 리뷰] BEHAVIOR: Benchmark for Everyday Household Activities in Virtual, Interactive, and Ecological Environments
BEHAVIOR는 현실적이고 다양하며 장기적 가정 활동에서 구현형 AI를 위한 100-작업 벤치마크를 제안하고, 시뮬레이터에 구애받지 않는 요구사항, 그리고 평가를 위한 인간 VR 시연을 제시한다.
We introduce BEHAVIOR, a benchmark for embodied AI with 100 activities in simulation, spanning a range of everyday household chores such as cleaning, maintenance, and food preparation. These activities are designed to be realistic, diverse, and complex, aiming to reproduce the challenges that agents must face in the real world. Building such a benchmark poses three fundamental difficulties for each activity: definition (it can differ by time, place, or person), instantiation in a simulator, and evaluation. BEHAVIOR addresses these with three innovations. First, we propose an object-centric, predicate logic-based description language for expressing an activity's initial and goal conditions, enabling generation of diverse instances for any activity. Second, we identify the simulator-agnostic features required by an underlying environment to support BEHAVIOR, and demonstrate its realization in one such simulator. Third, we introduce a set of metrics to measure task progress and efficiency, absolute and relative to human demonstrators. We include 500 human demonstrations in virtual reality (VR) to serve as the human ground truth. Our experiments demonstrate that even state of the art embodied AI solutions struggle with the level of realism, diversity, and complexity imposed by the activities in our benchmark. We make BEHAVIOR publicly available at behavior.stanford.edu to facilitate and calibrate the development of new embodied AI solutions.
연구 동기 및 목표
- 실제 데이터를 기반으로 한 100개의 일상 가정 활동의 현실적이고 다양하며 복합적인 집합을 정의한다.
- 무한한 인스턴스화에 대해 초기 조건과 목표 조건을 표현하기 위한 술어-논리 기반 도메인 정의 언어(BDDL)를 제공한다.
- 시뮬레이터 독립적 요구사항을 식별하고 iGibson 2.0에서 기능적 구현을 제공한다.
- 사람-상대 성공 및 효율 프레임워크를 포함한 강력한 평가 지표를 확립한다.
- 평가 및 모방 학습을 위한 기준으로 500개의 VR 기반 인간 시연 데이터셋을 제공한다.
제안 방법
- BEHAVIOR 도메인 정의 언어(BDDL)를 도입하고, 시뮬레이션된 상태를 초기 및 목표 조건에 대한 시맨틱 술어로 매핑하는 술어-논리 표현이다.
- 현실적 시뮬레이션을 위한 환경에 구애받지 않는 기능적 요구사항을 제안하고, BEHAVIOR를 iGibson 2.0에서 391개의 범주에 걸친 1217개 객체 모델로 구현한다.
- 활동을 POMDP로 정의하고 형식적 tau = {S_tau,0, S_tau,g}를 가지며, BDDL를 통해 무한한 유효 초기 상태와 해를 샘플링하는 메커니즘을 제공한다.
- 주요 성공 점수 Q를 포함하고 여섯 개의 보조 효율성 지표를 포함하는 포괄적 평가 지표를 개발하며, VR 시연 데이터셋을 사용한 인간 성과로 표준화한다.
- 500 VR 시연(758.5분)을 인간 기준 참값으로 제공하고 모방 학습 및 인간 벤치마킹 분석을 지원한다.
실험 결과
연구 질문
- RQ1구현형 AI 벤치마크에서 현실적이고 장기적 가정 활동을 어떻게 정의하고, 구현하며 평가할 수 있는가?
- RQ2술어-논리 도메인 언어(BDDL)가 장면 전반에 걸쳐 활동의 무한하고 다양한 인스턴스화를 가능하게 하는가?
- RQ3BEHAVIOR를 구현하기 위해 필요한 시뮬레이터 요건은 무엇이며, 현행 구현형 AI 방법들이 BEHAVIOR 과제에서 얼마나 잘 수행하는가?
- RQ4사람의 VR 시연은 현실성, 다양성, 복잡성 지표에서 AI 에이전트와 어떻게 비교되는가?
주요 결과
- BEHAVIOR는 장기적 시야, 다수의 객체 및 다양한 상태 변화로 구성된 100개의 활동을 산출하며, 이는 최첨단 RL 방법에 도전이 된다.
- 500개의 시연으로 구성된 인간 VR 데이터셋은 평가 및 모방 학습을 위한 풍부한 기준 참값을 제공한다.
- RL 에이전트는 고급 센싱 및 행동에도 불구하고 원래 BEHAVIOR 활동에서 어떤 목표 술어도 달성하기 어렵다; 시야를 축소하거나 물리 모델을 단순화하면 성능이 향상된다.
- 장면들, 객체들 및 초기 상태 전반의 다양성과 복잡성은 RL 성능을 현저히 저하시켜, 계층적이거나 계획 기반 접근의 필요성을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.