[논문 리뷰] InsActor: Instruction-driven Physics-based Characters
InsActor는 언어 조건부 운동 계획과 학습된 저수준 스킬을 융합함으로써 물리 기반 캐릭터의 물리적으로 타당하고 지시 기반 애니메이션을 생성하는 계층적 디퓨전 기반 프레임워크이다. 고수준 지시를 잠재 스킬 시퀀스로 매핑하여 물리적 타당성과 운동 일관성을 보장함으로써, 복잡한 작업에서 90.7%의 성공률을 기록하며 지시 수행 및 웨이포인트 탐색 분야에서 최신 기술 수준(SOTA) 성능을 달성한다.
Generating animation of physics-based characters with intuitive control has long been a desirable task with numerous applications. However, generating physically simulated animations that reflect high-level human instructions remains a difficult problem due to the complexity of physical environments and the richness of human language. In this paper, we present InsActor, a principled generative framework that leverages recent advancements in diffusion-based human motion models to produce instruction-driven animations of physics-based characters. Our framework empowers InsActor to capture complex relationships between high-level human instructions and character motions by employing diffusion policies for flexibly conditioned motion planning. To overcome invalid states and infeasible state transitions in planned motions, InsActor discovers low-level skills and maps plans to latent skill sequences in a compact latent space. Extensive experiments demonstrate that InsActor achieves state-of-the-art results on various tasks, including instruction-driven motion generation and instruction-driven waypoint heading. Notably, the ability of InsActor to generate physically simulated animations using high-level human instructions makes it a valuable tool, particularly in executing long-horizon tasks with a rich set of instructions.
연구 동기 및 목표
- 고수준 인간 지시로 제어되는 물리 시뮬레이션 기반 캐릭터 애니메이션을 가능하게 하되, 자연어로 표현된 지시가 복잡하고 다양한 특성을 가짐을 목표로 한다.
- 지시와 의미적으로 일치하면서도 동적인 환경에서 물리적으로 타당한 운동 계획을 생성하는 도전 과제를 해결한다.
- 직접적인 디퓨전 정책 출력이 물리 시뮬레이션에서 타당하지 않거나 불안정한 상태 전이를 유도할 수 있는 한계를 극복한다.
- 사용자 정의 작업 재학습 없이도 장기적 수평 작업과 웨이포인트와 같은 상호작용 조건을 지원하는 확장성 있고 유연한 프레임워크를 개발한다.
- 개선된 강건성과 일반화 능력을 갖춘 새로운 기준을 설정하여 언어 조건부, 물리 기반 캐릭터 애니메이션을 위한 새로운 베이스라인을 수립한다.
제안 방법
- 자연어 지시 조건부로 고수준 운동 계획을 생성하는 디퓨전 정책을 사용하여 테스트 시점에서의 조건부 설정을 민첩하게 가능하게 한다.
- 에ncoder-Decoder 아키텍처를 갖춘 비지도 스킬 발굴 모듈을 도입하여 관절 공간 궤적을 압축된 잠재 스킬 공간으로 매핑한다.
- 고수준 정책에서 유도된 비타당하거나 불안정한 상태 전이를 잠재 스킬 벡터로 인코딩하여 물리적 타당성을 보장한다.
- 역역학 정책과 호환되는 방식으로 학습된 스킬 임베딩을 실행 가능한 동작으로 디코딩한다.
- 역사적 운동에 대한 자동회귀 조건부 설정을 지원하여 상호작용적이고 다중 웨이포인트 탐색 작업을 가능하게 한다.
- 스킬 공간의 압축성과 지시-운동 일치도 간 균형을 조절할 수 있는 학습 가능한 가중치 인자 λ를 도입한다.
실험 결과
연구 질문
- RQ1디퓨전 기반 정책은 자연어 지시에서 의미적으로 일치하고 물리적으로 타당한 고수준 운동 계획을 생성할 수 있는가?
- RQ2고수준 정책에서 유도된 비타당한 상태 전이를 어떻게 수정하여 시뮬레이션에서 안정적이고 물리적으로 타당한 실행을 보장할 수 있는가?
- RQ3고수준 계획과 저수준 스킬 실행으로의 계층적 분해가 지시 기반 애니메이션에서 운동 품질과 작업 성공률을 얼마나 향상시키는가?
- RQ4특정 작업에 대한 재학습 없이도 장기 수평 작업과 다중 웨이포인트와 같은 상호작용 조건에 일반화할 수 있는가?
- RQ5스킬 공간의 압축성과 지시 일치도 간의 트레이드오프가 전체 성능에 미치는 영향은 어느 정도인가?
주요 결과
- InsActor는 복잡한 지시 수행 작업에서 90.7%의 성공률을 기록하여 Diffuser(38.0%) 및 기타 기존 방법보다 뚜렷이 뛰어난 성능을 보였다.
- 스킬 발굴을 통한 계층적 설계로 운동 충실도가 향상되고 오차 누적이 감소하여 높은 R-정밀도와 낮은 FID 점수를 달성했다.
- 제거 실험 결과, 고수준 계획과 저수준 스킬 실행의 조합이 필수적임을 확인했다. 고수준 정책만을 사용할 경우 지시 일치도가 열악했고, 저수준 정책만을 사용할 경우 언어적 맥락을 이해하지 못했다.
- 스킬 공간 정규화에서의 가중치 인자 λ는 운동 다양성과 물리적 타당성 간의 조정 가능한 트레이드오프를 가능하게 하며, 균형 잡힌 설정에서 최적의 성능을 달성했다.
- 정성적 결과에서는 InsActor가 시각적으로 타당하고 다양한, 일관성 있는 애니메이션을 생성함을 확인했으며, 다중 웨이포인트 탐색 및 복잡한 운동 시퀀스를 포함했다.
- 웨이포인트와 같은 추가 입력을 통한 민첩한 조건부 설정을 지원하여 재학습 없이도 상호작용 제어를 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.