Skip to main content
QUICK REVIEW

[논문 리뷰] RISP: Rendering-Invariant State Predictor with Differentiable Simulation and Rendering for Cross-Domain Parameter Estimation

Pingchuan Ma, Tao Du|arXiv (Cornell University)|2022. 05. 11.
Advanced Vision and Imaging인용 수 4
한 줄 요약

이 논문은 다양한 렌더링 조건(예: 조명, 재질, 그림자)이 알려지지 않은 상황에서 비디오에서 물리 시스템의 물리적 파라미터를 추정하기 위해 유연한 시뮬레이션과 렌더링 기울기의 특성을 활용하는 렌더링 불변 상태 예측기인 RISP를 제안한다. 렌더링 기울기를 기반으로 한 새로운 손실 함수를 통해 조명, 재질, 그림자와 같은 렌더링 조건에 영향을 받지 않는 네트워크를 훈련시킴으로써, RISP는 이질적 도메인 간 상태 추정, 시스템 식별, 이민 학습, 시각-운동 제어 분야에서 기존 방법보다 훨씬 낮은 재구성 오차를 기록하며 최신 기술 수준의 성능을 달성한다.

ABSTRACT

This work considers identifying parameters characterizing a physical system's dynamic motion directly from a video whose rendering configurations are inaccessible. Existing solutions require massive training data or lack generalizability to unknown rendering configurations. We propose a novel approach that marries domain randomization and differentiable rendering gradients to address this problem. Our core idea is to train a rendering-invariant state-prediction (RISP) network that transforms image differences into state differences independent of rendering configurations, e.g., lighting, shadows, or material reflectance. To train this predictor, we formulate a new loss on rendering variances using gradients from differentiable rendering. Moreover, we present an efficient, second-order method to compute the gradients of this loss, allowing it to be integrated seamlessly into modern deep learning frameworks. We evaluate our method in rigid-body and deformable-body simulation environments using four tasks: state estimation, system identification, imitation learning, and visuomotor control. We further demonstrate the efficacy of our approach on a real-world example: inferring the state and action sequences of a quadrotor from a video of its motion sequences. Compared with existing methods, our approach achieves significantly lower reconstruction errors and has better generalizability among unknown rendering configurations.

연구 동기 및 목표

  • 렌더링 설정(예: 조명, 재질 등)이 알려지지 않은 상태에서 비디오로부터 물리 시스템의 물리적 파라미터를 추정하는 문제에 대응하기 위해.
  • 기존 방법들이 알려진 렌더러나 대규모 도메인 적응 데이터를 필요로 하는 한계를 극복하기 위해.
  • 목표 도메인 데이터에 접근할 필요 없이 다양한 렌더링 도메인으로 일반화 가능한 유연한 엔드 투 엔드 프레임워크를 개발하기 위해.
  • 렌더링과 물리적 역학이 복잡하고 모델링되지 않은 실제 환경에서 강건한 파라미터 추정을 가능하게 하기 위해.
  • 렌더링 기울기를 상태 예측 네트워크에 통합하여 렌더링 변형에 대한 불변성을 강제하기 위해.

제안 방법

  • 렌더링 설정에 영향을 받지 않는 이미지 차이에서 상태 차이를 예측하는 렌더링 불변 상태 예측기(RISP)를 제안한다.
  • 렌더링 파라미터(예: 조명, 재질 등)의 기울기를 기반으로 한 새로운 손실 함수를 제안하여 상태 예측 네트워크의 불변성을 강제한다.
  • 렌더링 변동성 손실의 기울기를 효율적으로 계산하기 위해 고차원 최적화 방법을 사용하여 딥러닝 프레임워크에 통합 가능하게 한다.
  • 도메인 랜덤라이제이션을 사용하여 훈련 중 다양한 렌더링 조건(조명, 배경, 재질 등)을 생성함으로써 테스트 시의 알려지지 않은 구성 조건의 분포를 커버한다.
  • 유연한 시뮬레이션과 렌더링을 활용하여 전체 파이프라인을 통해 역전파를 수행함으로써 상태 예측기의 엔드 투 엔드 최적화를 가능하게 한다.
  • 유연한 역학을 활용하여 RISP 네트워크를 시스템 식별, 이민 학습, 시각-운동 제어와 같은 후속 작업에 통합한다.

실험 결과

연구 질문

  • RQ1알려지지 않은 렌더링 설정(예: 조명, 재질 반사율 등)에 영향을 받지 않는 방식으로 신경망을 훈련시켜 비디오에서 물리 시스템 상태를 예측할 수 있는가?
  • RQ2목표 도메인 데이터에 접근할 필요 없이 렌더링 기울기를 효과적으로 활용하여 상태 예측 네트워크의 불변성을 강제할 수 있는가?
  • RQ3픽셀 기반 또는 인지적 손실과 비교해 렌더링 기울기를 손실 함수에 통합함으로써 미지의 렌더링 도메인 간 일반화 성능이 향상되는가?
  • RQ4RISP는 복잡한 질감과 모델링되지 않은 역학을 포함한 실제 비디오(예: 비행하는 큐드로터)에 대해 어느 정도 일반화 가능한가?
  • RQ5모델링되지 않은 렌더링 설정이나 도메인 적응 기반 기준선과 비교해 본 결과, 제안된 방법의 성능은 어떠한가?

주요 결과

  • 모든 테스트 환경과 렌더링 설정에서 RISP는 픽셀 기반 손실 및 인지적 손실 기반 기준선보다 유의미하게 낮은 재구성 오차를 기록한다.
  • 이민 학습에서 RISP는 다음으로 우수한 기준선 대비 상태 불일치를 80% 이상 감소시켰으며, 손바닥 환경에서 평균 오차는 1.52 ± 0.18를 기록했다.
  • 제거 실험 결과, 렌더링 기울기가 성능 향상에 필수적임을 확인했으며, 일부 작업에서는 이를 제거할 경우 오차가 10배 이상 증가했다.
  • 실제 비행 큐드로터 작업에서 RISP는 모델링되지 않은 항공역학적 효과와 복잡한 질감에도 불구하고 기준 영상의 운동과 밀도 높은 일치를 보이는 액션 시퀀스를 성공적으로 재구성했다.
  • 미리 알려지지 않은 렌더링 도메인으로의 일반화 능력이 뛰어나, 훈련 및 테스트 설정 간의 차이가 크더라도 강건성을 유지함을 입증했다.
  • 고차원 기울기를 사용함으로써 렌더링 변동성 손실의 효율적이고 안정적인 훈련이 가능해졌으며, 딥러닝 파이프라인에 통합하는 데 실현 가능해졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.