Skip to main content
QUICK REVIEW

[논문 리뷰] What Went Wrong? Closing the Sim-to-Real Gap via Differentiable Causal Discovery

Peide Huang, Xilun Zhang|arXiv (Cornell University)|2023. 06. 28.
Time Series Analysis and Forecasting인용 수 4
한 줄 요약

이 논문은 로봇 조작에서 시뮬레이션과 실제 환경 간 격차를 줄이기 위해 핵심 시뮬레이터 파라미터를 식별하고 최적화하는 미분 가능(causal) 원인 발견 프레임워크인 COMPASS를 제안한다. 환경 파라미터와 궤도 불일치 간의 원인 관계를 학습함으로써, COMPASS는 종단 간(end-to-end), 해석 가능하고 효율적인 파라미터 조정을 가능하게 하여, 시뮬레이션 및 실제 실험 모두에서 기준 대비 유의미한 향상을 이룬다.

ABSTRACT

Training control policies in simulation is more appealing than on real robots directly, as it allows for exploring diverse states in an efficient manner. Yet, robot simulators inevitably exhibit disparities from the real-world ebut{dynamics}, yielding inaccuracies that manifest as the dynamical simulation-to-reality (sim-to-real) gap. Existing literature has proposed to close this gap by actively modifying specific simulator parameters to align the simulated data with real-world observations. However, the set of tunable parameters is usually manually selected to reduce the search space in a case-by-case manner, which is hard to scale up for complex systems and requires extensive domain knowledge. To address the scalability issue and automate the parameter-tuning process, we introduce COMPASS, which aligns the simulator with the real world by discovering the causal relationship between the environment parameters and the sim-to-real gap. Concretely, our method learns a differentiable mapping from the environment parameters to the differences between simulated and real-world robot-object trajectories. This mapping is governed by a simultaneously learned causal graph to help prune the search space of parameters, provide better interpretability, and improve generalization on unseen parameters. We perform experiments to achieve both sim-to-sim and sim-to-real transfer, and show that our method has significant improvements in trajectory alignment and task success rate over strong baselines in several challenging manipulation tasks.

연구 동기 및 목표

  • 모의 시뮬레이션과 실제 환경의 동역학 간 격차를 유발하는 핵심 시뮬레이터 파라미터를 식별하고 조정하여 로봇 제어에서 시뮬레이션-실제 환경 간 격차를 해결하기 위해.
  • 사례별 수작업 선택에 의존하지 않고, 파라미터 조정 과정을 자동화하고 확장하여 도메인 전문 지식 의존도를 줄이기 위해.
  • 불필요한 파라미터를 제거하고 원인-결과 관계를 드러내는 원인 그래프를 학습함으로써 해석 가능성과 일반화 능력을 향상시키기 위해.
  • 물리적 파라미터(질량, 감쇠, 마찰 계수 등)의 기울기 기반 최적화를 가능하게 하는 미분 가능 동역학 모델을 활용해 시뮬레이터 파라미터를 종단 간 효율적으로 최적화하기 위해.
  • 모의-모의 및 모의-실제 전이 설정 모두에서 궤도 일치도와 작업 성공률 측면에서 뛰어난 성능을 입증하기 위해.

제안 방법

  • COMPASS는 환경 파라미터에서 시뮬레이션과 실제 로봇-물체 상호작용 간 궤도 차이로의 미분 가능 매핑으로서 시뮬레이션-실제 간 격차를 정의한다.
  • 환경 파라미터와 시뮬레이션-실제 간 격차 간의 관계를 모델링하는 원인 그래프를 함께 학습함으로써, 구조적 검색 공간 축소를 가능하게 한다.
  • 기울기 역전파를 통해 미분 가능한 원인 모델을 통해 시뮬레이터 파라미터를 종단 간 최적화하여 궤도 불일치를 최소화한다.
  • 원인 그래프는 처음에 완전히 연결된 상태로 초기화되며, 학습된 원인 의존성에 기반해 반복적으로 자르기(iterative pruning)하여 효율성과 해석 가능성을 향상시킨다.
  • 이 방법은 실제 궤도 데이터와 시뮬레이션 궤도 데이터를 기반으로 훈련되며, 정책 성능은 시뮬레이션 및 실제 환경 모두에서 평가된다.
  • 물리적 파라미터(질량, 감쇠, 마찰 계수 등)의 기울기 기반 최적화를 가능하게 하는 미분 가능한 물리 엔진을 활용한다.

실험 결과

연구 질문

  • RQ1로봇 조작 작업에서 시뮬레이션-실제 간 격차에 가장 크게 기여하는 시뮬레이터 환경 파라미터는 무엇인가?
  • RQ2사용자 수작업 기반의 사례별 선택에 의존하지 않고, 영향력이 큰 파라미터를 자동으로 식별하고 우선순위를 정할 수 있는가?
  • RQ3미분 가능한 원인 모델이 시뮬레이션-실제 파라미터 조정의 효율성과 해석 가능성에 기여하는가?
  • RQ4원인적 구조를 통합할 경우, 시뮬레이션-실제 전이에서 일반화 능력과 성능 향상에 어느 정도 기여하는가?
  • RQ5궤도 일치도와 작업 성공률 측면에서, 제안된 방법은 기울기 기반 및 기울기 비기반 기준 대비 어떻게 비교되는가?

주요 결과

  • Push-I 작업에서 COMPASS는 2회 반복 내에 유효한 파라미터 검색 공간을 67차원에서 단 3개로 줄였으며, 가장 영향력 있는 파라미터로 cube@dyna@mass, cube@dyna@damping, cube@dyna@friction_sliding 를 식별했다.
  • 실제 환경 테스트에서 이 방법은 0.70 ± 0.28 의 작업 성공률을 기록하여 NPDR(0.40 ± 0.21) 및 EXI-Net(0.50 ± 0.22)를 뛰어넘는 유의미한 성능 향상을 보였다.
  • 궤도 일치 결과에서는 COMPASS가 NPDR 및 EXI-Net 대비 더 빠르게 수렴하고 더 낮은 궤도 차이를 달성했으며, 롤, 피치, 위치 궤도 모두에서 눈에 띄게 뛰어난 일치도를 보였다.
  • COMPASS가 학습한 원인 그래프는 불필요한 파라미터를 효과적으로 제거했으며, 사전 가정 없이도 핵심 물리적 요소를 식별할 수 있음을 입증했다.
  • 모의-모의 평가에서 COMPASS로 훈련된 에이전트는 노멀 및 기준 방법 대비 더 높은 성공률을 보였으며, 정책 일반화 능력 향상을 확인했다.
  • 프레임워크는 시뮬레이터 파라미터의 종단 간 최적화를 가능하게 했으며, 최적화 반복 과정에서 환경 파라미터가 점차 진실값에 수렴하는 경향을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.