Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Representations that Enable Generalization in Assistive Tasks

Jerry Zhi-Yang He, Aditi Raghunathan|arXiv (Cornell University)|2022. 12. 05.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 보조 로봇에서 zero-shot 일반화를 향상시키기 위해 상호작용 이력에서 직접 인간 파트너 정책의 분리된 잠재 표현을 학습하는 프레임워크인 PALM (Prediction-based Assistive Latent eMbedding)을 제안한다. 인간 행동을 예측하도록 잠재 공간을 훈련하고, 관찰된 행동을 사용해 테스트 시 적응을 가능하게 함으로써, 최신의 sim2real 및 인간-로봇 상호작용 방법에 비해 분포 외(OOD) 인간 정책으로의 일반화 성능이 뛰어나다.

ABSTRACT

Recent work in sim2real has successfully enabled robots to act in physical environments by training in simulation with a diverse ''population'' of environments (i.e. domain randomization). In this work, we focus on enabling generalization in assistive tasks: tasks in which the robot is acting to assist a user (e.g. helping someone with motor impairments with bathing or with scratching an itch). Such tasks are particularly interesting relative to prior sim2real successes because the environment now contains a human who is also acting. This complicates the problem because the diversity of human users (instead of merely physical environment parameters) is more difficult to capture in a population, thus increasing the likelihood of encountering out-of-distribution (OOD) human policies at test time. We advocate that generalization to such OOD policies benefits from (1) learning a good latent representation for human policies that test-time humans can accurately be mapped to, and (2) making that representation adaptable with test-time interaction data, instead of relying on it to perfectly capture the space of human policies based on the simulated population only. We study how to best learn such a representation by evaluating on purposefully constructed OOD test policies. We find that sim2real methods that encode environment (or population) parameters and work well in tasks that robots do in isolation, do not work well in assistance. In assistance, it seems crucial to train the representation based on the history of interaction directly, because that is what the robot will have access to at test time. Further, training these representations to then predict human actions not only gives them better structure, but also enables them to be fine-tuned at test-time, when the robot observes the partner act. https://adaptive-caregiver.github.io.

연구 동기 및 목표

  • 훈련 집단과는 다를 수 있는 테스트 시 인간 파트너가 분포 외(OOD)일 경우의 일반화 문제를 해결하기 위해.
  • 환경 매개변수나 보상과 같은 간접적 신호가 아닌, 상호작용 이력에 기반한 구조적이고 적응 가능한 인간 정책의 잠재 공간을 설계하기 위해.
  • 실제 상호작용 데이터를 사용해 테스트 시 잠재 공간을 적응시킴으로써, OOD 인간 행동에 대한 강건성을 향상시키기 위해.
  • 통제된 OOD 중심의 보조 작업 환경에서 표현 학습 방법을 평가하고 비교하기 위해.

제안 방법

  • 프레임워크는 끝에서 끝까지 backpropagation을 사용해 로봇 정책과 잠재 임베딩 공간을 공동으로 훈련하며, 잠재 공간은 상호작용 이력에서 인간 행동을 예측하도록 훈련된다.
  • 잠재 공간은 대조적 목적과 KL 정규화 항을 통해 최적화되어 부드럽고 일반화 가능한 구조를 유도한다.
  • 테스트 시 적응은 상호작용 중 관찰된 인간 행동을 사용해 잠재 공간을 미세조정함으로써 가능해지며, 이는 새로운 파트너와의 동적 일치를 가능하게 한다.
  • 이 방법은 이중 스트림 아키텍처를 사용한다: 하나는 인간 이력을 인코딩하고, 다른 하나는 다음 행동을 예측하며, 잠재 코드는 공유 표현으로 기능한다.
  • 프레임워크는 두 가지 시뮬레이션된 보조 작업 환경에서 평가된다: 2D 도달 환경과 다양한 인간 정책을 가진 2D 가시키기 작업.
  • 인간 정책는 분포 외(OOD)임을 명시적으로 구성하여, 일반화 성능 평가를 통제 가능하게 한다.

실험 결과

연구 질문

  • RQ1환경 매개변수나 간접적 신호에 기반한 표현보다, 상호작용 이력에서 학습된 인간 정책의 잠재 표현이 분포 외(OOD) 인간 행동으로의 일반화 성능이 더 뛰어나게 되는가?
  • RQ2훈련 시 인간 행동을 예측하는 것이 상태나 보상 예측보다 더 구조적이고 일반화 가능한 잠재 공간을 만들어내는가?
  • RQ3학습된 잠재 공간의 테스트 시 적응이 새로운 인간 파트너에서 성능을 얼마나 향상시키는가?
  • RQ4표현 학습 목표의 선택(예: 행동 예측 대비 보상 예측)이 보조 작업에서의 일반화에 어떤 영향을 미치는가?

주요 결과

  • PALM은 행동 예측을 사용할 경우, RMA, RNN, LILI, RILI를 포함한 모든 베이스라인보다 도달 및 가시키기 작업 전반에서 OOD 인간 정책으로의 일반화 성능이 뛰어나다.
  • 행동 예측을 통한 학습으로 얻은 잠재 공간은 인간 정책의 기저의 고리 모양의 구조를 성공적으로 포착하지만, RMA와 RILI는 모호하거나 정보가 없는 신호에 의존함으로써 이 구조를 유지하지 못한다.
  • KL 정규화는 더 부드러운 잠재 분포를 유도함으로써 일반화를 향상시키며, 특히 분포의 누락된 영역에서 OOD 인간을 잠재 공간에 더 잘 내삽할 수 있도록 한다.
  • 테스트 시 적응은 성능 향상에 크게 기여하며, PALM의 잠재 공간이 분포의 빈 공간을 메워 분포 외 인간을 더 잘 임bedding함을 잠재 공간의 시각화를 통해 확인할 수 있다.
  • 보상이나 상태를 예측하는 베이스라인은 인간 정책 간의 구조적 관계를 포착하지 못함으로써 일반화 성능이 떨어진다.
  • 인간 분포가 더 복잡해져도 이 방법은 강력한 성능을 보이며, MLP와 RILI는 분포 복잡성 증가에 따라 성능이 저하됨을 확인할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.