Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Latent Representations to Influence Multi-Agent Interaction

Annie Xie, Dylan P. Losey|arXiv (Cornell University)|2020. 11. 12.
Reinforcement Learning in Robotics참고 문헌 53인용 수 13
한 줄 요약

이 논문은 다중 에이전트 상호작용에서 비정상적인 에이전트를 모델링하고 영향을 주기 위해 잠재 전략을 학습하는 강화학습 프레임워크인 LILI를 제안한다. 다른 에이전트의 정책을 동적 잠재 변수로 표현하고, 잠재 동역학을 활용함으로써 자기 에이전트는 상대방의 행동을 예측하고 공조 행동으로 이끌 수 있으며, 시뮬레이션과 실제 공기 테이블에서의 실험에서 기존 방법들을 능가한다. 특히 91%의 슈팅을 차단하고, 상대방이 고보상 전략을 선호하도록 유도한다.

ABSTRACT

Seamlessly interacting with humans or robots is hard because these agents are non-stationary. They update their policy in response to the ego agent's behavior, and the ego agent must anticipate these changes to co-adapt. Inspired by humans, we recognize that robots do not need to explicitly model every low-level action another agent will make; instead, we can capture the latent strategy of other agents through high-level representations. We propose a reinforcement learning-based framework for learning latent representations of an agent's policy, where the ego agent identifies the relationship between its behavior and the other agent's future strategy. The ego agent then leverages these latent dynamics to influence the other agent, purposely guiding them towards policies suitable for co-adaptation. Across several simulated domains and a real-world air hockey game, our approach outperforms the alternatives and learns to influence the other agent.

연구 동기 및 목표

  • 자신의 행동에 따라 다른 에이전트가 정책을 변화시키는 비정상적인 다중 에이전트 상호작용 문제를 해결하기 위해.
  • 모든 저수준 행동을 명시적으로 모델링하지 않고도 다른 에이전트의 잠재 전략을 예측하고 영향을 줄 수 있도록 하기 위해.
  • 중앙 집중식 훈련이나 통신 없이도 작동하는 일반적인 프레임워크를 개발하여 인간-로봇 및 분산 환경에 적합하게 하기 위해.
  • 자신의 행동이 다른 에이전트의 잠재 전략이 시간에 따라 어떻게 변화하는지 학습함으로써 공조 행동을 향상시키기 위해.
  • 복잡하고 노이즈가 많으며 마르코프가 아닌 상호작용 상황에서도 강건성을 입증하기 위해.

제안 방법

  • 자기 에이전트는 다른 에이전트의 관측 행동에서 저차원의 잠재 전략 표현(𝑧)을 추론하기 위해 변동형 추론 기반 접근법을 사용한다.
  • 잠재 동역학 모델은 자기 에이전트의 행동에 따라 다른 에이전트의 전략이 어떻게 변화하는지 학습함으로써 향후 전략 예측이 가능해진다.
  • 자기 에이전트의 정책은 강화학습을 통해 현재의 잠재 전략에만 반응하는 것뿐만 아니라, 향후 전략을 공조 가능한 방향으로 영향을 주도록 훈련된다.
  • 다른 에이전트의 숨겨진 정책을 식별하고 예측하기 위해 역강화학습과 잠재변수 모델링의 조합을 사용한다.
  • 오프-폴리시 딥 강화학습(SAC)을 사용하여 엔드 투 엔드로 훈련하고, 상대방의 전략에 영향을 주도록 유도하는 보상 형태를 포함한다.
  • 프레임워크는 시뮬레이션 환경과 실제 공기 테이블에서 로봇 및 인간 상대방을 대상으로 평가된다.

실험 결과

연구 질문

  • RQ1강화학습 에이전트는 다중 에이전트 상호작용에서 부분 관측 가능한 비정상적 에이전트의 잠재 전략을 학습하고 예측할 수 있는가?
  • RQ2자기 에이전트는 학습된 잠재 동역학을 어떻게 활용하여 다른 에이전트의 향후 전략을 적극적으로 영향을 주어 더 나은 공조 행동을 이끌 수 있는가?
  • RQ3잠재 전략을 영향을 주는 방식으로 학습하면 실제 공기 테이블과 같은 다중 에이전트 과제에서 성능 향상이 이루어지는가?
  • RQ4상대방 행동의 노이즈와 비마르코프적 의존성에 대해 이 방법은 얼마나 강건한가?
  • RQ5로봇 상대에서 인간 상대로의 일반화가 실제 환경에서 가능할 수 있는가?

주요 결과

  • 실제 공기 테이블 실험에서 LILI는 마지막 100회 상호작용 동안 91%의 슈팅 차단 성공률을 기록했으며, SAC(44%)와 무작위 기준(18%)을 크게 능가했다.
  • LILI는 로봇 상대를 상대로 보너스 보상이 왼쪽 끝에 있는 블록에 해당하는 방향으로 41%의 확률로 공을 발사하도록 유도했다.
  • 인간 전문가 상대와의 테스트에서 LILI(영향 없음)는 슈팅의 73%(40개 중 29개)를 차단했고, SAC는 45%(40개 중 18개)를 차단하여 더 나은 공조 행동을 보였다.
  • LILI는 상대를 번갈아가며 전략(예: 왼쪽과 중앙)으로 이끌어내어, 상대가 이전에 차단된 영역을 피하려는 경향을 악용했다.
  • 장기적 시간 간격에 의한 분석에서 노이즈가 많은 잠재 동역학과 비마르코프적 전략 변화에 대해 강건함을 입증했다.
  • 최종 단계에서 LILI는 상호작용당 평균 누적 보상 1.15 ± 0.05를 기록했고, 영향 없이 학습한 LILI의 1.00 ± 0.05와 비교해 복잡한 영향력의 가치를 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.