Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-end Active Object Tracking and Its Real-world Deployment via Reinforcement Learning

Wenhan Luo, Peng Sun|arXiv (Cornell University)|2018. 08. 10.
Video Surveillance and Tracking Methods참고 문헌 60인용 수 6
한 줄 요약

이 논문은 시뮬레이터에서 원시 영상 프레임에서 직접 카메라 제어 동작을 예측하는 컨볼루션 네트워크-장기 단기 기억(LSTM) 에이전트를 사용하여 딥 강화학습을 활용한 엔드 투 엔드 주도 객체 추적 시스템을 제안한다. 이 방법은 예측할 수 없는 객체의 경로, 외관, 배경에 걸쳐 강건한 추적 일반화 성능을 달성하며, 최소한의 실제 세계 튜닝을 통해 시뮬레이션에서 실제 터틀봇 로봇에 성공적으로 전이된다.

ABSTRACT

We study active object tracking, where a tracker takes visual observations (i.e., frame sequences) as input and produces the corresponding camera control signals as output (e.g., move forward, turn left, etc.). Conventional methods tackle tracking and camera control tasks separately, and the resulting system is difficult to tune jointly. These methods also require significant human efforts for image labeling and expensive trial-and-error system tuning in the real world. To address these issues, we propose, in this paper, an end-to-end solution via deep reinforcement learning. A ConvNet-LSTM function approximator is adopted for the direct frame-to-action prediction. We further propose an environment augmentation technique and a customized reward function, which are crucial for successful training. The tracker trained in simulators (ViZDoom and Unreal Engine) demonstrates good generalization behaviors in the case of unseen object moving paths, unseen object appearances, unseen backgrounds, and distracting objects. The system is robust and can restore tracking after occasional lost of the target being tracked. We also find that the tracking ability, obtained solely from simulators, can potentially transfer to real-world scenarios. We demonstrate successful examples of such transfer, via experiments over the VOT dataset and the deployment of a real-world robot using the proposed active tracker trained in simulation.

연구 동기 및 목표

  • 추적과 카메라 제어를 분리하는 전통적 피사성 추적기의 한계를 해결하기 위해, 수동 조정과 광범위한 실제 세계 시험·오류 조정이 필요로 하는 방식을 개선한다.
  • 시뮬레이션 환경에서 엔드 투 엔드 에이전트를 훈련시켜 레이블링 및 시스템 튜닝에 필요한 인간의 노력 감소를 목표로 한다.
  • 예측할 수 없는 객체의 궤적, 외관, 배경, 간섭 물체에 대한 주도 추적의 강건한 일반화를 가능하게 한다.
  • 고도로 발전된 환경 증강 및 실제 세계 로봇 배포에 적합한 행동 공간 설계를 통해 시뮬레이션에서 실제 세계로의 격차를 해소한다.
  • 실제 세계에서의 튜닝 없이도 시뮬레이션에서만 훈련된 추적기를 물리적 터틀봇에 성공적으로 배치함을 보여준다.

제안 방법

  • 원시 영상 프레임을 직접 카메라 제어 동작(예: 전진, 왼쪽으로 회전)으로 매핑하기 위해 컨볼루션 네트워크-LSTM 아키텍처를 사용하여 엔드 투 엔드 학습을 가능하게 한다.
  • 에이전트를 훈련하기 위해 맞춤형 밀도 레이어드 보상 함수를 사용하는 A3C 강화학습 알고리즘을 적용하며, 이는 목표물이 영상 중심에 위치하고 크기가 일관되게 유지되도록 유도한다.
  • 시뮬레이터에서 객체 외관, 배경, 궤적, 간섭 물체를 동적으로 변화시켜 환경 증강을 적용함으로써 일반화 능력을 향상시킨다.
  • 행동 공간을 신중하게 설계(이산 또는 연속)하여 실제 세계 로봇 운동학과 더 잘 맞추고, 시뮬레이션에서 실제 세계로의 전이를 향상시킨다.
  • 맞춤형 API와 플러그인을 통해 가상 환경을 개선하여 훈련 중 다양한 실제 세계 조건을 시뮬레이션한다.
  • 시스템은 시뮬레이션과 실제 세계 로봇 배치 모두에서 평가되며, VOT 데이터셋 클립과 물리적 로봇 시험을 통해 전이 성능가 검증된다.

실험 결과

연구 질문

  • RQ1단지 시뮬레이션에서만 훈련된 엔드 투 엔드 주도 추적 정책이 예측할 수 없는 객체의 운동 경로와 외관에 대해 일반화 가능한가?
  • RQ2맞춤형 보상 함수를 사용한 강화학습이 간섭 물체와 배경 변화 상황에서도 강건한 추적을 얼마나 효과적으로 가능하게 하는가?
  • RQ3실제 세계 튜닝 없이도 시뮬레이션 환경에서 훈련된 정책이 실제 세계 로봇 제어로 성공적으로 전이될 수 있는가?
  • RQ4환경 증강이 주도 추적기의 일반화 능력과 강건성 향상에 어떤 역할을 하는가?
  • RQ5행동 공간 선택(이산 대비 연속)이 추적 성능과 실제 세계 배포 성공에 어떤 영향을 미치는가?

주요 결과

  • 추적기는 예측할 수 없는 객체 궤적, 외관, 배경, 간섭 물체에 대해 효과적으로 일반화되며, 일시적인 목표물 실종 후에도 안정적인 추적을 유지한다.
  • 실내 이산 행동 설정에서는 성공률 0.90, 실외 연속 행동 설정에서는 성공률 0.70을 달성하여 다양한 조건에서 뛰어난 성능을 보인다.
  • 추적기는 시뮬레이션에서 훈련된 후 실제 세계 터틀봇에 성공적으로 전이되어 실내 및 실외 환경 모두에서 안정적인 주도 추적을 달성한다.
  • 에이전트는 목표물을 영상 중심에 유지하고 일관된 목표물 크기를 유지함으로써 효과적인 운동 인식 제어 결정을 학습했다.
  • 연속 행동 공간을 사용할 경우 실외 설정에서 성능 향상이 나타나며, 성공률 0.70을 기록하여 실내 이산 설정의 0.90과 비교해도 열등하지 않다.
  • 정성적 결과는 추적기가 단순히 '정지' 동작을 취하는 대신 목표물의 운동 방향을 따라가며 추적함을 보여주며, LSTM 인코더를 통한 운동 예측을 학습한 것으로 나타난다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.