Skip to main content
QUICK REVIEW

[논문 리뷰] FIERY: Future Instance Prediction in Bird's-Eye View from Surround Monocular Cameras

Anthony Hu, Zak Murez|arXiv (Cornell University)|2021. 04. 21.
Autonomous Vehicle Technology and Safety참고 문헌 48인용 수 14
한 줄 요약

FIERY는 고차원 지ap 없이 단일 카메라 입력에서부터 직접 다중 모드의 궤적과 세그멘테이션을 추론하는 최초의 종단간(end-to-end), 단일 카메라 기반 모델을 제안한다. 이는 Bird's-eye view(BEV)에서의 확률적 미래 인스턴스 예측을 위한 모델로, 고해상도 지도(HD maps) 없이도 주변 RGB 입력으로부터 다중 모드의 궤적과 세그멘테이션을 직접 회귀한다. 이는 통합된 프레임워크에서 인식, 센서 융합, 예측을 동시에 학습함으로써 NuScenes 및 Lyft 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Driving requires interacting with road agents and predicting their future behaviour in order to navigate safely. We present FIERY: a probabilistic future prediction model in bird's-eye view from monocular cameras. Our model predicts future instance segmentation and motion of dynamic agents that can be transformed into non-parametric future trajectories. Our approach combines the perception, sensor fusion and prediction components of a traditional autonomous driving stack by estimating bird's-eye-view prediction directly from surround RGB monocular camera inputs. FIERY learns to model the inherent stochastic nature of the future solely from camera driving data in an end-to-end manner, without relying on HD maps, and predicts multimodal future trajectories. We show that our model outperforms previous prediction baselines on the NuScenes and Lyft datasets. The code and trained models are available at https://github.com/wayveai/fiery.

연구 동기 및 목표

  • 단일 카메라 입력만을 사용하여 자율주행에서의 향후 운동 및 인스턴스 수준의 동적 행동을 예측하는 문제에 도전한다.
  • 고차원 지도 및 다단계 파ip라인에 의존하지 않고, BEV에서 종단간 인식, 센서 융합, 예측을 통합된 프레임워크로 학습함으로써 이를 해결한다.
  • 미래 궤적의 본질적인 확률적 특성을 다중 모드 예측 프레임워크를 통해 모델링한다.
  • RGB 이미지에서 직접 BEV 표현으로 회귀함으로써 운동 계획을 위한 강력하고 고해상도의 미래 장면 이해를 가능하게 한다.
  • 원시 카메라 데이터에서만 종단간 학습이 이루어질 경우, 지도나 LiDAR에 의존하는 기존 기준 모델의 성능을 도달하거나 초월할 수 있음을 입증한다.

제안 방법

  • 1/8 해상도에서 특징을 추출하기 위해 EfficientNet-B4 백본을 사용하는 다중 카메라 RGB 입력 스트림을 사용한다.
  • 자기 운동 정보를 활용하여 공간 변환기와 기하학적 리프팅을 적용하여 2D 이미지 특징을 200×200 BEV 특징 맵으로 투영한다.
  • 과거 타임스텝에 걸친 시공간 동적 특징을 인코딩하기 위해 3D 컨볼루션 시간 모델과 시간 블록(Temporal Blocks)을 활용한다.
  • 인스턴스 세그멘테이션(중심도, 오프셋), 플로우, 향후 예측을 위한 다중 출력 헤드를 공유 디코더 헤드를 도입한다.
  • 불확실성 가중치가 적용된 확률적 손실과 변분 스타일의 분포 헤드를 사용하여 다중 모드의 미래 상태를 예측한다.
  • 미래 인스턴스 위치와 운동에 대한 지도를 위해 인스턴스 중심질량 가우시안 레이블링과 플로우 기반 레이블링을 활용한다.

실험 결과

연구 질문

  • RQ1단일 종단간 모델이 단일 카메라 입력에서부터 직접 BEV에서의 다중 모드 향후 인스턴스 세그멘테이션과 운동을 예측할 수 있는가?
  • RQ2원시 RGB 데이터에서 종단간 학습한 모델이 다단계 또는 지도 보조 기반 접근 방식에 비해 향후 예측 성능에서 어떻게 비교되는가?
  • RQ3명시적인 고차원 지도 지침 없이도 모델이 미래 에이전트 행동의 확률적 특성을 얼마나 잘 학습할 수 있는가?
  • RQ4중간 지도 없이도 통합 아키텍처가 인식, 센서 융합, 향후 예측을 동시에 최적화할 수 있는가?
  • RQ5실제 주행 환경에서 다중 모드 예측 헤드를 사용할 경우, 결정론적 기준 모델 대비 성능 향상은 어느 정도인가?

주요 결과

  • FIERY는 NuScenes 및 Lyft 데이터셋에서 이전의 예측 기준 모델을 모두 능가하며, 향후 인스턴스 세그멘테이션과 운동 예측 분야에서 최신 기술 수준의 성능을 입증한다.
  • 고차원 지도에 의존하지 않고도 뛰어난 성능을 달성함으로써, 단일 카메라에서만 종단간 학습이 이루어지는 것이 복잡한 예측 작업에 대해 실현 가능하다는 것을 증명한다.
  • 불확실성 가중치가 적용된 확률적 손실 사용으로 인해 강인성과 다중 모드 궤적 생성 능력이 크게 향상되었다.
  • 3D 컨볼루션과 게이트드 순환 유닛을 활용한 시간 모델링은 과거 타임스텝에 걸친 정확한 시공간 특징 학습을 가능하게 한다.
  • 카메라 기하학과 자동차의 자기 운동 정보만을 사용하여 2D 이미지 특징을 기하학적으로 일관된 BEV 표현으로 성공적으로 변환한다.
  • 검증용 데이터 분할(6,174개 샘플)을 활용한 결과, 모델이 새로운 환경에 잘 일반화됨을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.