[논문 리뷰] Fast-BEV: Towards Real-time On-vehicle Bird's-Eye View Perception
Fast-BEV는 깊이 추정이나 트랜스포머 기반 시각 변환에 의존하지 않고도 최신 기술 수준의 성능을 달성하는 실시간, 차량 내 구현에 적합한 베이직 에이드 뷰(Bird's-Eye-View, BEV) 인식 프레임워크를 제안한다. 이미지 공간과 BEV 공간에서 강력한 데이터 증강, 다중 프레임 시간적 융합, 그리고 사전 계산된 투영 인덱스와 공유 밀도 벡셀 특징을 통해 최적화된 배포 우수 시각 변환 기법을 통합함으로써, nuScenes에서 53.5%의 NDS를 달성하고 엣지 하드웨어에서 50 FPS 이상의 추론 속도를 확보한다.
Recently, the pure camera-based Bird's-Eye-View (BEV) perception removes expensive Lidar sensors, making it a feasible solution for economical autonomous driving. However, most existing BEV solutions either suffer from modest performance or require considerable resources to execute on-vehicle inference. This paper proposes a simple yet effective framework, termed Fast-BEV, which is capable of performing real-time BEV perception on the on-vehicle chips. Towards this goal, we first empirically find that the BEV representation can be sufficiently powerful without expensive view transformation or depth representation. Starting from M2BEV baseline, we further introduce (1) a strong data augmentation strategy for both image and BEV space to avoid over-fitting (2) a multi-frame feature fusion mechanism to leverage the temporal information (3) an optimized deployment-friendly view transformation to speed up the inference. Through experiments, we show Fast-BEV model family achieves considerable accuracy and efficiency on edge. In particular, our M1 model (R18@256x704) can run over 50FPS on the Tesla T4 platform, with 47.0% NDS on the nuScenes validation set. Our largest model (R101@900x1600) establishes a new state-of-the-art 53.5% NDS on the nuScenes validation set. The code is released at: https://github.com/Sense-GVT/Fast-BEV.
연구 동기 및 목표
- 비용이 많이 드는 라이다나 트랜스포머, 깊이 추정과 같은 자원 소모가 큰 구성 요소에 의존하지 않는 실시간, 차량 내 구현 가능한 BEV 인식 시스템을 개발하는 것.
- 모델 복잡도나 추론 시 계산 비용을 증가시키지 않고도 BEV 벤치마크에서 검출 성능을 향상시키는 것.
- 엣지 디바이스에 적합한 성능을 내기 위해 이미지에서 BEV로의 시각 변환 과정을 최적화하여 지연 시간을 줄이고 하드웨어 호환성을 향상시키는 것.
- 통합형 칩에서 작동하는 표준 컨볼루션 네트워크와 효율적인 추론 파이프라인만을 사용하여 고성능 BEV 인식을 구현하는 것.
제안 방법
- 과도한 피팅을 방지하고 강건성을 향상시키기 위해 이미지 공간과 BEV 공간 양쪽에서 강력한 데이터 증강을 적용한다.
- 이전 프레임의 시간 정보를 활용하는 다중 프레임 특징 융합 메커니즘을 도입하여 검출 정확도를 향상시킨다.
- 모든 추론 시 계산을 제거하기 위해 고정된 투영 인덱스를 사전에 계산하여 이미지에서 BEV로의 투영을 최적화한다.
- 모든 카메라 특징을 공유 밀도 벡셀 격자로 투영하여 벡셀 집계 지연을 줄이고 희소 집계 연산을 피한다.
- 깊이 분포 예측이나 비용이 많이 드는 어텐션 메커니즘을 회피하기 위해 M²BEV 기반의 완전 컨볼루션 아키텍처를 사용한다.
- 제한된 계산 자원을 가진 차량 내 엣지 디바이스에 적합한 경량이며 구현에 유리한 추론 파이프라인을 적용한다.
실험 결과
연구 질문
- RQ1이미지 공간과 BEV 공간에서 강력한 데이터 증강을 적용하면 모델 복잡도를 증가시키지 않으면서도 BEV 검출 성능을 크게 향상시킬 수 있는가?
- RQ2여러 프레임의 시간 정보를 통합할 경우 BEV 공간에서의 3D 객체 검출 성능에 얼마나 기여하는가?
- RQ3임베디드 플랫폼에서 밀리초 이내의 추론 지연을 달성하기 위해 이미지에서 BEV로의 시각 변환을 최적화할 수 있는가?
- RQ4트랜스포머나 깊이 추정을 사용하지 않고도 표준 컨볼루션 네트워크만으로 최신 기술 수준의 BEV 검출 성능을 달성할 수 있는가?
- RQ5강력한 증강과 시간적 융합의 조합이 훈련 수렴 속도와 최종 모델 정확도에 어떤 영향을 미치는가?
주요 결과
- 가장 큰 R101 기반 아키텍처와 900×1600 입력 해상도를 사용한 Fast-BEV 모델 패밀리가 nuScenes 검증 세트에서 새로운 최고 성능인 53.5% NDS를 달성했다.
- M1 모델(R18@256×704)은 Tesla T4에서 50 FPS 이상의 추론 속도를 기록하여 표준 하드웨어에서 실시간 기능을 입증했다.
- 이미지 공간과 BEV 공간의 증강을 결합한 결과 기준 모델 대비 NDS가 4.4%p 상승하여 다중 공간 증강의 효과를 입증했다.
- 네 개의 이전 프레임을 사용한 다중 프레임 시간 융합은 NDS를 9.3%p 향상시켜 BEV 검출에서 시간 모델링의 가치를 입증했다.
- 투영 인덱스 사전 계산과 공유 밀도 벡셀 격자 사용으로 원본 M²BEV 대비 시각 변환 지연이 한 수준 감소했다.
- 가장 큰 Fast-BEV 모델는 832×1440 입력 해상도에서 49.1% NDS를 기록했으며, 928×1600 초과 해상도에서는 성능 향상가 멈추는 경향을 보여 높은 해상도에서의 수익 감소를 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.