Skip to main content
QUICK REVIEW

[논문 리뷰] Fully Sparse 3D Occupancy Prediction

Haisong Liu, Chen Yang|arXiv (Cornell University)|2023. 12. 28.
Video Surveillance and Tracking Methods인용 수 6
한 줄 요약

이 논문은 스파스한 바이트 디코더와 스파스한 인스턴스 쿼리를 통해 기하학적 및 인스턴스 스파arsity를 활용하는 완전히 스파스한 팬옵틱 3D 오브젝티비티 예측 모델인 SparseOcc를 제안한다. Occ3D-nus에서 25.4 FPS로 실시간 성능을 달성하면서 mIoU 26.0을 기록하였고, 8帧에 걸친 시간적 모델링을 통해 성능을 더욱 향상시켜 30.9 mIoU를 달성하여, 추가적인 데이터 증강이나 아키텍처적 장식 없이도 최신 기술 수준(SOTA)의 정확도와 속도를 확보하였다.

ABSTRACT

Occupancy prediction plays a pivotal role in autonomous driving. Previous methods typically construct dense 3D volumes, neglecting the inherent sparsity of the scene and suffering from high computational costs. To bridge the gap, we introduce a novel fully sparse occupancy network, termed SparseOcc. SparseOcc initially reconstructs a sparse 3D representation from camera-only inputs and subsequently predicts semantic/instance occupancy from the 3D sparse representation by sparse queries. A mask-guided sparse sampling is designed to enable sparse queries to interact with 2D features in a fully sparse manner, thereby circumventing costly dense features or global attention. Additionally, we design a thoughtful ray-based evaluation metric, namely RayIoU, to solve the inconsistency penalty along the depth axis raised in traditional voxel-level mIoU criteria. SparseOcc demonstrates its effectiveness by achieving a RayIoU of 34.0, while maintaining a real-time inference speed of 17.3 FPS, with 7 history frames inputs. By incorporating more preceding frames to 15, SparseOcc continuously improves its performance to 35.1 RayIoU without bells and whistles.

연구 동기 및 목표

  • 자율주행에서의 밀도 높은 3D 오브젝티비티 예측의 높은 계산 비용 문제를 시나리오의 스파arsity를 활용하여 해결하고자 한다.
  • 세분화 및 인스턴스 수준의 오브젝티비티 예측을 하나의 팬옵틱 프레임워크로 통합하여 인스턴스 인식 가능한 3D 오브젝티비티를 가능하게 하고자 한다.
  • 밀도 높은 3D 특징 및 전역 어텐션 메커니즘을 제거하여 완전히 스파스한 아키텍처를 가능하게 하고자 한다.
  • 공정한 평가를 위해 PQ 지표를 사용하는 첫 번째 시각 중심 팬옵틱 오브젝티비티 벤치마크를 구축하고자 한다.
  • Occ3D-nus 데이터셋에서 정확도와 추론 속도 양면에서 최신 기술 수준의 성능을 입증하고자 한다.

제안 방법

  • 모든 비자유 영역(점유된 영역)만 재구성하는 스파스한 바이트 디코더를 제안하여, 밀도 높은 3D 특징 생성을 피하고 계산 비용을 크게 감소시킨다.
  • 마스크 가이드드 스파스 샘플링을 통해 2D 특징과 상호작용하는 스파스한 인스턴스 쿼리를 도입하여, 마스크 트랜스포머에서 비용이 많이 드는 밀도 높은 크로스 어텐션을 피한다.
  • 스파스한 쿼리를 사용하는 마스크 트랜스포머를 활용하여 인스턴스 마스크와 클래스 레이블을 동시에 예측함으로써 종단 간 팬옵틱 오브젝티비티 예측을 가능하게 한다.
  • 마스크 가이드드 스파스 샘플링을 사용하여 관련이 있는 2D 특징들만 효율적으로 접근함으로써, 스파arsity를 유지하면서도 3D 쿼리와 2D 특징 간 효과적인 상호작용을 가능하게 한다.
  • 과거 8帧의 특징을 스파스한 바이트 디코더와 마스크 트랜스포머 모두에 융합하여 시간적 모델링을 통합함으로써 장면 완성도와 정확도를 향상시킨다.
  • Occ3D-nus 기반으로 시각 중심 팬옵틱 오브젝티비티 벤치마크를 구축하였으며, 평가에 Panoptic Quality (PQ)와 mIoU를 사용한다.

실험 결과

연구 질문

  • RQ1완전히 스파스한 아키텍처가 실시간 추론을 유지하면서도 높은 정확도의 3D 팬옵틱 오브젝티비티 예측을 달성할 수 있는가?
  • RQ2밀도 높은 3D 특징 없이도 스파스한 인스턴스 쿼리 기반 예측이 객체 수준의 스파arsity를 효과적으로 모델링할 수 있는가?
  • RQ3시간적 모델링이 스파스한 3D 오브젝티비티 예측 성능에 어느 정도 기여하는가?
  • RQ4PQ 지표를 사용하는 시각 중심 벤치마크가 기존의 세분화 전용 벤치마크보다 팬옵틱 오브젝티비티를 더 잘 평가할 수 있는가?
  • RQ5스파스한 바이트 디코딩과 마스크 가이드드 샘플링의 설계가 밀도 높은 또는 스파스에서 밀도 높은 접근 방식에 비해 정확도와 효율성 측면에서 어떻게 비교되는가?

주요 결과

  • SparseOcc는 Occ3D-nus 데이터셋에서 실시간 추론 25.4 FPS로 mIoU 26.0을 달성하여 높은 효율성과 정확도를 입증하였다.
  • 8帧에 걸친 시간적 모델링을 적용한 결과, 성능이 향상되어 30.9 mIoU를 기록하였으며, 데이터 증강이나 아키텍처적 장식 없이도 최신 기술 수준의 성능을 확보하였다.
  • 절단 분석 결과, 스파스한 바이트 디코더와 마스크 트랜스포머 모두 시간적 융합에서 유의미한 이점을 얻었으며, 특히 디코더의 기여가 더 크다는 것이 확인되었다 (비활성화 시 3.5 mIoU 감소).
  • 인스턴스 쿼리 수를 100개 초과로 늘여도 성능 향상이 없었으며, 이는 100개의 쿼리로도 작업에 충분하다는 것을 시사한다.
  • 손실 함수에서 클래스 가중치를 조정함으로써 mRecall이 24.2에서 74.9로 향상되었으며, 이는 제한된 바이트 토큰으로도 장면을 효과적으로 커버할 수 있음을 보여준다.
  • 모델의 성능는 누적된 LiDAR 포인트 클라우드에서의 신뢰도가 떨어지는 진짜 지도 데이터에 대해서도 뛰어난 내성적 안정성을 보였지만, 장면 완성 오류 가능성으로 인해 여전히 한계점으로 남아 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.