[논문 리뷰] RELLIS-3D Dataset: Data, Benchmarks and Analysis
이 논문은 13,556개의 LiDAR 스캔과 6,235개의 RGB 이미지 레이블을 포함한 대규모 다중모달 데이터셋 RELLIS-3D를 소개한다. 이는 비도시 환경에서 3차원 세분화 모델의 벤치마크를 가능하게 하며, 기존 최고 수준의 모델들이 도시 벤치마크 대비 성능 저하를 보이며, 비도시 환경에서의 클래스 불균형과 비정형 지형의 과제를 드러낸다.
Semantic scene understanding is crucial for robust and safe autonomous navigation, particularly so in off-road environments. Recent deep learning advances for 3D semantic segmentation rely heavily on large sets of training data, however existing autonomy datasets either represent urban environments or lack multimodal off-road data. We fill this gap with RELLIS-3D, a multimodal dataset collected in an off-road environment, which contains annotations for 13,556 LiDAR scans and 6,235 images. The data was collected on the Rellis Campus of Texas A\&M University and presents challenges to existing algorithms related to class imbalance and environmental topography. Additionally, we evaluate the current state-of-the-art deep learning semantic segmentation models on this dataset. Experimental results show that RELLIS-3D presents challenges for algorithms designed for segmentation in urban environments. This novel dataset provides the resources needed by researchers to continue to develop more advanced algorithms and investigate new research directions to enhance autonomous navigation in off-road environments. RELLIS-3D is available at https://github.com/unmannedlab/RELLIS-3D
연구 동기 및 목표
- 비도시 자율 주행 연구를 위한 대규모 다중모달 데이터셋의 부족을 보완한다.
- 강력한 알고리즘 개발을 위한 동기화된 원시 센서 데이터(LiDAR, RGB, 스테레오, GPS/INS)를 제공한다.
- 학습, 검증, 테스트 분할을 포함한 벤치마크를 설정하여 세분화 모델 평가를 가능하게 한다.
- 클래스 불균형과 지형 복잡성으로 인해 최신 기술 모델의 성능 저하를 분석한다.
- 향후 세분화 이해, 센서 융합, 이격성 또는 경사 방향과 같은 고수준 의미 레이블 연구를 가능하게 한다.
제안 방법
- 텍사스 A&M 대학교 Rellis 캠퍼스에서 전술적 전차(워스터그) 로봇 플랫폼을 사용해 RGB 카메라, LiDAR, 스테레오 깊이 센서, GPS/INS, 자이로스코프를 장착하여 동기화된 다중모달 데이터를 수집하였다.
- 다섯 개의 별도된 시퀀스 동안 6,235개의 RGB 이미지에 대한 픽셀 수준의 의미 레이블과 13,556개의 LiDAR 포인트 클라우드에 대한 포인트 수준의 의미 레이블을 생성하였다.
- 재현 가능한 세분화 모델 벤치마킹을 가능하게 하기 위해 표준화된 학습, 검증, 테스트 분할을 정의하였다.
- mIoU를 주요 지표로 사용하여 SalsaNext와 KPConv와 같은 최신 기술 모델을 이미지 및 포인트 클라우드 세분화 작업에 대해 평가하였다.
- 클래스 불균형과 지형 비정형성으로 인한 성능 저하를 분석하였으며, 특히 LiDAR 기반 세분화에서 두드러진다.
- 다중 스캔 레지스트레이션을 통해 단일 스캔 LiDAR가 보이지 않는 물체(예: 덤불 뒤에 숨은 울타리)를 성공적으로 탐지함을 보여주며, 다중모달 융합의 중요성을 입증하였다.

실험 결과
연구 질문
- RQ1복잡한 지형과 클래스 불균형을 가진 대규모 다중모달 비도시 데이터셋에서 현재 최고 수준의 3차원 세분화 모델은 어떤 성능을 보이는가?
- RQ2비도시 환경에서의 클래스 불균형이 LiDAR 기반 세분화에서 딥 러닝 모델의 성능에 얼마나 큰 영향을 미치는가?
- RQ3텍스처와 색상 정보가 풍부한 이미지 기반 모델이 비도시 데이터에서 포인트 클라우드 기반 모델보다 뛰어나게 성능을 냈는가?
- RQ4특히 RGB와 다중 스캔 LiDAR를 융합한 다중모달 융합은 울타리처럼 시각적 또는 기하학적으로 미세한 특징을 가진 의미적으로 중요한 물체를 어떻게 향상시키는가?
- RQ5도시 데이터셋에서 학습된 모델을 비정형 비도시 환경으로 이식할 때의 주요 과제는 무엇인가?
주요 결과
- SalsaNext는 RELLIS-3D LiDAR 세분화에서 43.07%의 mIoU를 기록했으며, 이는 SemanticKITTI에서의 59.5% mIoU 대비 상당한 성능 저하를 보여, 비도시 환경에서의 성능 저하를 확인한다.
- KPConv는 RELLIS-3D에서 단지 19.07%의 mIoU를 기록했으며, SemanticKITTI에서의 58.8% mIoU에 비해 극명한 성능 저하를 보이며, 클래스 불균형과 비정형 지형으로 인한 심각한 과제를 확인한다.
- 이미지 기반 모델이 더 밀도 있고 시각적으로 풍부한 특징 덕분에 포인트 클라우드 기반 모델보다 뛰어난 성능을 보였으며, RGB 세분화가 LiDAR 기반 방법보다 더 높은 정확도를 보였다.
- 단일 LiDAR 스캔은 덤불 뒤에 숨은 물체(예: 울타리)를 자주 탐지하지 못했지만, 다중 스캔 레지스트레이션을 통해 성공적으로 탐지함을 확인하였으며, 시간적 융합의 가치를 입증하였다.
- KPConv에서 레이블 분포 기반 샘플링을 적용했을 때 mIoU가 단지 0.6% 향상되었으며, 이는 기존 샘플링 전략이 비도시 데이터의 극심한 클래스 불균형을 보완하는 데 부적절하다는 것을 시사한다.
- 이 데이터셋은 현재 의미 레이블이 이격성, 기울기 방향과 같은 고수준 의미 개념을 포함하지 못하고 있음을 드러내며, 향후 연구에서 온톨로지 정의를 확장할 필요가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.