Skip to main content
QUICK REVIEW

[논문 리뷰] SkipcrossNets: Adaptive Skip-cross Fusion for Road Detection

Yan Gong, Xinyu Zhang|arXiv (Cornell University)|2023. 08. 24.
Advanced Neural Network ApplicationsComputer Science인용 수 3
한 줄 요약

이 논문은 도로 감지를 위한 라이다 포인트 클라우드와 카메라 이미지의 동적이고 다중 수준의 융합을 가능하게 하는 새로운 적응형 스킵크로스 퓨전 아키텍처인 SkipcrossNets를 제안한다. 모든 레이어를 관통하는 조밀한 다중 모odal 스킵 연결을 구축함으로써, 방법은 최적의 융합 지점을 적응적으로 선택하며, KITTI에서 96.85%의 MaxF와 A2D2에서 84.84%의 F1을 기록하여 최신 기술 수준의 성능을 달성한다. 이와 동시에 모델 크기는 2.33 MB로 작고, 실시간 배포에 적합한 68.24 FPS의 추론 속도를 유지한다.

ABSTRACT

Multi-modal fusion is increasingly being used for autonomous driving tasks, as different modalities provide unique information for feature extraction. However, the existing two-stream networks are only fused at a specific network layer, which requires a lot of manual attempts to set up. As the CNN goes deeper, the two modal features become more and more advanced and abstract, and the fusion occurs at the feature level with a large gap, which can easily hurt the performance. To reduce the loss of height and depth information during the process of projecting point clouds into 2D space, we utilize calibration parameters to project the point cloud into Altitude Difference Images (ADIs), which exhibit more distinct road features. In this study, we propose a novel fusion architecture called Skip-cross Networks (SkipcrossNets), which combine adaptively ADIs and camera images without being bound to a certain fusion epoch. Specifically, skip-cross fusion strategy connects each layer to each layer in a feed-forward manner, and for each layer, the feature maps of all previous layers are used as input and its own feature maps are used as input to all subsequent layers for the other modality, enhancing feature propagation and multi-modal features fusion. This strategy facilitates selection of the most similar feature layers from two modalities, enhancing feature reuse and providing complementary effects for sparse point cloud features. The advantages of skip-cross fusion strategy is demonstrated through application to the KITTI and A2D2 datasets, achieving a MaxF score of 96.85% on KITTI and an F1 score of 84.84% on A2D2. The model parameters require only 2.33 MB of memory at a speed of 68.24 FPS, which can be viable for mobile terminals and embedded devices.

연구 동기 및 목표

  • 다중 모달 도로 감지에 대한 이중 스트림 네트워크에서 최적의 융합 타이밍이 아닌 하위 최적의 융합 타이밍 문제를 해결하기 위해.
  • 딥 네트워크에서 융합 레이어 선택을 위한 수동적인 초모델 조정에 의존도를 줄이기 위해.
  • 희소 라이다와 고해상도 카메라 특징 간의 특징 전파 및 상호 보완성을 향상시키기 위해.
  • 임베디드 및 모바일 자율 주행 시스템에 적합한 경량이며 실시간 처리가 가능한 모델을 개발하기 위해.
  • 모달 간의 적응적이고 교차 수준의 융합을 통해 희소 포인트 클라우드 데이터에서의 성능을 향상시키기 위해.

제안 방법

  • 모든 후속 레이어의 다른 모달리티의 레이어에 각 레이어의 특징 맵을 피드포워드 방식으로 연결하는 스킵크로스 융합 메커니즘을 제안한다.
  • 특징 수준 전역에서 최적의 융합 가중치를 학습함으로써 적응적이고 동적 융합을 가능하게 하는 스킵크로스 블록을 도입한다.
  • 공간적 세부 정보를 유지하고 특징 학습을 향상시키기 위해 잔차 블록(ResNet34 백본)을 사용한 다중 스케일 인코더-디코더 아키텍처를 사용한다.
  • 저수준 특징을 유지하고 해상도 복구를 향상시키기 위해 인코더에서 디코더로의 스킵 연결을 적용한다.
  • 희소 데이터를 위한 특징 표현을 향상시키기 위해 3D 라이다 포인트 클라우드를 2D 공간으로 투영하기 위해 적응적 거리 이미지(ADIs)를 사용한다.
  • 오직 2.33 MB의 파라미터만을 가지는 경량 네트워크 아키텍처를 설계하여, 68.24 FPS의 고속 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1다양한 특징 수준에서 다중 모달 융합을 어떻게 적응적으로 구현할 수 있을까? 이를 통해 수동적인 융합 타이밍 선택을 피할 수 있는가?
  • RQ2교차 수준의 조밀한 스킵 연결이 라이다와 카메라 모달 간의 특징 상호 보완성에 어떤 영향을 미치는가?
  • RQ3모델 복잡도 증가 없이도 적응적 융합이 희소 라이다 데이터에서의 성능 향상에 기여할 수 있는가?
  • RQ4예측 정확도와 효율성 측면에서 제안된 스킵크로스 융합 전략은 초기, 중간, 후기 융합 전략과 비교해 어떻게 다를까?
  • RQ5이러한 융합 메커니즘은 다양한 네트워크 아키텍처와 데이터셋에 대해 얼마나 일반화 가능한가?

주요 결과

  • SkipcrossNets는 KITTI 데이터셋에서 96.85%의 MaxF 점수를 기록하여 기존 방법들을 능가했다.
  • A2D2 데이터셋에서 모델은 84.84%의 F1 점수를 기록하여 다양한 도로 환경에서의 강력한 일반화 능력을 입증했다.
  • 모델의 추론 속도는 68.24 FPS에 달하여 모바일 및 임베디드 플랫폼에서의 실시간 배포에 적합하다.
  • 모델 크기는 단지 2.33 MB로, 유사한 최신 기술 수준의 모델들보다 크게 작다.
  • 제거 분석 결과, 스킵크로스 융합은 기준 융합 전략 대비 KITTI에서 MaxF를 1.11% 향상시키고, A2D2에서 F1을 1.18% 향상시켰다.
  • ResNet34 백본과 스킵 연결의 추가로 성능이 더욱 향상되었으며, MaxF는 1.32% 향상되고 F1은 1.27% 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.