[논문 리뷰] GrooMeD-NMS: Grouped Mathematically Differentiable NMS for Monocular 3D Object Detection
GrooMeD-NMS는 단안 3D 객체 검출을 위한 미분 가능하고 닫힌 형태의 비최대 억제(NMS) 방법을 도입하여, NMS 이후에 손실 함수를 적용할 수 있는 엔드 투 엔드 훈련을 가능하게 한다. NMS를 행렬 연산으로 공식화하고 비지도 그룹화 및 마스킹을 적용함으로써 KITTI 벤치마크에서 최신 기술 수준(SoTA) 성능을 달성하며, 단일 이미지 및 영상 기반 방법을 모두 능가한다.
Modern 3D object detectors have immensely benefited from the end-to-end learning idea. However, most of them use a post-processing algorithm called Non-Maximal Suppression (NMS) only during inference. While there were attempts to include NMS in the training pipeline for tasks such as 2D object detection, they have been less widely adopted due to a non-mathematical expression of the NMS. In this paper, we present and integrate GrooMeD-NMS -- a novel Grouped Mathematically Differentiable NMS for monocular 3D object detection, such that the network is trained end-to-end with a loss on the boxes after NMS. We first formulate NMS as a matrix operation and then group and mask the boxes in an unsupervised manner to obtain a simple closed-form expression of the NMS. GrooMeD-NMS addresses the mismatch between training and inference pipelines and, therefore, forces the network to select the best 3D box in a differentiable manner. As a result, GrooMeD-NMS achieves state-of-the-art monocular 3D object detection results on the KITTI benchmark dataset performing comparably to monocular video-based methods. Code and models at https://github.com/abhi1kumar/groomed_nms
연구 동기 및 목표
- 단안 3D 객체 검출에서 훈련과 추론 간의 불일치 문제를 해결하기 위해, NMS는 추론 시에만 적용되지만 훈련 중에는 적용되지 않는 점을 해결한다.
- 백프로파게이션을 지원하고 3D 박스 선택의 기울기 기반 최적화를 가능하게 하는 수학적으로 미분 가능한 NMS를 개발한다.
- 미분 가능한 NMS를 통해 네트워크가 최적의 국소화된 박스를 선택하도록 훈련시킴으로써 예측 박스 점수와 3D IoU 간의 상관관계를 향상시킨다.
- 경로 기반 또는 비미분 가능한 후처리가 필요 없도록 NMS를 훈련 파이프라인에 통합하여 학습 가능한, GPU 우수한 레이어로 구현한다.
제안 방법
- IoU 행렬과 점수 벡터를 사용하여 고전적 NMS를 행렬 연산으로 공식화하여, 미분 가능한 계산을 가능하게 한다.
- 후보 박스의 비지도 그룹화 및 마스킹을 도입하여 NMS 표현을 단순화하고 행렬 역행렬 계산이 필요 없도록 한다.
- NMS의 하드 임계값 처리를 선형, 지수, 시그모이드 함수 등의 소프트 프루닝 함수로 대체하여 역전파 동안 기울기 흐름을 유지한다.
- GrooMeD-NMS를 네트워크 내의 미분 가능한 레이어로 통합하여, NMS 이후의 손실에서 기울기가 네트워크 파rameter로 다시 흐르도록 한다.
- 훈련을 추론와 더 잘 맞추기 위해 이미지별 AP(이미지당 AP) 손실을 사용하여 일반화 성능을 향상시킨다.
- 자기 균형 잡힌 신뢰도 점수와 분류 점수를 조합하여 NMS 동안 국소화 정확도를 향상시킨다.
실험 결과
연구 질문
- RQ1엔드 투 엔드 3D 객체 검출을 위한 행렬 연산을 사용한 닫힌 형태의 수학적 미분 가능한 NMS를 공식화할 수 있는가?
- RQ2훈련 파이프라인에 NMS를 통합하면 예측 박스 점수와 3D IoU 간의 상관관계가 향상되는가?
- RQ3비지도 그룹화 및 마스킹을 통해 미분 가능한 NMS 표현을 단순화하면서도 기울기 흐름과 성능 유지를 할 수 있는가?
- RQ4NMS 이후에 손실을 적용하여 훈련하면 단안 3D 검출 벤치마크에서 더 나은 일반화 및 최신 기술 수준 성능을 달성할 수 있는가?
주요 결과
- GrooMeD-NMS는 KITTI 벤치마크에서 최신 기술 수준 성능을 달성했으며, Val 1 스플릿에서 0.7 IoU 기준 3D mAP 19.67%, 0.5 IoU 기준 14.32%를 기록하여 이전 최고 성능 기준을 초월했다.
- KITTI Val 2 스플릿에서 0.7 IoU 기준 3D mAP 55.62%를 기록하여 M3D-RPN 및 Kinematic (Image) 기준선을 모두 능가했다.
- NMS 이후의 점수-IoU 상관관계는 0.345에 도달했으며, M3D-RPN, Kinematic (Image), 심지어 Kinematic (Video)를 모두 초월하여 점수와 국소화 품질 간의 정렬성이 향상됨을 입증했다.
- GrooMeD-NMS를 사용한 훈련은 훈련과 추론 간 성능 격차를 줄였으며, 중간 및 어려운 난이도 세트에서 일관된 향상이 관찰되었다.
- 이미지당 추론 시간은 GrooMeD-NMS 기준 0.15ms로 고전적 NMS(0.12ms)와 비슷하며, 추론 시 고전적 NMS로 전환해도 성능에 변화가 없었다.
- 제거 분석 결과, 자기 균형 잡힌 신뢰도 점수와 이미지별 AP 손실 사용이 성능 향상에 기여하는 반면, 분류 점수만을 사용한 NMS는 성능에 악영향을 미쳤다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.