Skip to main content
QUICK REVIEW

[논문 리뷰] TFDet: Target-Aware Fusion for RGB-T Pedestrian Detection

Xue Zhang, Xiaohan Zhang|arXiv (Cornell University)|2023. 05. 26.
Advanced Image Fusion Techniques참고 문헌 86인용 수 6
한 줄 요약

TFDet는 RGB-T 보행자 검출을 위한 대상 인식 융합 전략을 제안하여 노이즈가 섞인 융합 특징으로 인한 잘못된 경고를 억제하고 특징 대비를 향상시킨다. 특징 융합 모듈, 특징 정제 모듈, 상관관계 최대 손실 함수를 통합함으로써 TFDet는 KAIST 및 LLVIP 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 특히 저조도 조건에서 뛰어난 성능을 보이며, 이전 SOTA 방법들과 유사한 추론 속도를 유지한다.

ABSTRACT

Pedestrian detection plays a critical role in computer vision as it contributes to ensuring traffic safety. Existing methods that rely solely on RGB images suffer from performance degradation under low-light conditions due to the lack of useful information. To address this issue, recent multispectral detection approaches have combined thermal images to provide complementary information and have obtained enhanced performances. Nevertheless, few approaches focus on the negative effects of false positives caused by noisy fused feature maps. Different from them, we comprehensively analyze the impacts of false positives on the detection performance and find that enhancing feature contrast can significantly reduce these false positives. In this paper, we propose a novel target-aware fusion strategy for multispectral pedestrian detection, named TFDet. TFDet achieves state-of-the-art performance on two multispectral pedestrian benchmarks, KAIST and LLVIP. TFDet can easily extend to multi-class object detection scenarios. It outperforms the previous best approaches on two multispectral object detection benchmarks, FLIR and M3FD. Importantly, TFDet has comparable inference efficiency to the previous approaches, and has remarkably good detection performance even under low-light conditions, which is a significant advancement for ensuring road safety.

연구 동기 및 목표

  • 저조도 조건에서 RGB 전용 보행자 검출기의 성능 저하 문제를 해결하기 위해.
  • 다중 스펙트럼 융합에서 노이즈가 섞인 융합 특징으로 인해 발생하는 잘못된 경고의 부정적 영향을 규명하고 이를 완화하기 위해.
  • 배경 잡음은 억제하면서 보행자에 대한 구분 능력이 뛰어난 특징을 강화하는 융합 전략을 개발하기 위해.
  • 실시간 교통 안전 응용에 적합한 계산 효율성을 확보하면서 최신 기술 수준의 검출 정확도를 달성하기 위해.

제안 방법

  • 쌍체의 RGB 및 열화상 특징 간의 병렬 채널 및 교차 채널 유사성을 활용하는 대상 인식 융합 전략을 제안한다.
  • 양 모odal의 보완적 특징을 집계하기 위해 특징 융합 모듈(FFM)을 도입한다.
  • 대상 특징과 비대상 특징을 구분하기 위해 특징 분류 유닛과 특징 대비 강화 유닛을 갖춘 특징 정제 모듈(FRM)을 활용한다.
  • 세그멘테이션 손실($\mathcal{L}_{\rm seg}$)과 음성 상관관계 손실($\mathcal{L}_{\rm neg\_corr}$)을 포함하는 상관관계 최대 손실 함수를 설계하여 특징의 구분 능력을 향상시킨다.
  • 일단계 및 이단계 검출기 모두에 이 융합 전략을 적용하여 유연성과 광범위한 적용 가능성을 확보한다.
  • 배경으로 VGG-16과 Faster R-CNN를 사용하고, 표준 프rotocol에 따라 KAIST 및 LLVIP 데이터셋에서 평가한다.

실험 결과

연구 질문

  • RQ1노이즈가 섞인 융합 특징은 다중 스펙트럼 보행자 검출에서 잘못된 경고 검출에 어떤 기여를 하는가?
  • RQ2대상 영역와 배경 영역 간의 특징 대비를 향상시키면 RGB-T 융합에서 잘못된 경고를 상당히 줄일 수 있는가?
  • RQ3기존 융합 방법에 비해 대상 인식 융합 전략은 저조도 조건에서 검출 성능을 얼마나 향상시킬 수 있는가?
  • RQ4제안된 상관관계 최대 손실 함수는 특징의 구분 능력과 검출 정확도에 어떤 영향을 미치는가?
  • RQ5제안된 융합 전략은 최신 기술 수준 성능을 달성하면서도 고속 추론 속도를 유지할 수 있는가?

주요 결과

  • TFDet는 KAIST 데이터셋에서 4.47%의 미스 레이트를 기록하여 이전 방법들보다 뚜렷이 뛰어난 성능을 보였다.
  • LLVIP 데이터셋에서 TFDet는 최고의 AP(75.3%)와 AP@IoU=0.75(68.9%)를 기록하여 정밀한 국소화 능력을 입증했다.
  • RGB 이미지가 심각하게 열악한 저조도 환경인 KAIST의 야간 서브셋에서 TFDet는 미스 레이트를 4.47%로 낮춰 저조도 조건에서도 뛰어난 강건성을 입증했다.
  • 제거 분석 결과, FFM, FRM 및 상관관계 최대 손실을 조합함으로써 미스 레이트가 8.57%에서 4.47%로 감소하였고, 0.3 이상의 잘못된 경고 신뢰도를 가진 예측은 40% 감소했다.
  • TFDet는 경쟁적인 추론 속도를 유지하며, 단일 RTX 3060 GPU에서 이미지당 15.8ms의 시간을 기록하여 SOTA 방법인 DCMNet과 유사한 성능을 보였다.
  • 정성적 결과에서는 TFDet가 일상 및 야간 환경에서 모두 모든 보행자를 성공적으로 검출하는 반면, 경쟁 방법들은 다수의 잘못된 경고와 잘못된 부정 예측을 유발했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.