Skip to main content
QUICK REVIEW

[논문 리뷰] LLVIP: A Visible-infrared Paired Dataset for Low-light Vision

Xinyu Jia, Chuang Zhu|arXiv (Cornell University)|2021. 08. 24.
Advanced Image Fusion TechniquesEngineering참고 문헌 20인용 수 21
한 줄 요약

이 논문은 저조도 시각 작업을 위해 특별히 설계된 최초의 대규모, 시간 및 공간으로 정렬된 가시광선-적외선 쌍화상 데이터셋인 LLVIP을 소개한다. 이 데이터셋은 극한의 저조도 조건에서 영상 융합, 보행자 검출, 영상 간 번역 작업에 대한 고급 연구를 가능하게 하며, 실험을 통해 기존 알고리즘들이 세 가지 작업 전반에서 뚜렷한 성능 격차를 보이며 데이터셋의 과제성과 향후 개발을 위한 유용성을 입증한다.

ABSTRACT

It is very challenging for various visual tasks such as image fusion, pedestrian detection and image-to-image translation in low light conditions due to the loss of effective target areas. In this case, infrared and visible images can be used together to provide both rich detail information and effective target areas. In this paper, we present LLVIP, a visible-infrared paired dataset for low-light vision. This dataset contains 30976 images, or 15488 pairs, most of which were taken at very dark scenes, and all of the images are strictly aligned in time and space. Pedestrians in the dataset are labeled. We compare the dataset with other visible-infrared datasets and evaluate the performance of some popular visual algorithms including image fusion, pedestrian detection and image-to-image translation on the dataset. The experimental results demonstrate the complementary effect of fusion on image information, and find the deficiency of existing algorithms of the three visual tasks in very low-light conditions. We believe the LLVIP dataset will contribute to the community of computer vision by promoting image fusion, pedestrian detection and image-to-image translation in very low-light applications. The dataset is being released in https://bupt-ai-cz.github.io/LLVIP. Raw data is also provided for further research such as image registration.

연구 동기 및 목표

  • 영상 융합, 보행자 검출, 영상 간 번역과 같은 저조도 시각 작업을 위해 특화된 대규모, 정렬된 가시광선-적외선 데이터셋의 부족을 해결하기 위해.
  • 정렬된 적외선 영상의 역할을 활용하여 극저조도 가시광선 영상에서 보행자를 정확하게 주석 처리할 수 있는 신뢰할 수 있는 방법을 개발하기 위해.
  • 어려운 저조도 조건을 가진 데이터셋에서 최신 알고리즘의 영상 융합, 보행자 검출, 영상 간 번역 성능을 평가하기 위해.
  • 현재 모델의 한계를 드러내고 저조도 컴퓨터 비전 분야의 연구를 촉진하기 위한 벤치마크 데이터셋을 제공하기 위해.

제안 방법

  • 동기화된 가시광선 및 적외선 센서를 갖춘 이중 카메라 시스템을 사용하여 총 30,976장의 영상(15,488개의 정렬된 가시광선-적외선 쌍화상)을 수집하였다.
  • 모든 쌍화상 간에 엄격한 정렬을 확보하기 위해 정밀한 공간적 및 시간적 정렬을 수행하였다.
  • 정렬된 적외선 영상의 정보를 활용하여 극저조도 가시광선 영상에서 보행자를 정확하게 주석 처리할 수 있는 역매핑 주석 방법을 제안하였다.
  • YOLOv3 및 YOLOv5를 활용한 보행자 검출, pix2pixGAN을 활용한 영상 간 번역을 포함한 여러 딥러닝 모델을 훈련 및 평가하였다.
  • 모든 작업에 대해 AP, AP50, AP75, SSIM, PSNR와 같은 지표를 사용하여 체계적인 정량적 및 정성적 평가를 수행하였다.
  • 영상 융합, 정렬, 도메인 적응 분야의 향후 연구를 지원하기 위해 원본 영상 및 주석을 포함한 전체 데이터셋을 공개하였다.

실험 결과

연구 질문

  • RQ1현재의 영상 융합 방법은 저조도 가시광선-적외선 영상 쌍에서 얼마나 효과적인가? 특히 세부 정보 및 대상 정보 유지 측면에서의 한계는 무엇인가?
  • RQ2정렬된 적외선 주석으로 훈련된 기존의 보행자 검출 모델이 저조도 가시광선 영상에서 얼마나 성능을 내는가?
  • RQ3pix2pixGAN과 같은 영상 간 번역 모델은 왜 저조도 데이터에서 실패하는가? 표준 데이터셋 대비 성능 저하 정도는 어떠한가?
  • RQ4극저조도 가시광선 영상에서 인간 주석이 불가능한 상황에서 정렬된 적외선 영상이 보행자 주석에 효과적으로 활용될 수 있는가?
  • RQ5최신 모델의 성능은 저조도 조건에서 가시광선, 적외선, 융합 영상 표현 방식 간에 어떻게 달라지는가?

주요 결과

  • 영상 융합 알고리즘은 저조도 가시광선 영상에서 세부 정보를 유지하는 데 어려움을 겪으며, 극단적인 조도 조건 하에서 현재 융합 방법에 큰 격차가 있음을 시사한다.
  • YOLOv5를 사용한 저조도 가시광선 영상에서의 보행자 검출은 평균 정밀도(AP)가 52.7%에 불과하지만, 적외선 영상에서는 67.0%의 AP를 기록하여 저조도 검출 모델의 향상이 시급함을 보여준다.
  • LLVIP에서 pix2pixGAN을 활용한 영상 간 번역의 경우 PSNR는 10.77, SSIM는 0.176에 그치며, KAIST 데이터셋의 성능(PSNR 28.99, SSIM 0.69)에 비해 훨씬 낮은 성능을 보이며 저조도 환경에 대한 일반화 능력이 떨어짐을 입증한다.
  • 미스율-FPPI 곡선 분석 결과, YOLOv5 및 YOLOv3는 특히 낮은 이미지당 오류 경고 수(FPPI)에서 높은 미스율을 보이며 어둠짐에서의 검출 신뢰도가 떨어짐을 나타낸다.
  • 이 데이터셋은 융합, 검출, 번역의 세 가지 작업 전반에서 기존 알고리즘이 매우 저조도 조건에서 최적의 성능을 내지 못함을 드러내며, 새로운 방법 개발의 필요성을 강조한다.
  • 역매핑 주석 방법은 적외선 영상의 일관성을 활용하여 극저조도 가시광선 영상에서 정확한 보행자 주석을 가능하게 하여 신뢰할 수 있는 평가를 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.