Skip to main content
QUICK REVIEW

[论文解读] LLVIP: A Visible-infrared Paired Dataset for Low-light Vision

Xinyu Jia, Chuang Zhu|arXiv (Cornell University)|Aug 24, 2021
Advanced Image Fusion TechniquesEngineering参考文献 20被引用 21
一句话总结

本文提出了LLVIP,这是首个专为低光照视觉任务设计的大规模、时空对齐的可见光-红外图像配对数据集。该数据集支持在极端低光照条件下进行图像融合、行人检测和图像到图像翻译的高级研究,实验揭示了现有算法在三项任务中均存在显著性能差距,凸显了该数据集在推动未来研究中的挑战性与实用性。

ABSTRACT

It is very challenging for various visual tasks such as image fusion, pedestrian detection and image-to-image translation in low light conditions due to the loss of effective target areas. In this case, infrared and visible images can be used together to provide both rich detail information and effective target areas. In this paper, we present LLVIP, a visible-infrared paired dataset for low-light vision. This dataset contains 30976 images, or 15488 pairs, most of which were taken at very dark scenes, and all of the images are strictly aligned in time and space. Pedestrians in the dataset are labeled. We compare the dataset with other visible-infrared datasets and evaluate the performance of some popular visual algorithms including image fusion, pedestrian detection and image-to-image translation on the dataset. The experimental results demonstrate the complementary effect of fusion on image information, and find the deficiency of existing algorithms of the three visual tasks in very low-light conditions. We believe the LLVIP dataset will contribute to the community of computer vision by promoting image fusion, pedestrian detection and image-to-image translation in very low-light applications. The dataset is being released in https://bupt-ai-cz.github.io/LLVIP. Raw data is also provided for further research such as image registration.

研究动机与目标

  • 为解决低光照视觉任务(如图像融合、行人检测和图像到图像翻译)中缺乏大规模、对齐的可见光-红外数据集的问题。
  • 通过利用对齐的红外图像进行反向映射,提出一种可靠的方法,用于在极低光照的可见光图像中标注行人。
  • 在具有挑战性的低光照条件下,评估最先进算法在图像融合、行人检测和图像到图像翻译任务中的性能表现。
  • 提供一个基准数据集,揭示当前模型的局限性,并推动低光照计算机视觉领域的研究发展。

提出的方法

  • 使用配备同步可见光与红外传感器的双目相机系统,采集30,976张图像(15,488对对齐的可见光-红外图像对)。
  • 执行精确的空间与时间配准,确保所有图像对中可见光与红外图像之间严格对齐。
  • 提出一种反向映射标注方法,利用对齐的红外图像在极低光照的可见光图像中准确标注行人。
  • 训练并评估多种深度学习模型,包括用于行人检测的YOLOv3和YOLOv5,以及用于图像到图像翻译的pix2pixGAN。
  • 使用AP、AP50、AP75、SSIM和PSNR等指标,对所有任务进行全面的定量与定性评估。
  • 发布完整数据集,包括原始图像与标注,以支持未来在图像融合、配准和域自适应方面的研究。

实验结果

研究问题

  • RQ1当前图像融合方法在低光照可见光-红外图像对上的效果如何?其在保留细节和目标信息方面存在哪些局限?
  • RQ2当在对齐的红外标注上进行训练时,现有行人检测模型在低光照可见光图像上的表现程度如何?
  • RQ3为何像pix2pixGAN这样的图像到图像翻译模型在低光照数据上表现不佳?其性能相较于标准数据集如何退化?
  • RQ4能否有效利用对齐的红外图像,在人类标注不可行的极低光照可见光图像中实现行人标注?
  • RQ5最先进模型在低光照条件下,其在可见光、红外和融合图像表示上的性能表现有何差异?

主要发现

  • 图像融合算法在低光照可见光图像中难以保留精细细节,表明在极端光照条件下,现有融合方法存在显著差距。
  • 在低光照可见光图像上,YOLOv5的平均精度(AP)仅为52.7%,而红外图像的AP达到67.0%,凸显了对更优低光照检测模型的迫切需求。
  • 在LLVIP数据集上使用pix2pixGAN进行图像到图像翻译,PSNR仅为10.77,SSIM为0.176,远低于在KAIST数据集上的表现(PSNR 28.99,SSIM 0.69),表明其在低光照场景中泛化能力极差。
  • 漏检率-每幅图像误报数(FPPI)曲线显示,YOLOv5和YOLOv3在可见光图像上的漏检率较高,尤其在低FPPI时,表明其在黑暗环境中的检测可靠性较差。
  • 该数据集表明,当前在融合、检测和翻译三项任务中,所有算法在极低光照条件下的表现均未达到最优,凸显了开发新方法的必要性。
  • 反向映射标注方法通过利用红外图像的一致性,成功实现了在极低光照可见光图像上的精确行人标注,从而支持了可靠的评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。