Skip to main content
QUICK REVIEW

[論文レビュー] LLVIP: A Visible-infrared Paired Dataset for Low-light Vision

Xinyu Jia, Chuang Zhu|arXiv (Cornell University)|Aug 24, 2021
Advanced Image Fusion TechniquesEngineering参考文献 20被引用数 21
ひとこと要約

本稿では、低照度視覚タスクに特化した、時間的・空間的に整合された可視赤外線ペアデータセットであるLLVIPを紹介する。このデータセットは、極端な低照度条件下における画像統合、歩行者検出、画像対画像変換の分野における先進的研究を可能にし、実験により、3つのタスクすべてにおいて既存のアルゴリズムに顕著な性能差が生じていることが明らかになった。これは、今後の開発におけるデータセットの挑戦性と有用性を示している。

ABSTRACT

It is very challenging for various visual tasks such as image fusion, pedestrian detection and image-to-image translation in low light conditions due to the loss of effective target areas. In this case, infrared and visible images can be used together to provide both rich detail information and effective target areas. In this paper, we present LLVIP, a visible-infrared paired dataset for low-light vision. This dataset contains 30976 images, or 15488 pairs, most of which were taken at very dark scenes, and all of the images are strictly aligned in time and space. Pedestrians in the dataset are labeled. We compare the dataset with other visible-infrared datasets and evaluate the performance of some popular visual algorithms including image fusion, pedestrian detection and image-to-image translation on the dataset. The experimental results demonstrate the complementary effect of fusion on image information, and find the deficiency of existing algorithms of the three visual tasks in very low-light conditions. We believe the LLVIP dataset will contribute to the community of computer vision by promoting image fusion, pedestrian detection and image-to-image translation in very low-light applications. The dataset is being released in https://bupt-ai-cz.github.io/LLVIP. Raw data is also provided for further research such as image registration.

研究の動機と目的

  • 画像統合、歩行者検出、画像対画像変換などの低照度視覚タスクに特化した大規模かつ整合済みの可視赤外線データセットの不足に対処すること。
  • 対応する赤外線画像を活用して逆マッピングを行うことで、極めて低照度の可視画像における歩行者アノテーションを信頼性高く行う手法の開発。
  • 挑戦的な低照度条件を有するデータセット上で、最先端のアルゴリズムの画像統合、歩行者検出、画像対画像変換における性能を評価すること。
  • 現在のモデルの限界を露呈するベンチマークデータセットを提供し、低照度コンピュータビジョン分野の研究を促進すること。

提案手法

  • 可視および赤外線センサが同期されたバイノキュラー・カメラシステムを用いて、合計30,976枚の画像(15,488組の整合済み可視赤外線ペア)を収集。
  • すべてのペアにおいて、可視画像と赤外線画像の間で厳密な空間的・時間的登録を実施し、正確な整合性を確保。
  • 対応する赤外線画像を活用して、低照度可視画像における歩行者を正確にアノテートできる「逆マッピングラベル付け法」を提案。
  • YOLOv3およびYOLOv5を用いた歩行者検出、およびpix2pixGANを用いた画像対画像変換の分野で、複数のディーブラーニングモデルを訓練・評価。
  • AP、AP50、AP75、SSIM、PSNRなどの指標を用いて、すべてのタスクにおいて包括的な定量的・定性的な評価を実施。
  • 将来の画像統合、登録、ドメイン適応分野の研究を支援するため、RAW画像およびアノテーションを含む完全なデータセットを公開。

実験結果

リサーチクエスチョン

  • RQ1現在の画像統合手法は、低照度可視赤外線画像ペアに対してどれほど有効であり、細部やターゲット情報の保持にどのような限界を示しているか?
  • RQ2対応する赤外線アノテーションで学習された既存の歩行者検出モデルは、低照度可視画像上でどの程度の性能を示すか?
  • RQ3pix2pixGANのような画像対画像変換モデルは、低照度データに対してなぜ失敗するのか?標準データセットと比較して性能はどのように低下するか?
  • RQ4極めて低照度の可視画像において、人間によるアノテーションが不可能な状況でも、対応する赤外線画像を効果的に活用して歩行者を正確にラベル付けできるか?
  • RQ5最先端モデルの性能は、低照度条件下における可視画像、赤外線画像、統合画像の各表現でどのように変動するか?

主な発見

  • 画像統合アルゴリズムは、低照度可視画像における細部の保持に困難を示しており、極端な照度条件下での現在の統合手法に顕著なギャップが存在することが示された。
  • YOLOv5を用いた低照度可視画像上の歩行者検出では平均適合率(AP)が52.7%にとどまり、赤外線画像では67.0%のAPを示した。これは、低照度向けのより優れた検出モデルの開発が不可欠であることを示している。
  • LLVIP上でpix2pixGANを用いた画像対画像変換を実行した結果、PSNRはわずか10.77、SSIMは0.176にとどまり、KAISTデータセット(PSNR 28.99、SSIM 0.69)と比較して著しく性能が劣っている。これは、低照度シナリオへの一般化能力が著しく低いことを示している。
  • ミス率-FPPI曲線から、YOLOv5およびYOLOv3は特に低い1枚あたりの誤検出数(FPPI)において高いミス率を示しており、暗闇における検出の信頼性が低いことが明らかになった。
  • このデータセットは、統合、検出、変換の3つのタスクすべてにおいて、現在のアルゴリズムが非常に低照度条件下で最適でない性能を示していることを明らかにした。これは、新たな手法の開発の必要性を強調している。
  • 逆マッピングラベル付け法は、赤外線画像の一貫性を活用することで、低照度可視画像における歩行者アノテーションを正確に可能にし、信頼性のある評価を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。