Skip to main content
QUICK REVIEW

[論文レビュー] Thermal Infrared Image Colorization for Nighttime Driving Scenes with Top-Down Guided Attention

Fuya Luo, Yunhan Li|arXiv (Cornell University)|Apr 29, 2021
Image Enhancement Techniques被引用数 5
ひとこと要約

本稿では、夜間走行シーンにおける赤外線画像の色付けに、上位からの注意(top-down guided attention)を用いて意味的曖昧さを低減するとともに、構造的勾配整合損失を導入してエッジの一貫性を維持する、GANベースのPearlGANを提案する。本手法は、アノテート済みのFLIRおよびKAISTデータセットを用いて検証され、新しいエッジ一貫性指標を用いて、既存の教師なし画像変換モデルに比べて意味的および幾何的忠実度が向上している。

ABSTRACT

Benefitting from insensitivity to light and high penetration of foggy environments, infrared cameras are widely used for sensing in nighttime traffic scenes. However, the low contrast and lack of chromaticity of thermal infrared (TIR) images hinder the human interpretation and portability of high-level computer vision algorithms. Colorization to translate a nighttime TIR image into a daytime color (NTIR2DC) image may be a promising way to facilitate nighttime scene perception. Despite recent impressive advances in image translation, semantic encoding entanglement and geometric distortion in the NTIR2DC task remain under-addressed. Hence, we propose a toP-down attEntion And gRadient aLignment based GAN, referred to as PearlGAN. A top-down guided attention module and an elaborate attentional loss are first designed to reduce the semantic encoding ambiguity during translation. Then, a structured gradient alignment loss is introduced to encourage edge consistency between the translated and input images. In addition, pixel-level annotation is carried out on a subset of FLIR and KAIST datasets to evaluate the semantic preservation performance of multiple translation methods. Furthermore, a new metric is devised to evaluate the geometric consistency in the translation process. Extensive experiments demonstrate the superiority of the proposed PearlGAN over other image translation methods for the NTIR2DC task. The source code and labeled segmentation masks will be available at \url{https://github.com/FuyaLuo/PearlGAN/}.

研究の動機と目的

  • 夜間走行における人間の解釈および下流のビジョンタスクを妨げる赤外線(TIR)画像の彩度不足および低コントラストの問題に対処する。
  • 上位からの注意機構を用いて階層的文脈情報を活用することで、TIR画像変換における意味的符号化の曖昧さを低減する。
  • 入力TIR画像と生成されたカラー画像の間の幾何的一貫性を向上させ、物体の境界やエッジにおける歪みを最小限に抑える。
  • FIDスコアの限界を補うために、一対でない画像間変換における幾何的一貫性を評価する新しい指標を提供する。
  • FLIRおよびKAISTデータセットのサブセットに対してピクセルレベルのアノテート済みマスクを公開することで、今後の研究を促進する。

提案手法

  • マルチスケールの平均プーリングを用いて空間的文脈を抽出し、高レベルから低レベルの特徴にかけて特徴の注目を誘導するトップダウンガイドドアテンション(TDGA)モジュールを導入する。
  • 入力TIR画像における正例マップと一致するように、アテンションマップを正例オブジェクト位置に一致させるために、注目的な損失を明示的に用いる。
  • Cannyエッジマップを一致させることで、入力TIR画像と生成カラー画像の間でエッジの一貫性を促進する、構造的勾配整合損失を提案する。
  • 教師なし画像間変換のバックボーンとしてToDayGANフレームワークを採用し、TDGAおよび勾配整合を統合して性能を向上させる。
  • TDGAモジュールがスケールを介して、空(上部)から道路およびオブジェクト(中央/下部)に段階的に注目を向けるように、段階的な訓練戦略を採用する。
  • 意味的保存評価のため、ピクセル単位のセマンティックラベルを備えた新たにアノテートされたFLIRおよびKAISTデータセットのサブセットを用いてモデルを検証する。

実験結果

リサーチクエスチョン

  • RQ1上位からのガイドドアテンションは、赤外線画像の色付けにおける意味的符号化の曖昧さを効果的に低減できるか?
  • RQ2勾配整合は、夜間走行シーンの非一対応画像間変換において、幾何的一貫性をどの程度向上させるか?
  • RQ3提案手法は、TIRからカラーへの変換において、コンテンツと構造の両方をSOTA GANと比較してどれほど良好に保持できるか?
  • RQ4エッジ一貫性に基づく新しい評価指標は、FIDスコアに比べてNTIR2DCタスクにおける翻訳品質をよりよく反映できるか?
  • RQ5注目と勾配整合の組み合わせにより、既存の教師なし手法と比較して、より現実的で意味的に忠実な色付けが達成できるか?

主な発見

  • PearlGANは、FLIRおよびKAISTの両データセットにおいて、CycleGAN、MUNIT、ToDayGANおよびその他のGANベース手法と比較して、意味的保存性およびエッジ一貫性において優れた性能を達成した。
  • 提案された注目損失により、入力TIR画像のオブジェクト領域と一致するようにアテンションマップの一致が向上し、局所的な意味的曖昧さが効果的に低減された。
  • 構造的勾配整合損失によりエッジ一貫性が著しく向上し、視覚的比較およびエッジマップ解析から、物体境界における幾何的歪みが低減された。
  • FIDスコアはやや低い(FLIRで62.7、KAISTで102.2)ものの、PearlGANはMUNITおよびToDayGANを上回り、コンテンツおよび幾何的忠実度が優れていることから、FIDが構造的正確性を十分に捉えていないことが示された。
  • 失敗事例から、バスなどのレアオブジェクトカテゴリの翻訳に課題があることが判明し、これはすべての手法に共通する問題である。
  • FLIRおよびKAISTデータセットのピクセルレベルのアノテート済みマスクの公開により、今後のTIR画像のセマンティックセグメンテーションおよび色付け研究における貴重なベンチマークが提供された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。