[論文レビュー] FEANet: Feature-Enhanced Attention Network for RGB-Thermal Real-time Semantic Segmentation
FEANetは、チャネルおよび空間的依存関係をモデル化することで、RGBおよび熱画像ストリームからのマルチレベル特徴を強化する新規な特徴強化注意モジュール(FEAM)を用いた二段階型の特徴強化注意ネットワークを提案する。都市部データセットにおいて、SOTAと比較して+2.6% mAccおよび+0.8% mIoUを達成しながら、1台のRTX 2080 Tiで35 FPSのリアルタイム推論を維持する。
The RGB-Thermal (RGB-T) information for semantic segmentation has been extensively explored in recent years. However, most existing RGB-T semantic segmentation usually compromises spatial resolution to achieve real-time inference speed, which leads to poor performance. To better extract detail spatial information, we propose a two-stage Feature-Enhanced Attention Network (FEANet) for the RGB-T semantic segmentation task. Specifically, we introduce a Feature-Enhanced Attention Module (FEAM) to excavate and enhance multi-level features from both the channel and spatial views. Benefited from the proposed FEAM module, our FEANet can preserve the spatial information and shift more attention to high-resolution features from the fused RGB-T images. Extensive experiments on the urban scene dataset demonstrate that our FEANet outperforms other state-of-the-art (SOTA) RGB-T methods in terms of objective metrics and subjective visual comparison (+2.6% in global mAcc and +0.8% in global mIoU). For the 480 x 640 RGB-T test images, our FEANet can run with a real-time speed on an NVIDIA GeForce RTX 2080 Ti card.
研究の動機と目的
- 低照度または複雑な背景下でのRGB-Tセマンティックセグメンテーションの性能が低いという課題に対処すること。
- モodal特徴の特徴をモデル化することで、低品質な熱画像からの特徴抽出を改善すること。
- 都市部のシーンにおける境界検出および小規模オブジェクト(例:カラーコーン)のセグメンテーションを向上させること。
- 空間分解能を損なわず、リアルタイムの推論速度を維持すること。
提案手法
- 二段階型ネットワークを導入:段階1では、RGBおよび熱画像ストリームの両方でマルチレベル特徴を精緻化するためにFEAMモジュールを適用する。
- FEAMモジュールを設計し、チャネル間および空間的注意をモデル化することで、識別性の高い低レベル特徴を強化し、背景ノイズを低減する。
- 段階的な精緻化を適用して複数レベルにわたる特徴を抽出・強化し、高分解能の詳細を保持する。
- FEAMによる強化後に要素ごとの和集合でRGBおよび熱画像特徴を統合し、モダリティ間の適合性を向上させる。
- RGBおよび熱画像ブランチに独立してFEAMを適用する二重ストリームエンコーダーを採用し、モダリティ固有の表現を保持する。
- スキップ接続を備えたデコーダーを採用し、高分解能のセグメンテーションマップを再構築するとともに、リアルタイム速度を維持する。

実験結果
リサーチクエスチョン
- RQ1空間分解能を低下させずに、専用の注意モジュールがRGB-Tセマンティックセグメンテーションにおける特徴表現を改善できるか?
- RQ2特に低品質な熱画像に対して、モダリティ固有の特徴強化が小規模オブジェクト検出に与える影響は何か?
- RQ3注意メカニズムは、厳しい照明条件下で境界の正確性をどの程度向上させられるか?
- RQ4軽量で注意に基づくモジュールは、SOTA手法を上回る性能を維持しながらリアルタイム推論速度を確保できるか?
主な発見
- FEANetはテストセットで73.2% mAccおよび55.3% mIoUを達成し、SOTA手法と比較して+2.6% mAccおよび+0.8% mIoUを上回った。
- ガーディレールクラスでは、FuseSeg-161と比較して+7.1%の精度および+0.2%のIoU向上を示し、小規模オブジェクトセグメンテーションの優れた性能を示した。
- カラーコーンクラスでは、+5.4%の精度および+8.4%のIoU向上を達成し、極小オブジェクトにおける優れた境界検出性能を示した。
- FEANetはRTX 2080 Tiで35.06 FPS(1枚あたり28.52 ms)で実行され、リアルタイム推論の可能性を裏付けた。
- アブレーションスタディの結果、特に熱画像ストリームにおけるFEAMの適用が性能向上に顕著に寄与した。
- FEAMモジュールは全レベルで特徴品質を向上させ、特に低レベル特徴の精緻化と境界の鋭さ向上で顕著な向上が見られた。
![Figure 2: The overall architecture of the proposed FEANet. From left to right are Thermal Stream, RGB Stream, and Output Stream. The encoder in Thermal Stream and RGB Stream contains two extracting stages. In stage 1, Thermal Stream and RGB Stream use ResNet [ 24 ] as the feature extractor layer. Th](https://ar5iv.labs.arxiv.org/html/2110.08988/assets/fig/fig2.jpg)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。