[논문 리뷰] Semantic Segmentation for Thermal Images: A Comparative Survey
이 종합 검토는 열화상 영상에 기반한 딥러닝 기반 의미 분할 방법에 대한 종합적인 분석을 제공하며, 입력 모odal리티(열화상 단독 대비 RGB-T 융합)에 따라 방법을 분류한다. 주요 데이터셋을 기반으로 최신 기술 모델의 성능을 mIoU와 같은 지표로 평가한 결과, 가장자리 유도 및 주의 기반 아키텍처가 전용 벤치마크에서 최대 0.939 mIoU를 기록하여 저조도 조건에서 열화상 단독 분할의 잠재력을 입증한다.
Semantic segmentation is a challenging task since it requires excessively more low-level spatial information of the image compared to other computer vision problems. The accuracy of pixel-level classification can be affected by many factors, such as imaging limitations and the ambiguity of object boundaries in an image. Conventional methods exploit three-channel RGB images captured in the visible spectrum with deep neural networks (DNN). Thermal images can significantly contribute during the segmentation since thermal imaging cameras are capable of capturing details despite the weather and illumination conditions. Using infrared spectrum in semantic segmentation has many real-world use cases, such as autonomous driving, medical imaging, agriculture, defense industry, etc. Due to this wide range of use cases, designing accurate semantic segmentation algorithms with the help of infrared spectrum is an important challenge. One approach is to use both visible and infrared spectrum images as inputs. These methods can accomplish higher accuracy due to enriched input information, with the cost of extra effort for the alignment and processing of multiple inputs. Another approach is to use only thermal images, enabling less hardware cost for smaller use cases. Even though there are multiple surveys on semantic segmentation methods, the literature lacks a comprehensive survey centered explicitly around semantic segmentation using infrared spectrum. This work aims to fill this gap by presenting algorithms in the literature and categorizing them by their input images.
연구 동기 및 목표
- 열화상 적외선 영상에 기반한 의미 분할에 집중된 종합적인 검토가 부족한 점을 보완하기 위해.
- 딥러닝 기반 의미 분할 방법을 열화상 영상을 입력으로 사용하여 체계적으로 분류하고 비교하기 위해.
- 여러 벤치마크 데이터셋을 기반으로 평균 교차율(Intersection over Union, mIoU)과 같은 표준화된 지표를 사용해 이러한 방법의 성능을 평가하기 위해.
- 열화상 영상 분할에 고유한 과제, 즉 열화상 교차, 낮은 해상도, 제한된 애너테이션 데이터셋 등을 분석하기 위해.
- 합성 데이터 생성 및 다중 모odal 입력을 위한 향상된 융합 전략과 같은 연구 격차와 향후 방향성을 규명하기 위해.
제안 방법
- 기존 방법을 주로 두 그룹으로 분류: 열화상 영상만 사용하는 방법과 RGB 및 열화상(_RGB-T_)을 융합하는 방법.
- 에코더-디코더 아키텍처, U-Net 변종, 아트로스 컨볼루션 또는 공간 피라미드 풀링을 사용하는 모델을 포함한 딥 네트워크 아키텍처를 검토하고 분류.
- 경계 검출을 향상시키고 노이즈 민감도를 감소시키기 위해 경계 기반 손실 함수와 상관 행렬을 도입.
- 스킵 연결과 다중 경로 설계(예: BiseNetV2)를 활용하여 공간적 세부 정보를 유지하고 특징 융합을 향상.
- 라벨 기울기에서 유도된 에지 맵을 사용해 분할을 안내함으로써 모호한 경계에서의 정확도를 향상.
- 저조도 조건에서의 성능 향상을 위해 가중치가 부여된 시그모이드 교차 엔트로피 손실을 적용하여 보행자 및 차량 분할에 특화.
![Figure 2 : Some prediction results of MFNet [ 10 ] and Segnet [ 1 ] on the MFNet dataset [ 10 ]](https://ar5iv.labs.arxiv.org/html/2205.13278/assets/images/mfnet_result.png)
실험 결과
연구 질문
- RQ1최신 기술의 의미 분할 모델에서 사용되는 주요 아키텍처 설계와 손실 함수는 무엇인가요?
- RQ2mIoU와 추론 속도 측면에서 열화상 단독 분할 모델과 RGB-T 융합 모델 간의 성능 비교는 어떻게 되나요?
- RQ3열화상 영상 의미 분할의 주요 과제는 무엇이며, 현재 방법들은 이를 어떻게 해결하고 있나요?
- RQ4열화상 영상 분할 평가에 가장 흔히 사용되는 데이터셋은 무엇이며, 이러한 벤치마크 간 모델 성능은 어떻게 다릅니까?
- RQ5열화상 교차와 저해상도 아티팩트가 존재하는 환경에서 분할 정확도를 향상시키는 데 가장 효과적인 기법은 무엇인가요?
주요 결과
- [17]에서 제안한 방법은 SODA 데이터셋에서 0.619 mIoU를 기록하여 [5]의 0.571 mIoU를 능가했다.
- SCUT-Seg 야간 주행 데이터셋에서 [35]는 32.52 FPS에서 0.676 mIoU를 기록했고, [23]는 동일한 벤치마크에서 0.667 mIoU를 보고했다.
- MFnet 데이터셋에서 [35]는 열화상 영상만을 사용해 0.519 mIoU를 기록했으며, 이는 RGB-T 융합을 사용한 [6](0.504 mIoU) 및 RTFNet-50(0.503 mIoU)와 유사한 성능이었다.
- [31]의 모델은 자체 데이터셋에서 0.939 mIoU를 기록하여 [5], [21], [15]를 능가했으며, 강도 비균일성과 노이즈에 대한 강건성을 입증했다.
- LII 데이터셋에서 [7]은 0.912 mIoU를 기록하여 [4]의 0.469 mIoU를 크게 앞서며 특히 저조도 조건에서 뛰어난 성능을 보였다.
- NPU_CS_UAV_IR_DATA 데이터셋에서 [20]는 [11], [5], [1]과 유사한 평균 정밀도를 기록했으며, 약간 더 빠른 추론 속도를 확보했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.