Skip to main content
QUICK REVIEW

[논문 리뷰] UnCRtainTS: Uncertainty Quantification for Cloud Removal in Optical Satellite Time Series

Patrick Ebel, Vivien Sainte Fare Garnot|arXiv (Cornell University)|2023. 04. 11.
Advanced Image Fusion Techniques인용 수 5
한 줄 요약

UnCRtainTS는 다중 시간적 옵티컬 위성 기상 구름 제거를 위한 새로운 주의 기반 딥러닝 아키텍처를 제안하며, 통합된 多변량 불확실성 정량화를 내재하고 있다. 픽셀 단위의 앨레토릭 불확실성 예측과 함께 이미지 복원을 수행함으로써, SEN12MS-CR-TS에서 최신 기술 수준의 성능을 달성하고, 잘 校정된 불확실성 추정을 통해 신뢰할 수 있는 품질 제어를 가능하게 한다.

ABSTRACT

Clouds and haze often occlude optical satellite images, hindering continuous, dense monitoring of the Earth's surface. Although modern deep learning methods can implicitly learn to ignore such occlusions, explicit cloud removal as pre-processing enables manual interpretation and allows training models when only few annotations are available. Cloud removal is challenging due to the wide range of occlusion scenarios -- from scenes partially visible through haze, to completely opaque cloud coverage. Furthermore, integrating reconstructed images in downstream applications would greatly benefit from trustworthy quality assessment. In this paper, we introduce UnCRtainTS, a method for multi-temporal cloud removal combining a novel attention-based architecture, and a formulation for multivariate uncertainty prediction. These two components combined set a new state-of-the-art performance in terms of image reconstruction on two public cloud removal datasets. Additionally, we show how the well-calibrated predicted uncertainties enable a precise control of the reconstruction quality.

연구 동기 및 목표

  • 시간적으로 손상된 시퀀스에서 구름 없는 옵티컬 위성 이미지를 신뢰할 수 있는 품질 평가와 함께 복원하는 문제를 해결하기 위해.
  • 위성 이미지 복원에 다변량 불확실성 정량화를 통합하여, 신뢰도 인식 기반의 후속 응용을 가능하게 하기 위해.
  • 전고해상도 특징 맵과 주의 기반 시간 인코딩을 활용하여 복원 정밀도와 불확실성 校정을 향상시키기 위해.
  • 입력 시퀀스 길이와 보조 SAR 데이터가 복원 품질과 불확실성 신뢰성에 미치는 영향을 평가하기 위해.
  • 불확실성 예측이 저품질 복원 영역을 식별하고 실세계 이미지 동역학(예: 일시적 현상)을 반영할 수 있음을 입증하기 위해.

제안 방법

  • 전고해상도 특징 맵에서 작동하는 새로운 주의 기반 신경망 아키텍처를 제안하여, 공간적 세부 정보를 유지하기 위해 다운샘플링을 피한다.
  • 다변량 앨레토릭 불확실성을 모델링하기 위해 대각 행렬을 사용하며, 음의 로그우도 손실을 통해 훈련 중 픽셀 단위의 분산 예측이 가능하도록 한다.
  • 불확실성 예측을 심층 앙상블 방법과 결합하여 지식 기반 불확실성(에피스테믹 불확실성)을 추정하고, 전체 불확실성의 校정을 향상시킨다.
  • 옵티컬 및 SAR 데이터를 복합적으로 사용하여 복원의 강건성과 불확실성 감소를 향상시킨다.
  • 픽셀 단위의 NLL 손실을 통한 불확실성과 고주파 세부 사항 복구를 위한 지각적 손실을 조합한 하이브리드 손실을 사용하여 모델을 훈련시킨다.
  • 장기적 시간 의존성을 모델링하기 위해 시간 자기주의 주의(self-attention)를 적용하여, 파도나 변화하는 작물과 같은 일시적 특징을 더 잘 모델링할 수 있도록 한다.
Figure 1 : Overview: Our attention-based UnCRtainTS architecture predicts a single cloud-free image from a sequence of cloudy observations. For each reconstructed pixel, our method also estimates the aleatoric uncertainty of the prediction. Note how higher uncertainties (in red) are associated with
Figure 1 : Overview: Our attention-based UnCRtainTS architecture predicts a single cloud-free image from a sequence of cloudy observations. For each reconstructed pixel, our method also estimates the aleatoric uncertainty of the prediction. Note how higher uncertainties (in red) are associated with

실험 결과

연구 질문

  • RQ1다변량 불확실성 정량화는 다중 시간 설정에서 구름 제거된 위성 이미지의 신뢰성 향상에 기여하는가?
  • RQ2불확실성 추정이 포함될 경우 복원된 위성 이미지의 해석 가능성과 신뢰성은 어떻게 향상되는가?
  • RQ3더 긴 입력 시퀀스 길이가 이미지 복원 품질과 불확실성 校정에 모두 기여하는가?
  • RQ4보조 SAR 데이터가 불확실성 감소와 복원 성능 향상에 어느 정도 기여하는가?
  • RQ5불확실성 맵은 지속적인 가림, 구름 그림자, 파도가 부서지는 현상이나 성숙하는 작물과 같은 동적 특징을 효과적으로 식별할 수 있는가?

주요 결과

  • UnCRtainTS는 T=4 입력 시간 포인트를 사용하여 SEN12MS-CR-TS 벤치마크에서 최신 기술 수준의 성능을 달성했으며, 테스트 세트에서 PSNR 28.41과 SSIM 0.875를 기록했다.
  • 픽셀 수준의 불확실성 캘리브레이션 오차(UCE)는 0.001로 감소하였고, 이미지 수준의 UCE는 0.002로 나타나, 잘 校정된 불확실성 추정이 이루어졌음을 시사한다.
  • 더 긴 입력 시퀀스(T=4)는 T=2 또는 T=3보다 더 높은 복원 품질과 향상된 불확실성 校정을 제공한다.
  • SAR 데이터를 제외할 경우 이미지 수준과 픽셀 수준의 UCE가 모두 증가하여, SAR가 복원의 신뢰성 향상에 기여함을 입증한다.
  • 불확실성 맵은 구름 그림자, 지속적인 가림 영역, 파도와 변화하는 작물 색상과 같은 동적 특징을 효과적으로 강조한다.
  • 모델의 불확실성 예측은 실제 복원 오차와 강하게 상관관계를 보이며, 후속 응용 분야에서 신뢰할 수 있는 품질 제어를 가능하게 한다.
Figure 2 : UnCRtainTS. The network consists of three main parts, applied along a main branch of MBConv blocks [ 60 ] that is processing feature maps at full input resolution: First, an encoder is applied in parallel to the $T$ time points. Then, an attention-based temporal aggregator computes attent
Figure 2 : UnCRtainTS. The network consists of three main parts, applied along a main branch of MBConv blocks [ 60 ] that is processing feature maps at full input resolution: First, an encoder is applied in parallel to the $T$ time points. Then, an attention-based temporal aggregator computes attent

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.