Skip to main content
QUICK REVIEW

[논문 리뷰] Encoding Structure-Texture Relation with P-Net for Anomaly Detection in Retinal Images

Kang Zhou, Yuting Xiao|arXiv (Cornell University)|2020. 08. 09.
Retinal Imaging and Analysis참고 문헌 42인용 수 21
한 줄 요약

이 논문은 건강한 망막 영상에서의 구조-문자성 관계를 활용하여 망막 영상 이상 탐지용 새로운 딥러닝 프레임워크인 P-Net을 제안한다. 먼저 혈관의 정규성 등 구조적 특징(예: 혈관의 정열 구조)을 추출하고, 이를 깊이 있는 무늬 특징과 융합한 후 원본 영상을 재구성한다. P-Net는 원본 영상과 재구성 영상 간의 차이를 핵심 이상 지표로 사용하여, RESC 및 iSee 데이터셋에서 각각 평균 AUC 0.965와 0.958를 기록하며 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Anomaly detection in retinal image refers to the identification of abnormality caused by various retinal diseases/lesions, by only leveraging normal images in training phase. Normal images from healthy subjects often have regular structures (e.g., the structured blood vessels in the fundus image, or structured anatomy in optical coherence tomography image). On the contrary, the diseases and lesions often destroy these structures. Motivated by this, we propose to leverage the relation between the image texture and structure to design a deep neural network for anomaly detection. Specifically, we first extract the structure of the retinal images, then we combine both the structure features and the last layer features extracted from original health image to reconstruct the original input healthy image. The image feature provides the texture information and guarantees the uniqueness of the image recovered from the structure. In the end, we further utilize the reconstructed image to extract the structure and measure the difference between structure extracted from original and the reconstructed image. On the one hand, minimizing the reconstruction difference behaves like a regularizer to guarantee that the image is corrected reconstructed. On the other hand, such structure difference can also be used as a metric for normality measurement. The whole network is termed as P-Net because it has a ``P'' shape. Extensive experiments on RESC dataset and iSee dataset validate the effectiveness of our approach for anomaly detection in retinal images. Further, our method also generalizes well to novel class discovery in retinal images and anomaly detection in real-world images.

연구 동기 및 목표

  • 정상 데이터만을 사용하여 망막 영상의 이상 탐지를 해결하는 것. 정상 데이터는 질병 데이터보다 더 쉽게 확보 가능하다.
  • 임상적 통찰을 활용하여 망막 질환은 규칙적인 해부학적 구조(예: 혈관, 층구조)를 파괴하지만, 정상 영상에서는 강한 구조적 규칙성이 있음을 활용하는 것.
  • 이미지 무늬와 구조 레이아웃 간의 상호작용을 명시적으로 모델링하여 이상 탐지 성능을 향상시키고, 이를 독립적으로 다루는 것보다 더 나은 성능을 내는 것.
  • 신규 클래스 탐지 및 실세계 이미지 이상 탐지에까지 일반화 가능한 방법을 개발하는 것.

제안 방법

  • 정상 맹막 영상 I로부터 구조적 표현 S를 추출하기 위해 구조 추출 네트워크 G_s를 훈련한다. 이때 경계 기반 또는 구조 인식 특징을 사용한다.
  • 추출된 구조 S와 원본 영상 I의 고수준 특징 표현을 융합하여, 생성형 디코더를 통해 입력 영상 Î를 재구성한다.
  • 재구성 과정은 원본 영상과 재구성 영상 간의 일관성을 강제로 유지하여 픽셀 수준 및 특징 수준의 재구성 오차를 최소화한다.
  • 재구성 영상 Î로부터 두 번째 구조 추출을 수행하여 Ŝ를 도출하고, S와 Ŝ 간의 구조적 차이를 핵심 이상 지표로 계산한다.
  • 최종 이상 점수는 이미지 재구성 오차와 구조 일관성 오차를 조합하여 이중 정규화 메커니즘을 형성함으로써 탐지 정밀도를 향상시킨다.
  • 전체 아키텍처는 'P' 모양을 띠며, 이에 따라 P-Net라는 이름을 붙였다. 구조 분지가 수직 줄기 역할을 하고, 재구성 경로가 수평 바를 형성한다.

실험 결과

연구 질문

  • RQ1이미지 무늬와 구조 간의 관계를 모델링하면 망막 영상의 이상 탐지 성능이 향상되는가?
  • RQ2혈관 정열 구조 등의 구조적 사전 지식을 통합하면 재구성 정확도와 이상 탐지의 강인성이 향상되는가?
  • RQ3재구성 오차와 함께 사용될 경우, 원본 영상과 재구성 영상 간의 구조 일관성 오차가 신뢰할 수 있는 이상 지표가 될 수 있는가?
  • RQ4P-Net는 이상 유형이 이전에 본 적이 없는 질병 유형인 새로운 클래스 탐지에 일반화되는가?
  • RQ5기존 최신 기술 대비 P-Net는 제로샷 이상 탐지에서 실세계 이미지 데이터셋에서 어떻게 성능을 내는가?

주요 결과

  • P-Net는 평균 AUC 0.965를 기록하며 RESC 데이터셋에서 최신 기술 수준의 성능을 달성했으며, AE (SSIM), AnoGAN, TI 등의 기준 모델을 크게 앞서 간다.
  • iSee 데이터셋에서는 평균 AUC 0.958을 기록하여 다양한 맹막 질환 유형과 영상 모odalities에 걸쳐 강력한 일반화 성능을 보였다.
  • 구조적 윤곽이 의미 있는 형태를 형성하는 물체 유형의 영상(예: 캡슐, 나사, 지퍼)에서는 뛰어난 성능을 보였으며, 평균 이상 영역 겹침률이 0.89에 이르렀다.
  • 높은 경계 밀도와 노이즈로 인해 구조 추출이 어려운 무늬 유형의 영상(예: 카펫, 격자, 가죽)에서는 성능 저하가 발생했다.
  • 제거 실험 결과, 재구성 오차와 구조 일관성 오차를 모두 사용할 경우 각각을 별도로 사용하는 것보다 더 나은 이상 탐지 성능을 얻을 수 있음을 확인했다.
  • 보조 실험을 통해 P-Net는 새로운 클래스 탐지에 잘 일반화됨을 검증했으며, 이는 이전에 본 적이 없는 이상 패tern에도 강인함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.