Skip to main content
QUICK REVIEW

[논문 리뷰] Model-based Cleaning of the QUILT-1M Pathology Dataset for Text-Conditional Image Synthesis

Marc Aubreville, Jonathan Ganz|arXiv (Cornell University)|2024. 04. 11.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

이 논문은 QUILT-1M 조직병리학 데이터셋의 텍스트 조건부 이미지 생성을 위해 모델 기반 파이프라인을 제안한다. 이는 ResNet50-D 기반 다중 레이블 분류기와 CLIP 점수를 통한 의미적 정렬 필터링을 사용하여 시각적 불순물(예: 내레이터, 소프트웨어 오버레이, 텍스트 애너테이션 등)을 탐지하고 제거함으로써 이미지의 정밀도를 향상시킨다. 이 방법은 후행 디퓨전 모델에서 아티팩트를 감소시키고 FID 점수를 낮추며 이미지 품질을 크게 향상시킨다.

ABSTRACT

The QUILT-1M dataset is the first openly available dataset containing images harvested from various online sources. While it provides a huge data variety, the image quality and composition is highly heterogeneous, impacting its utility for text-conditional image synthesis. We propose an automatic pipeline that provides predictions of the most common impurities within the images, e.g., visibility of narrators, desktop environment and pathology software, or text within the image. Additionally, we propose to use semantic alignment filtering of the image-text pairs. Our findings demonstrate that by rigorously filtering the dataset, there is a substantial enhancement of image fidelity in text-to-image tasks.

연구 동기 및 목표

  • QUILT-1M 데이터셋의 낮은 이미지 품질과 시각적 불순물로 인해 텍스트 조건부 이미지 생성에 활용도가 떨어지는 문제를 해결하기 위해.
  • 공개된 온라인 레포지토리에서 확보한 조직병리학 이미지에 공통적으로 존재하는 이미지 불순물들을 자동으로 탐지하고 스케일링 가능한 방법을 개발하기 위해.
  • CLIP 기반 점수를 활용하여 대규모 데이터셋 내 이미지-텍스트 쌍 간의 의미적 정렬을 향상시키기 위해.
  • FID 및 정성적 분석을 통해 데이터셋 정제가 후행 텍스트-이미지 생성 품질에 미치는 영향을 평가하기 위해.
  • 저품질 및 비순수한 이미지 콘텐츠를 제거함으로써 고정밀도의 병리학 전용 이미지 생성을 가능하게 하기 위해.

제안 방법

  • QUILT-1M에서 6,532장의 이미지를 대상으로 1% 수준의 수동 애너테이션을 기반으로 ResNet50-D 기반 다중 레이블 분류기를 훈련하여 9종류의 시각적 불순물(내레이터, 데스크톱 요소, 텍스트 오버레이 등)을 탐지하였다.
  • 검증 손실 기반 조기 정지 및 모델 선택을 통해 불순물 탐지 모델의 최적화를 수행하였다.
  • CONCH 모델을 통해 CLIP 점수를 계산하고 의미적 정렬 기반 필터링을 적용하여 상위 50%의 점수를 가진 이미지-텍스트 쌍만 유지하였다.
  • 두 가지 필터링 단계를 통합: 먼저 불순물 탐지, 그 다음 의미적 정렬 필터링을 수행하여 정제된 데이터셋 서브셋을 생성하였다.
  • 정제된 데이터셋을 기반으로 15,000 반복 동안 잠재 공간 디퓨전 모델(Stable Diffusion 2.1)을 미세조정하여 텍스트-이미지 생성 품질을 평가하였다.
  • 10,000개의 생성된 이미지 컷에 대해 조건부 프레셰 이너셉션 디스턴스(FID)를 사용하여 생성 품질을 평가하였으며, 기준 및 벤치마크 데이터셋(MIDOG++ 및 PLISM)과 비교하였다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델은 QUILT-1M와 같이 공개적으로 크롤링된 소스에서 유래한 조직병리학 이미지의 일반적인 시각적 불순물을 얼마나 잘 탐지할 수 있는가?
  • RQ2CLIP 점수 기반 의미적 정렬 필터링은 대규모 데이터셋 내 이미지-텍스트 쌍의 품질에 어떻게 기여하는가?
  • RQ3불순물 제거와 정렬 향상이 조직병리학 분야의 텍스트-이미지 생성 정밀도에 미치는 영향은 무엇인가?
  • RQ4정제된 데이터셋은 디퓨전 기반 이미지 생성 모델에서 아티팩트 감소와 FID 점수 향상에 실질적인 기여를 할 수 있는가?

주요 결과

  • 다중 레이블 불순물 분류기는 테스트 세트에서 92.71%의 정확도를 기록하였으며, 불순물 탐지에 있어 높은 재현율(97.17%)과 AUC(0.9481)을 확보하였다.
  • QUILT-1M 데이터셋의 78% 이상의 이미지에 최소 한 가지 이상의 시각적 불순물이 존재했으며, 그 중 데스크톱/소프트웨어 요소(35.96%)와 추가 버튼/제어 요소(31.89%)가 가장 흔하게 발견되었다.
  • 정제되지 않은 QUILT-1M 데이터셋을 기반으로 훈련된 모델은 생성된 이미지에서 눈에 띄는 아티팩트를 유발했으며, 정성적 샘플을 통해 확인되었다.
  • 정제된 데이터셋을 사용함으로써 이미지 품질이 크게 향상되었으며, 기준 데이터셋 대비 FID 점수는 32% 감소하였다.
  • CONCH의 CLIP 점수를 통한 의미적 정렬 필터링은 정렬이 잘 되지 않은 이미지-텍스트 쌍을 효과적으로 제거하여 학습 데이터 품질을 향상시켰다.
  • 불순물 탐지와 의미적 정렬 필터링의 조합은 조직병리학 분야의 고정밀도 텍스트-이미지 모델 학습을 위한 더 깔끔하고 신뢰할 수 있는 데이터셋을 제공하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.