Skip to main content
QUICK REVIEW

[論文レビュー] Model-based Cleaning of the QUILT-1M Pathology Dataset for Text-Conditional Image Synthesis

Marc Aubreville, Jonathan Ganz|arXiv (Cornell University)|Apr 11, 2024
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

本稿では、ResNet50-Dベースの多ラベル分類器とCLIPスコアを用いた意味的整合性フィルタリングにより、ナラティブ、ソフトウェアオーバーレイ、テキストアノテーションなどの視覚的不純物を検出し、除去することで、テキスト条件付き画像生成を目的としたQUILT-1Mヒストパスロジー画像データセットのクリーニングを目的としたモデル駆動のパイプラインを提案する。この手法は、画像生成の忠実度を著しく向上させ、下流の拡散モデルにおけるアーティファクトを低減し、FIDスコアを低下させる。

ABSTRACT

The QUILT-1M dataset is the first openly available dataset containing images harvested from various online sources. While it provides a huge data variety, the image quality and composition is highly heterogeneous, impacting its utility for text-conditional image synthesis. We propose an automatic pipeline that provides predictions of the most common impurities within the images, e.g., visibility of narrators, desktop environment and pathology software, or text within the image. Additionally, we propose to use semantic alignment filtering of the image-text pairs. Our findings demonstrate that by rigorously filtering the dataset, there is a substantial enhancement of image fidelity in text-to-image tasks.

研究の動機と目的

  • QUILT-1Mデータセットにおける画像品質の低さと視覚的不純物が、テキスト条件付き画像生成の応用に制限をもたらすという問題に対処すること。
  • 公開オンラインリポジトリから抽出されたヒストパスロジー画像に共通する画像不純物を自動かつスケーラブルに検出する手法を開発すること。
  • CLIPスコアを用いたスコアリングにより、大規模データセット内の画像-テキストペア間の意味的整合性を向上させること。
  • FIDスコアと定性的分析を用いて、データセットクリーニングの下流のテキスト-画像生成品質への影響を評価すること。
  • 低品質で不純な画像コンテンツを除外することで、高忠実度の病理学的特化型画像生成を可能にすること。

提案手法

  • QUILT-1Mから抽出した6,532枚の画像の1%を手動でアノテートしたデータセットを用いて、ナラティブ、デスクトップ要素、テキストオーバーレイなど9種類の視覚的不純物を検出するResNet50-Dベースの多ラベル分類器を学習した。
  • 検証損失に基づく早期停止とモデル選択を用いて、不純物検出モデルの最適化を実施した。
  • CONCHモデルを用いてCLIPスコアを計算し、意味的整合性フィルタリングを実施。上位50%のスコアを持つ画像-テキストペアのみを保持した。
  • 両方のフィルタリングステップを組み合わせた:まず不純物検出を行い、次に意味的整合性フィルタリングを実施することで、クリーニングされたデータセットサブセットを生成した。
  • フィルタリング済みデータセットを用いて、15,000イテレーションにわたり潜在拡散モデル(Stable Diffusion 2.1)を微調整し、テキスト-画像生成品質の評価を実施した。
  • 10,000枚の生成画像クロップを用いて、条件付きFréchet Inception Distance(FID)を用いて生成品質を評価し、ベースラインおよびベンチマークデータセット(MIDOG++およびPLISM)と比較した。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、QUILT-1Mのような公開スクリーピングソースからのヒストパスロジー画像において、一般的な視覚的不純物をどの程度検出できるか?
  • RQ2CLIPスコアを用いた意味的整合性に基づくフィルタリングは、大規模データセット内の画像-テキストペアの品質をどのように向上させるか?
  • RQ3不純物の除去と整合性の向上が、ヒストパスロジー分野におけるテキスト-画像生成の忠実度に与える影響は何か?
  • RQ4クリーニングされたデータセットは、拡散ベースの画像生成モデルにおけるアーティファクトの顕著な低減とFIDスコアの改善をもたらすか?

主な発見

  • 多ラベル不純物分類器はテストセットで92.71%の精度を達成し、不純物の検出にあたっては97.17%の再現率と0.9481のAUCを示した。
  • QUILT-1Mデータセットの78%以上が少なくとも1つの視覚的不純物を含んでおり、その中で最も一般的なのはデスクトップ/ソフトウェア要素(35.96%)と追加のボタン/制御要素(31.89%)であった。
  • フィルタリングを行わないQUILT-1Mデータセットを用いて学習したモデルは、定性的なサンプルでも顕著なアーティファクトを生成した。
  • フィルタリング済みデータセットは、画像忠実度に著しい向上をもたらし、ベースラインと比較してFIDスコアが32%低下した。
  • CONCHのCLIPスコアを用いた意味的整合性フィルタリングにより、整合性が低い画像-テキストペアが効果的に除外され、学習データの品質が向上した。
  • 不純物検出と意味的整合性フィルタリングの組み合わせにより、ヒストパスロジー分野における高忠実度テキスト-画像モデルの学習に適した、よりクリアで信頼性の高いデータセットが得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。