Skip to main content
QUICK REVIEW

[論文レビュー] PathGen-1.6M: 1.6 Million Pathology Image-text Pairs Generation through Multi-agent Collaboration

Yuxuan Sun, Yunlong Zhang|arXiv (Cornell University)|Jun 28, 2024
Biomedical Text Mining and OntologiesBiochemistry, Genetics and Molecular Biology被引用数 3
ひとこと要約

本稿では、TCGAの全スライド画像(WSI)上でマルチエージェント協調によるプロセスを経て生成された160万件の病理画像・テキストペアデータセット、PathGen-1.6Mを提案する。大規模なマルチモodalモデルを活用して代表的なパッチを抽出し、洗練されたキャプションを生成することで、著者らはPathGen-CLIPおよびPathGen-LLaVAを訓練した。これらはゼロショットおよびフェイントショット分類において最先端の性能を達成し、病理学的ベンチマークにおいてGPT-4Vでさえも上回っている。

ABSTRACT

Vision Language Models (VLMs) like CLIP have attracted substantial attention in pathology, serving as backbones for applications such as zero-shot image classification and Whole Slide Image (WSI) analysis. Additionally, they can function as vision encoders when combined with large language models (LLMs) to support broader capabilities. Current efforts to train pathology VLMs rely on pathology image-text pairs from platforms like PubMed, YouTube, and Twitter, which provide limited, unscalable data with generally suboptimal image quality. In this work, we leverage large-scale WSI datasets like TCGA to extract numerous high-quality image patches. We then train a large multimodal model to generate captions for these images, creating PathGen-1.6M, a dataset containing 1.6 million high-quality image-caption pairs. Our approach involves multiple agent models collaborating to extract representative WSI patches, generating and refining captions to obtain high-quality image-text pairs. Extensive experiments show that integrating these generated pairs with existing datasets to train a pathology-specific CLIP model, PathGen-CLIP, significantly enhances its ability to analyze pathological images, with substantial improvements across nine pathology-related zero-shot image classification tasks and three whole-slide image tasks. Furthermore, we construct 200K instruction-tuning data based on PathGen-1.6M and integrate PathGen-CLIP with the Vicuna LLM to create more powerful multimodal models through instruction tuning. Overall, we provide a scalable pathway for high-quality data generation in pathology, paving the way for next-generation general pathology models.

研究の動機と目的

  • 既存の病理画像・テキストデータセットの不足と低品質が、強固なビジョン・ランゲージモデルの訓練を制限しているという問題に対処すること。
  • TCGAの大型全スライド画像(WSI)を活用した、スケーラブルで高品質なデータ生成パイプラインの開発。
  • 病理学的ビジョン・ランゲージモデルの性能向上を図る、大規模かつ高忠実度の画像・テキストデータセットの構築。
  • 生成されたデータを大規模言語モデルと統合し、臨床的推論や診断に適した強力なマルチモーダル病理モデルの構築。

提案手法

  • TCGAの高解像度全スライド画像(WSI)から、マルチエージェント協調により代表的なパッチを抽出し、多様で診断的に関連する領域を網羅的に捉える。
  • 大規模なマルチモーダルモデルが、視覚的および文脈的特徴を活用して、抽出された画像パッチの初期キャプションを生成する。
  • エージェントベースのフィードバックと検証を繰り返し行うことで、キャプションの精錬を実施し、正確性、詳細性、臨床的関連性を向上させる。
  • 得られたPathGen-1.6Mデータセットを用いて、画像・テキストペアの対照学習により、病理学的特化型CLIPモデルであるPathGen-CLIPを事前学習する。
  • PathGen-1.6Mから抽出された20万件のインstructチューニングサンプルを用いて、PathGen-CLIPを微調整し、病理理解に特化したマルチモーダルLLM、PathGen-LLaVAを訓練する。
  • ビジョンエンコーダー(PathGen-CLIP)と大規模言語モデル(例:Vicuna)をインstructチューニングにより統合し、複雑な推論やマルチモーダルQAを可能にする。

実験結果

リサーチクエスチョン

  • RQ1ウェブ上の低品質なソースに依存せずに、マルチエージェント協調により全スライド画像から高品質で診断的に関連する画像・テキストペアを効果的に生成できるか?
  • RQ2大規模かつ高忠実度の病理学的データセットは、全スライド画像解析におけるゼロショットおよびフェイントショット分類性能をどの程度向上させるか?
  • RQ3病理学的最適化済みビジョン・ランゲージモデル(PathGen-CLIP)は、PLIP や BiomedCLIP といった既存モデルを下流の病理学的タスクで上回ることができるか?
  • RQ4PathGen-CLIPを大規模言語モデルと統合することで、一般ドメインモデル(例:GPT-4V)を凌駆するマルチモーダルモデル(PathGen-LLaVA)が、病理学的推論タスクにおいて優れた性能を示せるか?

主な発見

  • PathGen-CLIPはABMILアーキテクチャを用いてCAMELYON16データセットで平均AUC 96.9を達成し、PLIP(90.0)、BiomedCLIP(83.6)、Quilt-Net(87.1)を大きく上回った。
  • より大きなPathGen-CLIP-LバージョンはACMILアーキテクチャを用いて、複数のデータセットで平均AUC 92.6を達成し、PLIP(87.2)、BiomedCLIP(83.4)、Quilt-Net(86.2)を上回った。
  • PathGen-LLaVAはPathMMUベンチマークで全体の正答率58.4%を達成し、GPT-4V(49.8%)およびQuilt-LLaVAを複数のサブセットで17.5%~22.2%上回った。
  • PathGen-LLaVAはPathMMUのすべてのサブセットでQuilt-LLaVAを大きく上回り、PubMedでは17.5%、SocialPathでは12.2%、Atlasでは15.4%、PathCLSでは22.2%の向上を示した。
  • PathGen-1.6Mを既存のデータセットと統合することで、PathGen-CLIPは9つのゼロショット画像分類タスクおよび3つの全スライド画像分類タスクでSOTA性能を達成した。
  • 本研究は、マルチエージェント協調によるWSIからの高品質でスケーラブルなデータ生成が可能であり、病理AI分野における顕著な性能向上をもたらすことを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。