[論文レビュー] PathAsst: A Generative Foundation AI Assistant Towards Artificial General Intelligence of Pathology
PathAsst は、病理学に特化した生成型基盤AIアシスタントであり、視覚エンコーダーと大規模言語モデルを統合して組織病理画像を解釈し、細胞分類や検出のような複雑なタスクに特化したサブモデルを起動する。142Kの収集済み画像・テキストペアと180Kの指示従いサンプルを活用することで、ベースラインのMLLMよりも優れた診断的推論を達成し、臨床的文脈における高度なマルチモーダル推論を示している。
As advances in large language models (LLMs) and multimodal techniques continue to mature, the development of general-purpose multimodal large language models (MLLMs) has surged, offering significant applications in interpreting natural images. However, the field of pathology has largely remained untapped, particularly in gathering high-quality data and designing comprehensive model frameworks. To bridge the gap in pathology MLLMs, we present PathAsst, a multimodal generative foundation AI assistant to revolutionize diagnostic and predictive analytics in pathology. The development of PathAsst involves three pivotal steps: data acquisition, CLIP model adaptation, and the training of PathAsst's multimodal generative capabilities. Firstly, we collect over 207K high-quality pathology image-text pairs from authoritative sources. Leveraging the advanced power of ChatGPT, we generate over 180K instruction-following samples. Furthermore, we devise additional instruction-following data specifically tailored for invoking eight pathology-specific sub-models we prepared, allowing the PathAsst to effectively collaborate with these models, enhancing its diagnostic ability. Secondly, by leveraging the collected data, we construct PathCLIP, a pathology-dedicated CLIP, to enhance PathAsst's capabilities in interpreting pathology images. Finally, we integrate PathCLIP with the Vicuna-13b and utilize pathology-specific instruction-tuning data to enhance the multimodal generation capacity of PathAsst and bolster its synergistic interactions with sub-models. The experimental results of PathAsst show the potential of harnessing AI-powered generative foundation model to improve pathology diagnosis and treatment processes.
研究の動機と目的
- 病理学に特化したマルチモーダル大規模言語モデル(MLLM)の不足に対処するため、組織病理画像を理解し、それらに基づいて推論を行う基盤モデルを開発すること。
- ユーザーの意図と画像コンテンツに基づいて動的に特化したサブモデルを起動できる仕組みを提供することで、病理学における診断および予測的分析を向上させること。
- 訓練用に耐性のある病理学特化型AIモデルを構築するため、142Kの病理学的画像・テキストペアと180Kの指示従いサンプルを含む高品質なオープンソースデータセットを作成・公開すること。
- 研究者がデータ収集ツールと前処理パイプラインをオープンソース化することで、自らの病理学基盤モデルの構築およびファインチューニングを支援すること。
提案手法
- PubMed、病理学教科書、信頼できるWebサイト、および専門家がアノテートした非公開データから、厳密なクリーニングと最適化を経て142Kの高品質な病理学的画像・テキストペアを収集した。
- GPT-4を用いて180Kの指示従いサンプルを生成し、基盤モデルが多様な診断的および分析的タスクを学習できるようにした。
- モデル起動のための特化した指示従いデータを設計し、PathAsstが動的に8つのタスク特化型サブモデル(例:LBC細胞生成モデル、PD-L1検出器)を選択・利用できるようにした。
- CLIP視覚エンコーダー(clip-vit-base-patch32)を搭載したVicuna-13B言語モデルを用いてPathAsstを訓練し、マルチモーダル理解と推論を可能にした。
- カスタムスクリプトを用いてPDF病理学書から画像・テキストペアを自動抽出するパイプラインを開発した。
- 200K以上の病理学サンプルで微調整された、複数のCLIPバリアント(例:vit-large-patch14-336)を再訓練し、公開する計画である。
実験結果
リサーチクエスチョン
- RQ1生成型基盤モデルは、複雑な組織病理画像を効果的に解釈し、臨床的に関連性のある診断的インサイトを生成できるか?
- RQ2特化したサブモデルの動的起動は、エンドツーエンドのマルチモーダル生成と比較して、病理学における診断の正確性とタスクの汎化性をどのように向上させるか?
- RQ3高品質で収集されたデータは、病理学特化タスクにおける基盤モデルのパフォーマンスをどの程度向上させるか?
- RQ4病理学特化のプロンプトを用いた指示チューニングは、ゼロショットおよびフェイントショットの診断的推論能力を顕著に向上させるか?
主な発見
- PathAsstは、LLaVA や MiniGPT-4 といったベースラインのMLLMよりも、組織病理画像における病的特徴(例:拡大した核、不規則な核膜)の認識で優れた性能を示した。
- 専用のLBC細胞生成モデルを起動することで、LSILカテゴリに属する不規則な胞質を有するLBC細胞を効果的に生成し、タスク特化型の適応性を示した。
- 細胞数え上げタスクでは、PathAsstがPD-L1細胞検出モデルを正しく起動し、陽性細胞をマークし、正確な統計情報を含むマークダウン形式の構造化結果を出力した。
- 画像コンテンツについての推論と適切なサブモデルの選択能力のおかげで、直接的なマルチモーダル生成に比べ、より正確で文脈に即した診断的出力が得られた。
- GPT-4を用いて180Kの指示従いサンプルを生成することで、複雑で多段階的な診断指示に従う能力が顕著に向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。