[論文レビュー] CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models
CARESは、信頼性、公平性、安全性、プライバシー、耐性の5つの次元において、医療用途の大規模ビジョン・リンギアモデル(Med-LVLM)の信頼性を評価する包括的なベンチマークである。16の医用画像モダリティおよび27の解剖的領域をカバーする41,000の質問・回答ペアを含み、事実の虚構、文化的バイアス、プライバシー意識の欠如、改ざん攻撃への脆弱性、不確実性推定における過信といった深刻な問題が明らかになった。
Artificial intelligence has significantly impacted medical applications, particularly with the advent of Medical Large Vision Language Models (Med-LVLMs), sparking optimism for the future of automated and personalized healthcare. However, the trustworthiness of Med-LVLMs remains unverified, posing significant risks for future model deployment. In this paper, we introduce CARES and aim to comprehensively evaluate the Trustworthiness of Med-LVLMs across the medical domain. We assess the trustworthiness of Med-LVLMs across five dimensions, including trustfulness, fairness, safety, privacy, and robustness. CARES comprises about 41K question-answer pairs in both closed and open-ended formats, covering 16 medical image modalities and 27 anatomical regions. Our analysis reveals that the models consistently exhibit concerns regarding trustworthiness, often displaying factual inaccuracies and failing to maintain fairness across different demographic groups. Furthermore, they are vulnerable to attacks and demonstrate a lack of privacy awareness. We publicly release our benchmark and code in https://cares-ai.github.io/.
研究の動機と目的
- 診断精度を超えて、Med-LVLMの信頼性を体系的に評価すること。
- 医療AIにおける信頼性を評価するための標準化された、多次元のベンチマークの不足を解消すること。
- 事実の虚構、バイアス、プライバシー漏洩、悪意あるプロンプトへの脆弱性といった、Med-LVLMにおける深刻なリスクを同定すること。
- 今後のより安全で信頼性の高いMed-LVLMの開発を支援するため、公開可能なベンチマークを提供すること。
- 信頼性の欠如が、主な信頼性次元において臨床応用に深刻なリスクをもたらすことを強調すること。
提案手法
- CARESは、7つの既存の医用マルチモーダルおよび画像分類データセットから構築され、医用画像モダリティおよび解剖的領域の広範なカバレッジを確保している。
- ベンチマークには18,000枚の画像と41,000の質問・回答ペアが含まれており、閉形式(例:選択肢、はい/いいえ)および開形式の両方の形式を含む。
- 信頼性は5つの次元で評価される:信頼性(事実性および不確実性)、公平性(文化的差異)、安全性(改ざん攻撃、毒性、過剰な慎重さ)、プライバシー(機微情報の保護)、耐性(ノイズやレアな入力への耐性)。
- 標準化された評価プロトコルにより、Med-LVLM間での一貫性のある比較が可能であり、事実的正確性については人間によるアノテーションまたはキュレート済みラベルが用いられる。
- 改ざん攻撃用の悪意あるプロンプトを用いて、モデルの改ざん攻撃への耐性および毒性出力を生成するリスクを評価する。
- 再現性および今後の拡張を支援するため、コードを含めてベンチマークを公開している。
実験結果
リサーチクエスチョン
- RQ1Med-LVLMは、開形式の質問やまれなモダリティの状況において、どの程度事実の虚構を示すか?
- RQ2年齢、性別、人種といった文化的要因がMed-LVLMのパフォーマンスに与える影響は何か。これは公平性の問題を示唆する。
- RQ3Med-LVLMは改ざん攻撃に対してどの程度脆弱であり、有害または有害な出力を生成するリスクはどれほどか?
- RQ4患者の機微な情報を求められる質問に対して、Med-LVLMはどの程度患者のプライバシーを保護できていないか?
- RQ5Med-LVLMは、分布外またはノイズの多い医用画像に対して、不確実性をどの程度適切に推定し、適切に対応できるか?
主な発見
- Med-LVLMは包括的なVQAベンチマークにおいて、50%以上のケースで事実の虚構を示しており、特に開形式の質問やまれな解剖的領域・モダリティの状況で顕著である。
- 不確実性推定において顕著な過信が見られ、自身の知識の限界を正しく理解していないため、誤診のリスクが高まっている。
- 文化的要因によるパフォーマンスの差が認められる:40–60歳の年齢層が最も高い正確性を示すが、高齢の患者は訓練データの偏りにより代表されておらず、パフォーマンスが低い。
- LLaVA-Medは改ざん攻撃および毒性への耐性が最も強く示されたが、過剰な慎重さのため、日常的な質問に対しても拒否率が高く、不利益をもたらしている。
- Med-LVLMは有効なプライバシー防御を欠いており、しばしば患者の機微な情報を求められる質問に拒否しないため、機密性の意識が乏しいことが示された。
- すべてのモデルが改ざん攻撃用プロンプトの下で正確性が低下し、有害または誤った診断出力を一貫して拒否しないため、深刻なセキュリティ上の脆弱性が明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。