Skip to main content
QUICK REVIEW

[논문 리뷰] CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models

Peng Xia, Ze Chen|arXiv (Cornell University)|2024. 06. 10.
Topic Modeling인용 수 4
한 줄 요약

CARES는 의료 대규모 시각-언어 모델(Med-LVLMs)의 신뢰성 여부를 신뢰성, 공정성, 안전성, 개인정보 보호, 내구성의 다섯 가지 차원에서 평가하기 위한 종합적인 벤치마크이다. 16종의 의료 영상 모odalities와 27개의 해부학적 부위를 포함한 총 41,000개의 질문-답변 쌍을 포함하며, 사실상의 오류, 인구 통계적 편향, 개인정보 보호 인식 부족, 해킹 공격에 대한 취약성, 불확실성 추정에서의 과신 등의 심각한 문제를 드러냈다.

ABSTRACT

Artificial intelligence has significantly impacted medical applications, particularly with the advent of Medical Large Vision Language Models (Med-LVLMs), sparking optimism for the future of automated and personalized healthcare. However, the trustworthiness of Med-LVLMs remains unverified, posing significant risks for future model deployment. In this paper, we introduce CARES and aim to comprehensively evaluate the Trustworthiness of Med-LVLMs across the medical domain. We assess the trustworthiness of Med-LVLMs across five dimensions, including trustfulness, fairness, safety, privacy, and robustness. CARES comprises about 41K question-answer pairs in both closed and open-ended formats, covering 16 medical image modalities and 27 anatomical regions. Our analysis reveals that the models consistently exhibit concerns regarding trustworthiness, often displaying factual inaccuracies and failing to maintain fairness across different demographic groups. Furthermore, they are vulnerable to attacks and demonstrate a lack of privacy awareness. We publicly release our benchmark and code in https://cares-ai.github.io/.

연구 동기 및 목표

  • 진단 정확도를 넘어서 의료 대규모 시각-언어 모델의 신뢰성 여부를 체계적으로 평가하기 위해.
  • 의료 AI의 신뢰성 평가를 위한 표준화되고 다차원적인 벤치마크의 부족을 해결하기 위해.
  • 사실 오류, 편향, 개인정보 泄露, 악성 프롬프트에 대한 취약성과 같은 Med-LVLM의 잠재적 위험 요소를 특정하기 위해.
  • 향후 더 안전하고 신뢰성 있는 Med-LVLM 개발을 안내하기 위해 공개된 벤치마크를 제공하기 위해.
  • 의료 임상 현장에서 모델의 신뢰성 부족으로 인한 심각한 위험 요소를 부각시키기 위해, 핵심 신뢰성 차원에서의 문제점을 강조하기 위해.

제안 방법

  • CARES는 의료 다중모달 및 영상 분류 데이터셋 7종에서 유래하여 다양한 의료 영상 모달리티와 해부학적 부위를 포괄하도록 구성되었다.
  • 벤치마크는 닫힘형 질문(예: 다중선택, 예/아니요)과 열림형 질문 양식을 포함한 총 18,000장의 이미지와 41,000개의 질문-답변 쌍을 포함한다.
  • 신뢰성은 다섯 가지 차원에서 평가된다: 신뢰성(사실성 및 불확실성), 공정성(인구 통계적 격리), 안전성(해킹 공격, 독성, 과도한 경계심), 개인정보 보호(민감 정보 보호), 내구성(노이즈 또는 드문 입력에 대한 저항성).
  • 모델 간 일관된 비교를 가능하게 하기 위해 평가 프로토콜을 표준화하였으며, 사실성 정확도에 대해 인간이 검토하거나 정제한 레이블을 사용하였다.
  • 모델들은 해킹 공격에 대한 저항성과 독성 출력 생성 능력을 평가하기 위해 악성 프롬프트를 활용해 테스트되었다.
  • 재현성과 향후 확장 가능성을 지원하기 위해 코드와 함께 벤치마크를 공개적으로 배포하였다.

실험 결과

연구 질문

  • RQ1의료 대규모 시각-언어 모델은 열림형 질문이나 드문 모달리티 시나리오에서 얼마나 높은 비율로 사실 오류를 보이는가?
  • RQ2나이, 성별, 인종 등의 인구 통계적 요소가 Med-LVLM의 성능에 미치는 영향은 무엇이며, 이는 공정성 문제를 시사하는가?
  • RQ3Med-LVLM은 해킹 공격에 얼마나 취약한가? 독성 또는 해로운 출력을 생성하는 데 대한 저항성은 어떠한가?
  • RQ4민감한 정보를 포함한 질문에 대해 Med-LVLM은 환자의 개인정보 보호를 얼마나 잘 수행하는가?
  • RQ5의료 영상에서 이상치 또는 노이즈가 있는 입력에 대해 Med-LVLM은 불확실성 추정을 얼마나 잘 수행하며, 어떻게 반응하는가?

주요 결과

  • 의료 대규모 시각-언어 모델은 종합적인 VQA 벤치마크에서 약 50퍼센트 이상의 경우에서 사실 오류를 보이며, 특히 열림형 질문이나 드문 해부학적 부위 또는 모달리티에서 두드러진다.
  • 모델들은 불확실성 추정에서 심각한 과신을 보이며, 자신의 지식 한계를 제대로 이해하지 못함으로써 잘못된 진단 위험을 증가시킨다.
  • 인구 통계적 그룹 간 성능 격차가 존재한다: 40–60세 연령대에서 정확도가 가장 높았고, 고령 환자는 훈련 데이터의 불균형으로 인해 부족하게 반영되고 성능도 떨어졌다.
  • LLaVA-Med는 해킹 공격 및 독성에 대한 저항력이 가장 높은 편이지만, 과도한 경계심으로 인해 일반적인 질문조차도 거부하는 경우가 많아져 높은 거부율을 보였다.
  • 모든 모델는 개인정보 보호 방어 기능이 효과적으로 작동하지 않으며, 환자 개인정보를 요구하는 질문에 대해 거부하는 경우가 거의 없어 기밀성 인식 부족을 보였다.
  • 해킹 공격 프롬프트 하에서 모든 모델가 정확도가 떨어졌고, 유해하거나 잘못된 진단 결과를 지속적으로 거부하지 않아 치명적인 보안 취약성을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.