[论文解读] CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models
CARES 是一个全面的基准测试,用于评估医学多模态大模型(Med-LVLMs)在五个维度上的可信度:可信性、公平性、安全性、隐私性和鲁棒性。该基准包含跨16种医学影像模态和27个人体解剖区域的41,000个问答对,揭示了显著问题,包括事实性幻觉、人口统计偏差、隐私意识薄弱、易受越狱攻击以及对不确定性估计的过度自信。
Artificial intelligence has significantly impacted medical applications, particularly with the advent of Medical Large Vision Language Models (Med-LVLMs), sparking optimism for the future of automated and personalized healthcare. However, the trustworthiness of Med-LVLMs remains unverified, posing significant risks for future model deployment. In this paper, we introduce CARES and aim to comprehensively evaluate the Trustworthiness of Med-LVLMs across the medical domain. We assess the trustworthiness of Med-LVLMs across five dimensions, including trustfulness, fairness, safety, privacy, and robustness. CARES comprises about 41K question-answer pairs in both closed and open-ended formats, covering 16 medical image modalities and 27 anatomical regions. Our analysis reveals that the models consistently exhibit concerns regarding trustworthiness, often displaying factual inaccuracies and failing to maintain fairness across different demographic groups. Furthermore, they are vulnerable to attacks and demonstrate a lack of privacy awareness. We publicly release our benchmark and code in https://cares-ai.github.io/.
研究动机与目标
- 系统评估 Med-LVLM 的可信度,超越单纯的诊断准确性。
- 解决医学人工智能中缺乏标准化、多维基准以评估可靠性的现状。
- 识别 Med-LVLM 中的关键风险,如事实性幻觉、偏见、隐私泄露以及对对抗性提示的脆弱性。
- 提供一个公开可用的基准,以指导未来更安全、更可靠的 Med-LVLM 的开发。
- 突出由于模型在关键可信度维度上的不可靠性,导致临床部署中存在紧迫风险。
提出的方法
- CARES 基于七个现有的医学多模态和图像分类数据集构建,确保覆盖广泛的医学影像模态和解剖区域。
- 该基准包含18,000张图像和41,000个问答对,涵盖闭合式(如多选题、是/否)和开放式格式。
- 可信度在五个维度上进行评估:可信性(事实性与不确定性)、公平性(人口统计差异)、安全性(越狱攻击、毒性、过度谨慎)、隐私性(敏感信息保护)和鲁棒性(对噪声或罕见输入的抗扰能力)。
- 采用标准化的评估协议,以实现不同 Med-LVLM 之间的一致性比较,事实准确性使用人工标注或精心筛选的标签。
- 通过对抗性提示测试模型,以评估其对越狱攻击的抵抗能力及毒性输出生成能力。
- 该基准已公开发布,并附带代码,以支持可复现性及未来扩展。
实验结果
研究问题
- RQ1Med-LVLM 在多大程度上表现出事实性幻觉,特别是在开放式问题或罕见模态场景下?
- RQ2年龄、性别和种族等人口统计因素如何影响 Med-LVLM 的性能,反映出公平性问题?
- RQ3Med-LVLM 对越狱攻击的脆弱性如何,其对生成有毒或有害输出的抵抗能力如何?
- RQ4当被询问涉及敏感信息时,Med-LVLM 在多大程度上未能保护患者隐私?
- RQ5Med-LVLM 在估计不确定性以及应对分布外或噪声医学图像时表现如何?
主要发现
- 在综合 VQA 基准测试中,Med-LVLM 在超过50%的案例中表现出事实性幻觉,尤其在开放式问题以及罕见解剖区域或模态场景下更为明显。
- 模型在不确定性估计方面表现出显著的过度自信,对其自身知识边界的理解较差,增加了误诊风险。
- 不同人口群体之间存在性能差异:40–60岁人群的准确率最高,而老年人群因训练数据不平衡而代表性不足且表现较差。
- LLaVA-Med 展现出最强的越狱攻击和毒性抵抗能力,但代价是过度谨慎,导致即使对常规查询也出现极高的拒绝率。
- Med-LVLM 缺乏有效的隐私防护机制,通常无法拒绝涉及患者隐私信息的查询,表明其对保密性的认知严重不足。
- 所有模型在越狱提示下准确率均下降,且无一模型能一致拒绝有害或错误的诊断输出,暴露出关键的安全漏洞。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。