Skip to main content
QUICK REVIEW

[论文解读] A study on the adequacy of common IQA measures for medical images

Anna Breger, Clemens Karner|arXiv (Cornell University)|May 29, 2024
Consumer Perception and Purchasing BehaviorBusiness, Management and Accounting被引用 3
一句话总结

本研究通过胸部X光片和光声成像的专家评分,以及自然图像和加速磁共振成像的补充数据,评估了常用图像质量评估(IQA)指标在医学图像中的适用性。结果表明,PSNR和SSIM在医学场景下表现不佳,而HaarPSI、DISTS、FSIM和LPIPS与人类评分的相关性更优,表明医学影像中需要采用任务特定的IQA度量标准。

ABSTRACT

Image quality assessment (IQA) is standard practice in the development stage of novel machine learning algorithms that operate on images. The most commonly used IQA measures have been developed and tested for natural images, but not in the medical setting. Reported inconsistencies arising in medical images are not surprising, as they have different properties than natural images. In this study, we test the applicability of common IQA measures for medical image data by comparing their assessment to manually rated chest X-ray (5 experts) and photoacoustic image data (2 experts). Moreover, we include supplementary studies on grayscale natural images and accelerated brain MRI data. The results of all experiments show a similar outcome in line with previous findings for medical images: PSNR and SSIM in the default setting are in the lower range of the result list and HaarPSI outperforms the other tested measures in the overall performance. Also among the top performers in our experiments are the full reference measures FSIM, LPIPS and MS-SSIM. Generally, the results on natural images yield considerably higher correlations, suggesting that additional employment of tailored IQA measures for medical imaging algorithms is needed.

研究动机与目标

  • 评估广泛使用的IQA度量(最初为自然图像设计)在医学影像数据中的适用性。
  • 解决医学影像中缺乏专家标注、公开可用的数据集以实现可靠IQA基准测试的问题。
  • 研究常见全参考(FR)和无参考(NR)IQA度量是否能有效反映临床图像质量评估中的人类专家感知。
  • 识别适用于医学图像恢复和重建任务的稳健、可泛化的IQA度量。
  • 指出PSNR和SSIM在医学场景中的局限性,并倡导在临床人工智能开发中采用定制化或改进的度量标准。

提出的方法

  • 使用人工评分的医学图像数据集开展四项独立实验:胸部X光片(5名专家)、光声图像(1名专家)、灰度自然图像(5名评分者)以及加速脑部MRI重建。
  • 采用标准化的IQA度量,包括PSNR、SSIM、MS-SSIM、DISTS、LPIPS、HaarPSI,以及NR度量如NIQE和PaQ-2-PIQ。
  • 使用speedyIQA标注工具收集并标准化专家评分,在皮尔逊相关性分析前对评分者进行z分数标准化。
  • 通过IQA评分与人工评分之间的Spearman等级相关系数(SRCC)和Kendall等级相关系数(KRCC)评估性能。
  • 使用IQA度量的官方实现,由于原始代码不可用,VIF度量使用PyTorch Lightning实现。
  • 在灰度、彩色图像,X光、光声、MRI等模态,以及噪声、压缩、加速等失真类型之间测试泛化能力。

实验结果

研究问题

  • RQ1常用IQA度量在胸部X光片和光声成像等医学图像上的评分与专家评分的相关性如何?
  • RQ2PSNR和SSIM等标准IQA度量在评估医学图像质量时是否仍可靠,尤其是与人类感知相比?
  • RQ3哪些IQA度量在不同医学影像任务和模态中表现出最高的泛化能力和鲁棒性?
  • RQ4全参考与无参考IQA度量在反映医学影像中人类标注的质量排序方面,表现如何比较?
  • RQ5在具有显著特征(如灰度、低对比度、高诊断细节)的医学图像数据上,基于自然图像训练的IQA度量在多大程度上具有泛化能力?

主要发现

  • 在默认设置下,PSNR和SSIM在所有医学图像数据集上与专家评分的相关性最低,证实其在医学图像质量评估中适用性有限。
  • HaarPSI始终表现最优,在所有测试的医学影像任务中均位列前三,展现出极强的泛化能力。
  • 全参考度量如DISTS、FSIM、LPIPS和MS-SSIM在多个数据集上表现优异,表明其在医学图像评估中具有应用潜力。
  • IQA度量在灰度自然图像数据集上的相关系数显著高于医学图像数据集,凸显了在医学场景下的性能差距。
  • NR度量如NIQE和PaQ-2-PIQ在加速MRI重建中难以检测到质量退化,表明其对临床相关失真不敏感。
  • 本研究证实,医学影像中需要采用任务特定和模态感知的IQA度量,因为通用度量如PSNR和SSIM无法与专家感知对齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。