[論文レビュー] A study on the adequacy of common IQA measures for medical images
本研究では、胸部X線およびフォトアクウスティック画像における専門家による評価と、自然画像および加速MRIに関する補足データを用いて、一般的に用いられる画像品質評価(IQA)指標の医用画像への適正さを評価する。結果として、PSNRおよびSSIMは医用画像の文脈では性能が著しく劣ることが判明した一方、HaarPSI、DISTS、FSIM、LPIPSは人間の評価と優れた相関を示し、医用画像処理におけるタスク特化型IQA指標の必要性が示された。
Image quality assessment (IQA) is standard practice in the development stage of novel machine learning algorithms that operate on images. The most commonly used IQA measures have been developed and tested for natural images, but not in the medical setting. Reported inconsistencies arising in medical images are not surprising, as they have different properties than natural images. In this study, we test the applicability of common IQA measures for medical image data by comparing their assessment to manually rated chest X-ray (5 experts) and photoacoustic image data (2 experts). Moreover, we include supplementary studies on grayscale natural images and accelerated brain MRI data. The results of all experiments show a similar outcome in line with previous findings for medical images: PSNR and SSIM in the default setting are in the lower range of the result list and HaarPSI outperforms the other tested measures in the overall performance. Also among the top performers in our experiments are the full reference measures FSIM, LPIPS and MS-SSIM. Generally, the results on natural images yield considerably higher correlations, suggesting that additional employment of tailored IQA measures for medical imaging algorithms is needed.
研究の動機と目的
- 自然画像向けに設計された一般的に用いられるIQA指標が、医用画像データに適しているかどうかを評価すること。
- 医用画像における信頼できるIQAベンチマーク化のための、専門家がアノテートした公開可能なデータセットの不足を解消すること。
- 一般的なフルレファレンス(FR)およびノーレファレンス(NR)IQA指標が、臨床的画像品質評価における人間の専門家認識とどの程度相関しているかを調査すること。
- 医用画像修復および再構成タスクに適した、強固で一般化可能なIQA指標を特定すること。
- PSNRおよびSSIMが医用文脈で限界を示すことを確認し、臨床的AI開発における特化型または改善型指標の導入を提言すること。
提案手法
- 手動で評価された医用画像データセットを用いた4つの独立した実験:胸部X線(5名の専門家)、フォトアクウスティック画像(1名の専門家)、グレースケール自然画像(5名の評価者)、加速脳MRI再構成(5名の評価者)。
- PSNR、SSIM、MS-SSIM、DISTS、LPIPS、HaarPSI、およびNIQEやPaQ-2-PIQなどのNR指標を含む標準化されたIQA指標を採用。
- 専門家評価の収集と標準化にspeedyIQAアノテーションツールを用い、相関分析の前に評価者間でzスコア正規化を実施。
- IQAスコアと手動評価との間のスピアーマンおよびケンドール順位相関係数(SRCC/KRCC)を用いて性能を評価。
- IQA指標の公式実装を用い、VIFについては元のコードが入手不能であったためPyTorch Lightningを活用。
- グレースケールおよびカラー画像、X線・フォトアクウスティック・MRIのモダリティ、ノイズ・圧縮・加速などの歪みタイプの多様な組み合わせにおいて一般化性能をテスト。
実験結果
リサーチクエスチョン
- RQ1一般的に用いられるIQA指標は、胸部X線やフォトアクウスティックスキャンなどの医用画像において、専門家評価とどの程度相関しているか。
- RQ2PSNRやSSIMといった標準的IQA指標は、人間の認識と比較して医用画像品質評価に信頼性を保っているか。
- RQ3どのようなIQA指標が、多様な医用画像タスクおよびモダリティにわたって最も一般化可能で強健であるか。
- RQ4フルレファレンスとノーレファレンスのIQA指標は、医用画像における人間がアノテートした品質順位をどの程度適切に反映できるか。
- RQ5自然画像で学習されたIQA指標は、グレースケール、低コントラスト、診断に重要な詳細を有する医用画像データにどの程度一般化できるか。
主な発見
- PSNRおよびSSIMは、デフォルト設定下で、あらゆる医用画像データセットにおいて、専門家評価との相関が最低水準にとどまり、医用画像品質評価に適さないことが確認された。
- HaarPSIは一貫して他のIQA指標を上回り、全テスト対象の医用画像タスクで上位3位以内を維持し、優れた一般化性能を示した。
- DISTS、FSIM、LPIPS、MS-SSIMといったフルレファレンス指標は、複数のデータセットで優れた性能を示し、医用画像評価への応用可能性が示された。
- IQA指標の相関係数は、グレースケール自然画像データセットでは医用画像データセットよりも顕著に高かったことから、医用文脈における性能格差が浮き彫りになった。
- NIQE や PaQ-2-PIQ などのNR指標は、加速MRI再構成における品質劣化を検出できず、臨床的に重要な歪みに感受性が低かった。
- 本研究は、一般化可能な指標がPSNRやSSIMに代わる、タスク特化型かつモダリティに配慮したIQA指標の開発が医用画像処理において不可欠であることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。