[論文レビュー] Pressure Ulcer Categorisation using Deep Learning: A Clinical Trial to Evaluate Model Performance
本研究では、実臨床現場におけるNHS臨床試験において、スマートフォン画像から圧瘡(I〜IV期、DTI、ステージ不能)を自動分類する深層学習ベースのモバイルシステムを、Faster R-CNNを用いて評価した。216枚の妥当性確認済み画像を用いて、0.75の信頼度しきい値で平均F1スコア0.6786を達成し、標準化された報告のための臨床的十分性にはまだ至っていないが、地域ケアにおける有望な性能を示した。
Pressure ulcers are a challenge for patients and healthcare professionals. In the UK, 700,000 people are affected by pressure ulcers each year. Treating them costs the National Health Service {\\pounds}3.8 million every day. Their etiology is complex and multifactorial. However, evidence has shown a strong link between old age, disease-related sedentary lifestyles and unhealthy eating habits. Pressure ulcers are caused by direct skin contact with a bed or chair without frequent position changes. Urinary and faecal incontinence, diabetes, and injuries that restrict body position and nutrition are also known risk factors. Guidelines and treatments exist but their implementation and success vary across different healthcare settings. This is primarily because healthcare practitioners have a) minimal experience in dealing with pressure ulcers, and b) a general lack of understanding of pressure ulcer treatments. Poorly managed, pressure ulcers lead to severe pain, poor quality of life, and significant healthcare costs. In this paper, we report the findings of a clinical trial conducted by Mersey Care NHS Foundation Trust that evaluated the performance of a faster region-based convolutional neural network and mobile platform that categorised and documented pressure ulcers. The neural network classifies category I, II, III, and IV pressure ulcers, deep tissue injuries, and unstageable pressure ulcers. Photographs of pressure ulcers taken by district nurses are transmitted over 4/5G communications to an inferencing server for classification. Classified images are stored and reviewed to assess the model's predictions and relevance as a tool for clinical decision making and standardised reporting. The results from the study generated a mean average Precision=0.6796, Recall=0.6997, F1-Score=0.6786 with 45 false positives using an @.75 confidence score threshold.
研究の動機と目的
- 地域の診療における地域看護師を含む保健従事者の間で生じる圧瘡分類の臨床的ばらつきや一貫性の欠如を是正すること。
- リアルタイムの臨床意思決定支援を可能にする、深層学習を活用したAI搭載モバイルシステムを開発・評価し、圧瘡分類を標準化すること。
- プライマリケア環境における、実臨床現場の低品質な画像を用いたFaster R-CNNモデルの実用性と性能を評価すること。
- 画像品質やクラスの不均衡といった、モデル性能の制約要因を同定し、今後の改善に向けた解決策を提示すること。
- AIモデルの正確性を向上させるために、高品質な圧瘡画像の共有と標準化された撮影プロトコルの推進を提唱すること。
提案手法
- Faster Region-based Convolutional Neural Network (Faster R-CNN) を用いて、圧瘡を6つのカテゴリー(I期、II期、III期、IV期、深部組織障害(DTI)、ステージ不能)に分類するように学習した。
- 地域看護師がモバイルフォンで圧瘡画像を撮影し、4G/5G回線を介してリバプールジョン・ムーズ大学のサーバーに送信し、推論処理を実行した。
- 環境要因のばらつきを低減するため、画像を傷の部分にクロップすることで前処理を行い、モデル性能の向上を図った。
- 事前学習済みバックボーンを用いたトランスファー学習を実施し、8か月間にわたり収集した1,016枚の画像データセットを、品質フィルタリングの後、216枚に削減して微調整した。
- 性能評価には、標準的なオブジェクト検出指標(平均平均精度(mAP)、平均再現率(mAR)、平均F1スコア(mAF1))を用いた。
- 精度と再現率のバランスを図るため、信頼度しきい値を0.75に設定し、誤検出の臨床的妥当性についても分析した。
実験結果
リサーチクエスチョン
- RQ1地域ケアの現場において、実臨床現場の低品質なスマートフォン画像を用いて、深層学習モデルが複数のステージおよびタイプの圧瘡を正確に分類できるか?
- RQ2画像のクロップおよび前処理は、Faster R-CNNモデルの圧瘡分類性能にどのように影響するか?
- RQ3現在のモデル性能が、日常的患者ケアおよび報告の臨床基準を満たしている程度はどの程度か?
- RQ4圧瘡分類モデルのための十分で高品質かつバランスの取れたトレーニングデータを取得する上で、主な課題は何か?
- RQ5標準化された撮影プロトコルとデータ共有は、今後のモデル性能の向上および臨床現場での採用をどのように促進できるか?
主な発見
- 0.75の信頼度しきい値で、平均F1スコア0.6786、精度0.6796、再現率0.6997を達成し、中程度の性能ではあるが、臨床的十分性にはまだ至っていないことが示された。
- 画像のクロップ処理によりモデル性能が顕著に向上し、mAPが0.3639から0.6796に上昇した。これは、傷の部分に焦点を当てる重要性を強調している。
- システムは合計45件の誤検出(偽陽性)を出力しており、圧瘡と類似した皮膚状態やアーティファクトを区別する能力に改善の余地があることが示された。
- 低品質なインターネット上の画像をトレーニングデータとして使用したにもかかわらず、妥当な結果が得られた。これは、高品質なデータを用いればさらなる改善が見込める可能性を示唆している。
- 本試験では達成できなかったが、90パーセンタイルの性能を達成するには、少なくとも9,000枚の高品質かつバランスの取れた画像(各クラス1,500枚)の必要があることが同定された。
- 結果から、標準化された撮影とオープンデータ共有の重要性が再確認された。これは、圧瘺管理におけるAIの発展に不可欠である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。