Skip to main content
QUICK REVIEW

[論文レビュー] Audio-based AI classifiers show no evidence of improved COVID-19 screening over simple symptoms checkers

Harry Coppock, Nicholson, George|arXiv (Cornell University)|Dec 15, 2022
COVID-19 diagnosis using AI被引用数 5
ひとこと要約

本研究では、67,842人の個体を対象とした大規模でPCR検査による裏付けのあるデータセットを用いて、音声ベースのAI分類器がCOVID-19スクリーニングに与える影響を評価した。初期のAUCが0.846と高水準であったが、自覚症状などの交絡要因を補正した後は0.619に低下し、音声ベースの分類器は単なる自覚症状スクリーニングに比べて実用的な利点を示さないことが判明した。

ABSTRACT

Recent work has reported that AI classifiers trained on audio recordings can accurately predict severe acute respiratory syndrome coronavirus 2 (SARSCoV2) infection status. Here, we undertake a large scale study of audio-based deep learning classifiers, as part of the UK governments pandemic response. We collect and analyse a dataset of audio recordings from 67,842 individuals with linked metadata, including reverse transcription polymerase chain reaction (PCR) test outcomes, of whom 23,514 tested positive for SARS CoV 2. Subjects were recruited via the UK governments National Health Service Test-and-Trace programme and the REal-time Assessment of Community Transmission (REACT) randomised surveillance survey. In an unadjusted analysis of our dataset AI classifiers predict SARS-CoV-2 infection status with high accuracy (Receiver Operating Characteristic Area Under the Curve (ROCAUC) 0.846 [0.838, 0.854]) consistent with the findings of previous studies. However, after matching on measured confounders, such as age, gender, and self reported symptoms, our classifiers performance is much weaker (ROC-AUC 0.619 [0.594, 0.644]). Upon quantifying the utility of audio based classifiers in practical settings, we find them to be outperformed by simple predictive scores based on user reported symptoms.

研究の動機と目的

  • 音声ベースのAI分類器が、単なる自覚症状チェックの上を行なうかどうかを評価すること。
  • 特に自覚症状のような交絡変数が、音声ベースのAIモデルの予測性能に与える影響を調査すること。
  • 音声ベース分類器の実際の人口スクリーニングにおける実用的価値を、シミュレートされた一般人口スクリーニング状況で評価すること。
  • AIを活用した診断研究における参加者選抜バイアスの低減と研究設計の改善に向けたベストプラクティスガイドラインを提供すること。
  • 再現可能性と今後の研究を支援するため、大規模で公開可能なPCR検査による裏付けのあるデータセットを公開すること。

提案手法

  • PCR検査結果と関連付けられた呼吸音声の記録を67,842件収集し、そのうち23,514例がSARS-CoV-2陽性であった。
  • 収集したデータセットを用いて複数の音声ベースAI分類器を訓練し、一般化性能をROC-AUCを用いて評価した。特に、実世界での適用を念頭に置いた評価を重視した。
  • 感受性スコアマッチングを適用して、測定済みの交絡要因(例:自覚症状)に差がないように個体をバランスさせ、自覚症状のみのスクリーニングと公平な比較を模擬した。
  • マッチド分析を実施し、自覚症状やその他の交絡要因を補正した後における音声特徴の残存予測力のみを隔離して評価した。
  • 臨床的意思決定の閾値を変化させた状況下で、期待される有効性指標を用いて分類器の実用的価値を評価し、音声、自覚症状、両者を組み合わせたモデルを比較した。
  • 外部データセットを用いて結果を再現し、得られた結果の頑健性と一般化可能性を検証した。

実験結果

リサーチクエスチョン

  • RQ1交絡要因を適切に補正した場合、音声ベースのAIは自覚症状スクリーニングを上回るCOVID-19スクリーニングの正確性を向上させるのか?
  • RQ2自覚症状やその他の交絡要因は、音声ベースAI分類器の予測性能をどの程度説明しているのか?
  • RQ3バイアスのかかった参加者選抜とは対照的に、現実的でマッチドされた人口条件下で音声ベース分類器の性能はどのように変化するのか?
  • RQ4シミュレートされた一般人口スクリーニング環境下で、音声ベース分類器の実用的価値は自覚症状スクリーニングと比べてどの程度高いのか?
  • RQ5今後のAIベース診断研究において、どのようにして登録バイアスや交絡要因を研究設計と評価の両面でより適切に扱うことができるか?

主な発見

  • 補正なしの分析では、音声ベースAI分類器のROC-AUCは0.846(95%信頼区間:0.838~0.854)に達し、先行研究と整合的であった。
  • 自覚症状などの測定済み交絡要因でマッチングした後、ROC-AUCは著しく0.619(95%信頼区間:0.594~0.644)に低下し、音声特徴自体に残存する予測力は極めて小さいことが示された。
  • すべてのシミュレートされた実用的状況下で、音声ベース分類器の性能は自覚症状スクリーニングに劣り、音声と自覚症状を組み合わせた場合にも追加的利益は認められなかった。
  • 本研究では、自覚症状に基づく参加者選抜が、先行研究における性能の誇張の主な要因であることが判明した。
  • 補正後の残存予測力は、データセットに収録されていない人口統計的・行動的要因などの未測定交絡要因に起因するとされた。
  • 研究者による再現性と今後のバイアス低減研究を支援するため、データセットとコードベースを公開した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。