[論文レビュー] Neural Networks for Pulmonary Disease Diagnosis using Auditory and Demographic Information
本論文では、2つの並列ディープ畳み込みニューラルネットワーク(DCNN)を用いて聴診的呼吸音と人口統計データを統合することで、肺疾患診断を向上させるディープラーニングフレームワークを提案する。音声と人口統計特徴量を組み合わせることで、5%の精度向上を達成し、NVIDIA TX2のようなエッジデバイス上での展開効率を評価した。低消費電力で実時間性能を達成可能であることが示された。
Pulmonary diseases impact millions of lives globally and annually. The recent outbreak of the pandemic of the COVID-19, a novel pulmonary infection, has more than ever brought the attention of the research community to the machine-aided diagnosis of respiratory problems. This paper is thus an effort to exploit machine learning for classification of respiratory problems and proposes a framework that employs as much correlated information (auditory and demographic information in this work) as a dataset provides to increase the sensitivity and specificity of a diagnosing system. First, we use deep convolutional neural networks (DCNNs) to process and classify a publicly released pulmonary auditory dataset, and then we take advantage of the existing demographic information within the dataset and show that the accuracy of the pulmonary classification increases by 5% when trained on the auditory information in conjunction with the demographic information. Since the demographic data can be extracted using computer vision, we suggest using another parallel DCNN to estimate the demographic information of the subject under test visioned by the processing computer. Lastly, as a proposition to bring the healthcare system to users' fingertips, we measure deployment characteristics of the auditory DCNN model onto processing components of an NVIDIA TX2 development board.
研究の動機と目的
- 聴診的および人口統計的情報を統合することで、機械支援肺疾患診断の感度と特異度を向上させること。
- 追加のセンサデータを組み込めるスケーラブルで柔軟なフレームワークを構築し、家庭や公衆衛生モニタリングなど多様な展開シナリオに対応すること。
- 受動的な音声および動画データを用いた、医療機関に依存しない早期段階の診断を可能にすることにより、医療システムへの負担を軽減すること。
- 組み込みエッジデバイスに診断モデルを展開する際の実現可能性を評価し、プライバシーを守るリアルタイム推論を可能にすること。
提案手法
- 呼吸音記録と人口統計的特徴量(年齢、性別、民族)を並列に処理する二重ブランチDCNNアーキテクチャを採用し、分類精度を向上させる。
- 人口統計的特徴量は手動で入力されるか、患者の画像から二次的なコンピュータビジョンベースのDCNNを用いて推定される。
- 126名の被験者と7つの疾患クラス(健常者を含む)を含む、公開済みで準バランスの取れた呼吸音データセットを用いてモデルを学習した。
- 音声データはEnvNetベースのDCNNで処理され、人口統計推定には顔画像を用いた別個のDCNNが顔の年齢と性別を予測するために訓練された。
- モデルの展開効率は、さまざまなクロック周波数を設定したCPUオンリーおよびCPU+GPU構成のNVIDIA TX2ボード上で評価された。
- パフォーマンス指標には、推論遅延、消費電力、GFLOPS/W、および異なるハードウェア設定におけるエネルギー効率が含まれる。
実験結果
リサーチクエスチョン
- RQ1聴診的および人口統計的情報を統合することで、肺疾患分類のためのディープラーニングモデルの精度が向上するか?
- RQ2人口統計的データの組み込みが、DCNNを用いた呼吸器疾患診断における感度と特異度に与える影響はいかほどか?
- RQ3顔画像から並列DCNNを用いて人口統計的特徴量をどれほど正確に推定できるか?
- RQ4組み込みエッジデバイスにDCNNモデルを展開する際、ハードウェアリソースとエネルギー効率のトレードオフはどのようなものか?
主な発見
- 音声ベースのDCNNに人口統計的情報を追加することで、分類精度が5%向上した。
- 音声と人口統計的特徴量を組み合わせたモデルは、テストで83%の精度を達成した。これは、著しく不均衡なデータセットを用いていた先行研究の音声オンリーモデル(97%の精度)を上回った。
- 最もエネルギー効率の良い展開は、NVIDIA TX2のCPU+GPU構成であり、推論を0.1秒で完了し、エネルギー消費は1.935 Jであった。
- 最も消費電力が低い構成(低周波のDenver CPU)は、1回の推論に10秒を要し、8.81 mWの消費電力と0.019 Jのエネルギー消費を記録した。
- CPU+GPU構成はエネルギー効率で0.91 GFLOPS/Wを達成し、CPUオンリーコンfigurationを上回った。
- このフレームワークにより、エッジデバイス上でリアルタイムかつ低遅延の診断が可能となり、プライバシーを守るデバイス内推論を実現した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。