[論文レビュー] Listen2YourHeart: A Self-Supervised Approach for Detecting Murmur in Heart-Beat Sounds
本論文は、PhysioNet 2022 チャレンジの音声データを用いて、心雑音の検出を目的とした自己教師付き対照的学習アプローチ、Listen2YourHeartを提案する。2022年および2016年のデータセットからの増幅処理を施したPCGウィンドウを用いて、対照的SSLを用いたCNNバックボーンの事前学習により、心雑音検出で0.737(13位)の重み付き正確度、臨床的結果予測で11,946(7位)のコストスコアを達成し、完全に教師ありのベースラインを上回った。
Heart murmurs are abnormal sounds present in heartbeats, caused by turbulent blood flow through the heart. The PhysioNet 2022 challenge targets automatic detection of murmur from audio recordings of the heart and automatic detection of normal vs. abnormal clinical outcome. The recordings are captured from multiple locations around the heart. Our participation investigates the effectiveness of selfsupervised learning for murmur detection. We train the layers of a backbone CNN in a self-supervised way with data from both this year's and the 2016 challenge. We use two different augmentations on each training sample, and normalized temperature-scaled cross-entropy loss. We experiment with different augmentations to learn effective phonocardiogram representations. To build the final detectors we train two classification heads, one for each challenge task. We present evaluation results for all combinations of the available augmentations, and for our multipleaugmentation approach. Our team's, Listen2YourHeart, SSL murmur detection classifier received a weighted accuracy score of 0.737 (ranked 13th out of 40 teams) and an outcome identification challenge cost score of 11946 (ranked 7th out of 39 teams) on the hidden test set.
研究の動機と目的
- 限られたデータ量で弱くラベル付けされたPCGデータからの堅牢な表現学習のための自己教師付き学習フレームワークの開発。
- さまざまなデータ増幅処理が、下流のPCG分類性能を向上させる有効性の評価。
- リソースが限られた臨床音声環境における完全に教師ありの微調整に依存しないモデルの汎化性能の向上。
- 多様な増幅処理を用いた事前学習により、臨床DNN応用におけるモデルのドリフトや一般化性能の低さという課題への対処。
- 心雑音検出および臨床的結果分類の分野で、PhysioNet 2022 チャレンジにおける最先端の性能を達成すること。
提案手法
- 本手法は、2022年および2016年PhysioNetデータセットからの5秒間PCGウィンドウを用いて、対照的自己教師付き学習フレームワークを採用し、CNNバックボーンを事前学習する。
- 各入力ウィンドウは、異なる変換を用いて2回ずつ増幅処理される。変換には、ハイパス/ローパスフィルタ(250–750 Hz)、リバース再生、反転、ランダムスケーリング(0.5–2.0)、ノイズ注入(一様分布、範囲0.002–0.02)、2倍のアップサンプリングと対称的クロップが含まれる。
- モデルは、同じ信号の増幅処理によるペア(ポジティブペア)と、異なる信号由来のペア(ネガティブペア)の間で、正規化された温度調整付き交差エントロピー損失を最小化する。温度パrameterは0.1として設定される。
- 最終的な分類ヘッドは、事前学習済みバックボーンからの固定された特徴表現に線形プロキシヘッドを適用し、下流タスクで微調整される。
- 訓練にはLARS最適化アルゴリズムを用い、5エポックにわたり線形ウェルコンを用いてピーク学習率0.1に到達させ、その後コサイン減衰を適用する。5エポックにわたり性能向上が見られない場合は早期停止を行う。
- 患者レベルの予測は、ウィンドウレベルの予測を記録レベルに集約し、その後患者レベルのラベルに集約することで得られる。
実験結果
リサーチクエスチョン
- RQ1ラベル付けされたデータが限られる状況下で、自己教師付き対照的学習がPCG信号の表現学習を改善できるか?
- RQ2どの組み合わせのデータ増幅処理が、PCG分類に最も情報量が多く、一般化可能な表現を生み出すか?
- RQ32016年のチャレンジデータを含むより大規模で多様なデータセットを用いた事前学習が、2022年チャレンジの下流性能を向上させるか?
- RQ4完全に教師ありベースラインと比較して、自己教師付きモデルの隠しテストセットにおける重み付き正確度およびコストスコアの性能はどの程度か?
- RQ5チャレンジの隠しテストセットにおける性能から、モデルが未学習データに対して効果的に一般化できるか?
主な発見
- 自己教師付きモデルは、心雑音検出タスクで0.737の重み付き正確度を達成し、PhysioNet 2022 チャレンジで40チーム中13位となった。
- 臨床的結果予測では、コストスコア11,946を達成し、39チーム中7位となり、完全に教師ありベースラインを上回った。
- 最も高い性能を示した増幅処理の組み合わせは、最初のビューで250 Hzハイパスフィルタに加えリバース再生と反転を適用し、2番目のビューで一様ノイズ(範囲0.02)とアップサンプリングを適用したものであった。
- 心雑音検出(0.700 vs. 0.558の重み付き正確度)および結果予測(0.764 vs. 0.750の重み付き正確度)の両方で、完全に教師ありベースラインを上回った。
- 特に、反転+リバースやローパスフィルタ+ノイズといった多様な増幅処理を組み合わせた場合、同一の増幅処理を適用した場合(0.85)より高い正確度(0.84)を示し、多様性が表現品質を向上させることを示唆した。
- モデルは強力な一般化性能を示し、検証正確度0.671、テスト正確度0.737を達成し、未学習データに対しても堅牢であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。