[논문 리뷰] Listen2YourHeart: A Self-Supervised Approach for Detecting Murmur in Heart-Beat Sounds
이 논문은 PhysioNet 2022 챌린지의 음성 데이터를 활용하여 심장 박동음(PCG) 신호에서 심장 혈류음 감지를 위한 자기지도 학습 대비 학습 접근법인 Listen2YourHeart를 제안한다. 2022년 및 2016년 데이터셋의 보강된 PCG 윈도우를 사용하여 대비 학습 기반의 자기지도 학습(contrastive SSL)으로 CNN 기반 모델을 사전 훈련한 결과, 혈류음 감지에서 가중 정확도 0.737(13위)를 기록하였고, 임상 결과 예측에서는 비용 점수 11,946(7위)를 기록하여 완전히 지도 학습 기반의 베이스라인을 능가하였다.
Heart murmurs are abnormal sounds present in heartbeats, caused by turbulent blood flow through the heart. The PhysioNet 2022 challenge targets automatic detection of murmur from audio recordings of the heart and automatic detection of normal vs. abnormal clinical outcome. The recordings are captured from multiple locations around the heart. Our participation investigates the effectiveness of selfsupervised learning for murmur detection. We train the layers of a backbone CNN in a self-supervised way with data from both this year's and the 2016 challenge. We use two different augmentations on each training sample, and normalized temperature-scaled cross-entropy loss. We experiment with different augmentations to learn effective phonocardiogram representations. To build the final detectors we train two classification heads, one for each challenge task. We present evaluation results for all combinations of the available augmentations, and for our multipleaugmentation approach. Our team's, Listen2YourHeart, SSL murmur detection classifier received a weighted accuracy score of 0.737 (ranked 13th out of 40 teams) and an outcome identification challenge cost score of 11946 (ranked 7th out of 39 teams) on the hidden test set.
연구 동기 및 목표
- 제한적이고 약한 레이블이 부여된 PCG 데이터로부터 강건한 표현 학습을 위한 자기지도 학습 프레임워크를 개발하는 것.
- 다양한 데이터 보정 기법이 PCG 분류 성능 향상에 기여하는지를 평가하는 것.
- 저자원 임상 음성 환경에서 완전히 지도 학습 기반의 미세조정에 대한 의존도를 줄이고 모델 일반화 능력을 향상시키는 것.
- 다양한 보정 기법에 기반한 사전 훈련을 통해 임상 DNN 응용에서의 모델 드리프트 및 일반화 부족 문제를 해결하는 것.
- 심장 혈류음 감지 및 임상 결과 분류 과제에서 최신 기술 수준의 성능을 달성하는 것.
제안 방법
- 이 방법은 2022년 및 2016년 PhysioNet 데이터셋의 5초 PCG 윈도우에서 사전 훈련된 CNN 기반 모델을 사용하는 대비 자기지도 학습 프레임워크를 적용한다.
- 각 입력 윈도우는 두 번의 보정을 거치며, 고역통과/저역통과 필터(250–750 Hz), 뒤로감기, 반전, 랜덤 스케일링(0.5–2.0), 노이즈 주입(균일 분포, 범위 0.002–0.02), 2배 업샘플링 후 대칭 크롭핑 등의 변환을 적용한다.
- 모델은 동일한 신호에서 유도된 양성 쌍(positive pairs)과 다른 신호에서 유도된 음성 쌍(negative pairs) 간의 정규화된 온도 조정형 교차 엔트로피 손실을 최소화하며, 온도 값은 0.1로 설정한다.
- 최종 분류기 헤드는 사전 훈련된 기반 모델의 고정된 특징 표현에서 선형 투영 헤드를 사용하여 훈련하며, 하류 작업에 대해 미세조정한다.
- 훈련에는 LARS 옵timizer를 사용하며, 5 에포크 동안 선형 웜업을 통해 피크 학습률 0.1에 도달한 후 코스인 감쇠를 적용하고, 성능 향상이 없어진 이후 5 에포크 동안은 조기 종료를 시행한다.
- 환자 수준의 예측은 윈도우 수준의 예측을 기록 수준으로 집계한 후 환자 수준의 레이블로 통합하여 도출된다.
실험 결과
연구 질문
- RQ1레이블이 부족한 상황에서 자기지도 대비 학습이 심장 박동음 신호의 표현 학습을 향상시킬 수 있는가?
- RQ2어떤 데이터 보정 조합이 PCG 분류에 대해 가장 정보적이고 일반화 가능한 표현을 생성하는가?
- RQ32016년 챌린지 데이터를 포함한 더 큰 이질적 데이터셋에서 사전 훈련을 수행하면 2022년 챌린지의 하류 성능이 향상되는가?
- RQ4숨겨진 테스트 세트에서 자기지도 모델의 성능이 완전히 지도 학습 기반 베이스라인 대비 가중 정확도 및 비용 점수 측면에서 어떻게 비교되는가?
- RQ5도전 과제의 숨겨진 테스트 세트에서 성능이 우수함으로써, 모델이 새로운 데이터에 효과적으로 일반화되는가?
주요 결과
- 자기지도 모델은 혈류음 감지 과제에서 가중 정확도 0.737을 기록하여 PhysioNet 2022 챌린지에서 40개 팀 중 13위를 기록하였다.
- 임상 결과 예측 과제에서 비용 점수 11,946을 기록하여 39개 팀 중 7위를 기록하였으며, 완전히 지도 학습 기반 베이스라인을 능가하였다.
- 가장 높은 성능를 보인 보정 조합은 첫 번째 뷰에서 250 Hz 고역통과 필터링에 더해 뒤로감기 및 반전을 적용한 조합이며, 두 번째 뷰에서는 균일 노이즈(범위 0.02)에 업샘플링을 적용한 조합이었다.
- 혈류음 감지(0.700 대비 0.558 가중 정확도) 및 결과 예측(0.764 대비 0.750 가중 정확도) 과제에서 모두 완전히 지도 학습 기반 베이스라인을 초월하였다.
- 특히 서로 다른 보정 기법(예: 반전 + 뒤로감기 또는 저역통과 필터 + 노이즈)을 사용한 다중 보정은 동일한 보정 기법을 사용한 경우보다 높은 정확도(0.84)를 기록하였고, 이는 다양성이 표현 품질 향상에 기여함을 시사한다.
- 모델는 강력한 일반화 능력을 보였으며, 검증 정확도 0.671과 테스트 정확도 0.737을 기록하여 새로운 데이터에 대한 강인함을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.