Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Neural Network for Automatic Assessment of Dysphonia

Mário Garcia, Ana Lorena Rosset|arXiv (Cornell University)|2022. 02. 25.
Speech and Audio Processing인용 수 6
한 줄 요약

이 연구는 음성 기록에서 파wer cepstrum 입력을 사용하여 GRBAS 전반적인 음성 이상 정도(G)를 예측하는 딥 네ural 네트워크를 제안한다. 아키텍처는 진폭/주파수 변동과 잡음을 탐지하도록 설계되었으며, 인간 내부 평가자 신뢰도 수준에 근접한 성능을 달성하여 인간 간 평가자 간 일致성보다 뛰어나며, 자동화되고 표준화된 음성 평가의 강력한 잠재력을 보여준다.

ABSTRACT

The purpose of this work is to contribute to the understanding and improvement of deep neural networks in the field of vocal quality. A neural network that predicts the perceptual assessment of overall severity of dysphonia in GRBAS scale is obtained. The design focuses on amplitude perturbations, frequency perturbations, and noise. Results are compared with performance of human raters on the same data. Both the precision and the mean absolute error of the neural network are close to human intra-rater performance, exceeding inter-rater performance.

연구 동기 및 목표

  • GRBAS 척도에서 전반적인 음성 이상 정도(G)의 자동 예측을 위한 딥 네럴 네트워크 개발
  • 인간 청각-지각 평가를 대체하거나 보완하여 임상 음성 평가의 주관성과 변동성을 줄이기
  • 음성 품질의 핵심 음향적 연관 요소인 진폭 및 주파수 변동, 잡음을 포착하는 네트워크 아키텍처 설계
  • 모델 성능을 인간 평가자 간 변동성과 비교하여 내부 평가자 일致성 및 외부 평가자 일치도를 기준으로 평가하기
  • 강건하고 일반화 가능한 아키텍처와 평가를 통해 향후 임상 적용을 위한 AI 기반 음성 품질 분류기의 기초 마련

제안 방법

  • 모델는 두 개의 분기 아키텍처를 가진 딥 네럴 네트워크를 사용한다: 한 분기는 진폭 및 주파수 변동을 처리하고, 다른 분기는 잡음을 중심으로 하며, 양측 모두 컨볼루션 레이어를 활용한다.
  • 입력 특징은 음성 신호의 파워 셰스트럼에서 유도되며, 음성 품질에 관련된 스펙트럼 엔벨롭 및 주기성 정보를 포함한다.
  • 다양한 커널 크기를 가진 다중 컨볼루션 레이어를 사용하여 다양한 스무딩 척도에서 패턴을 포착하며, 이미지 인식에서의 스칼라 공간 이론에 영향을 받는다.
  • 최종 분류를 위해 밀집 레이어를 포함하며, 출력은 예측된 GRBAS G 점수(0–3)가 된다.
  • 성능 평가는 인간 평가자 평가 결과와의 비교를 통해 이루어지며, 내부 평가자 일치도 및 외부 평가자 일치도를 기준 기준으로 사용한다.
  • 모델는 인간 평가된 GRBAS 점수가 포함된 음성 기록 데이터셋을 사용하여 훈련되며, 평균 절대 오차와 분류 정확도를 지표로 사용한다.

실험 결과

연구 질문

  • RQ1딥 네럴 네트워크는 인간 평가자 수준과 유사한 성능으로 GRBAS 척도에서 전반적인 음성 이상 정도(G)를 자동으로 평가할 수 있는가?
  • RQ2제안된 신경망의 성능는 인간 전문가 간 내부 평가자 일치도 및 외부 평가자 일치도와 비교해 어떻게 되는가?
  • RQ3진폭/주파수 변동과 잡음에 특화된 이중 분기 아키텍처는 GRBAS G 예측 정확도 향상에 어느 정도 기여하는가?
  • RQ4다양한 스무딩 척도(다른 커널 크기)는 모델이 음성 품질 특징을 탐지하는 능력을 향상시키는 데 어떤 역할을 하는가?
  • RQ5이 모델을 더 넓은 임상 인구군과 환경으로 일반화하는 데 있어 주요 제한 요소는 무엇인가?

주요 결과

  • 딥 네럴 네트워크는 인간 내부 평가자 신뢰도 수준과 근접한 평균 절대 오차(MAE)를 달성하여 개별 인간 평가자와의 일관성이 매우 높음을 시사한다.
  • 모델의 성능는 인간 간 평가자 간 일치도를 초월하여, 음성 평가에서 인간의 변동성을 뛰어넘는다는 것을 입증한다.
  • 이중 분기 아키텍처는 진폭/주파수 변동과 잡음과 관련된 고유한 음향 패턴을 효과적으로 포착하여 G 예측 향상에 기여한다.
  • 다양한 커널 크기(다른 스무딩 척도)의 사용은 특징 추출 능력을 향상시켰으며, 패턴 인식 분야의 스칼라 공간 이론 원칙과 일치한다.
  • 성능는 뛰어나지만, 특히 인구 통계적 다양성과 녹음 조건의 다양성 측면에서 훈련 데이터의 크기와 변동성으로 인해 일반화 능력이 제한되어 있다.
  • 연구는 모델가 강력한 초석을 마련했지만, 임상 적용을 위해서는 더 크고 다양한 데이터셋이 필요하며, 아키텍처의 추가 정교화가 요구된다고 결론을 내린다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.