Skip to main content
QUICK REVIEW

[논문 리뷰] Speaking Style Authentication Using Suprasegmental Hidden Markov Models

Ismail Shahin|arXiv (Cornell University)|2017. 06. 29.
Speech and Audio Processing참고 문헌 21인용 수 9
한 줄 요약

이 논문은 음고, 에너지, 리듬과 같은 음성 특성에 기반해 신원을 확인하기 위해 초음절적 음성 모델(SPHMM)을 사용한 발화 스타일 인증 시스템을 제안한다. 이 시스템은 중립 스타일 기준 평균 99%의 정확도를 달성했으며, 느린 말하기 스타일에서는 최대 85%의 정확도를 기록하여 분노, 공포, 외침 등 다양한 발화 스타일에서도 높은 성능을 보였다.

ABSTRACT

The importance of speaking style authentication from human speech is gaining an increasing attention and concern from the engineering community. The importance comes from the demand to enhance both the naturalness and efficiency of spoken language human-machine interface. Our work in this research focuses on proposing, implementing, and testing speaker-dependent and text-dependent speaking style authentication (verification) systems that accept or reject the identity claim of a speaking style based on suprasegmental hidden Markov models (SPHMMs). Based on using SPHMMs, our results show that the average speaking style authentication performance is: 99%, 37%, 85%, 60%, 61%, 59%, 41%, 61%, and 57% belonging respectively to the speaking styles: neutral, shouted, slow, loud, soft, fast, angry, happy, and fearful.

연구 동기 및 목표

  • 더 나은 인간-기계 상호작용을 위해 강건한 발화 스타일 기반 신원 인증 시스템을 개발하기 위해.
  • 단지 발화자 신원이나 말 내용이 아닌, 발화 스타일에 기반한 신원 확인 과제를 해결하기 위해.
  • 초음절적 특징이 다양한 발화 스타일을 구분하는 데 얼마나 효과적인지 평가하기 위해.
  • 프로소디크 특징에 기반한 HMM을 학습시켜 발화 스타일 인증의 기준을 설정하기 위해.
  • 정서적 및 표현적 발화 변형이 인증 정확도에 미치는 영향을 분석하기 위해.

제안 방법

  • 시스템은 음성 신호에서 추출한 음고, 에너지, 제로크로스 레이트와 같은 초음절적 특징을 사용해 발화 스타일을 모델링한다.
  • 프로소디크 특징에 기반해 초음절적 히든 마르코프 모델(SPHMM)을 학습시켜 발화 스타일의 시간적 동적 특성을 표현한다.
  • 각 발화자에 대해 특정 문장에 대해 발화 스타일에 따라 음성 모델을 학습시키는 발화자 독립적·문장 독립적 학습 방식을 사용한다.
  • 음성 프레임에서 유도된 특징 벡터를 군집화하여 HMM 상태 공간 내에서 구분되는 발화 스타일을 표현한다.
  • 시험 문장에 대해 각 발화자-스타일 모델 하에서의 가능도를 계산하고 가장 높은 점수를 받은 매칭을 선택함으로써 인증을 수행한다.
  • 등가오류율(EER)과 9개의 구분 가능한 발화 스타일에서의 정확도를 사용해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1초음절적 특징은 발화 스타일을 구분하는 데 효과적으로 작용할 수 있는가?
  • RQ2SPHMM의 성능은 중립, 분노, 외침과 같은 다양한 발화 스타일 간에 어떻게 달라지는가?
  • RQ3문장 의존성과 발화자 의존성이 인증 정확도에 어떤 영향을 미치는가?
  • RQ4정서적 및 표현적 발화 변형이 시스템 성능을 얼마나 떨어뜨리거나 향상시키는가?
  • RQ5제안된 SPHMM 기반 방법은 기존의 발화자 인증 시스템과 비교해 스타일 기반 정확도 측면에서 어떻게 다른가?

주요 결과

  • 중립 발화 스타일 기준으로 시스템은 99%의 인증 정확도를 기록했으며, 테스트한 모든 스타일 중에서 가장 높은 성능을 보였다.
  • 외침 스타일에서는 정확도가 37%로 크게 떨어져 극단적인 음성 강도를 모델링하는 데 어려움이 있음을 시사한다.
  • 느린 말하기 스타일은 85%의 정확도를 기록해 제어된, 의도적인 말하기 스타일에서 뛰어난 성능을 보였다.
  • 큰 소리, 작게, 빠르게, 분노, 기쁨, 공포 스타일은 각각 60%, 61%, 59%, 41%, 61%, 57%의 정확도를 기록해 중간에서 높은 신뢰성을 보였다.
  • 결과적으로 SPHMM은 제어된 조건이나 극단적이지 않은 표현적 발화 스타일에서 프로소디크 변동을 효과적으로 모델링할 수 있음을 보여주었다.
  • 연구는 초음절적 특징이 스타일 기반 인증에 매우 구분력이 있으며, 말의 정서적 또는 신체적 강도에 따라 성능에 상당한 차이가 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.