[논문 리뷰] End-to-End Speaker Height and age estimation using Attention Mechanism with LSTM-RNN
이 논문은 음성 특징의 장기적 의존성을 포착하기 위해 LSTM-RNN와 통합된 새로운 크로스 어텐션 메커니즘을 사용하여 종단 간 스피커 신장 및 연령 추정 모델을 제안한다. 시간 프레임과 인코더 유닛 양쪽에 동시에 주의를 기울임으로써, TIMIT 데이터셋에서 남성의 경우 6.92cm, 여성의 경우 6.34cm의 RMSE로 최신 기술 성능(SOTA)을 달성하였으며, 연령 추정의 경우 남성 7.85년, 여성 8.75년의 RMSE를 기록하였다. 또한 어조음소가 추정에 가장 유용한 것으로 드러났다.
Automatic height and age estimation of speakers using acoustic features is widely used for the purpose of human-computer interaction, forensics, etc. In this work, we propose a novel approach of using attention mechanism to build an end-to-end architecture for height and age estimation. The attention mechanism is combined with Long Short-Term Memory(LSTM) encoder which is able to capture long-term dependencies in the input acoustic features. We modify the conventionally used Attention -- which calculates context vectors the sum of attention only across timeframes -- by introducing a modified context vector which takes into account total attention across encoder units as well, giving us a new cross-attention mechanism. Apart from this, we also investigate a multi-task learning approach for jointly estimating speaker height and age. We train and test our model on the TIMIT corpus. Our model outperforms several approaches in the literature. We achieve a root mean square error (RMSE) of 6.92cm and6.34cm for male and female heights respectively and RMSE of 7.85years and 8.75years for male and females ages respectively. By tracking the attention weights allocated to different phones, we find that Vowel phones are most important whistlestop phones are least important for the estimation task.
연구 동기 및 목표
- 음성 특징을 이용하여 종단 간 딥러닝 프레임워크를 개발하여 스피커의 신장과 연령을 동시에 추정하는 것.
- 시간 프레임과 인코더 유닛 양쪽에 주의를 기울이는 새로운 크로스 어텐션 메커니즘을 도입하여 성능을 향상시키는 것.
- 다중 작업 학습과 성별을 특징으로 삼는 것이 추정 정확도에 미치는 영향을 조사하는 것.
- 어텐션 가중치를 통해 어떤 음소 단위가 스피커 신체적 특성 추정에 가장 유용한지 분석하는 것.
제안 방법
- 모델은 원방향 LSTM 인코더를 사용하여 원시 음성 특징으로부터 장기적 의존성을 추출한다.
- 새로운 크로스 어텐션 메커니즘은 두 개의 컨텍스트 벡터를 계산한다: 하나는 시간 프레임을 통해, 다른 하나는 인코더 히든 유닛을 통해 주의를 기울여 계산한다.
- 최종 컨텍스트 벡터는 두 컨텍스트 벡터를 연결하고 변환하여 스피커 특성을 더 잘 표현하도록 구성된다.
- 모델은 다중 작업 학습을 활용하여 신장과 연령을 동시에 예측하며, 작업 간 표현 학습을 공유한다.
- 성별은 이중 입력 특징으로 통합되어 추정 성능 향상에 기여한다.
- 드롭아웃(20%)을 사용하여 LSTM 및 밀집층에서 과적합을 방지하고, Adam 옵timizer를 사용해 네트워크를 훈련시킨다.
실험 결과
연구 질문
- RQ1시간 프레임과 인코더 유닛 양쪽에 주의를 기울이는 크로스 어텐션 메커니즘이 기존 어텐션보다 스피커 신장 및 연령 추정 성능을 향상시키는가?
- RQ2신장과 연령 추정을 위한 다중 작업 학습이 단일 작업 학습 대비 모델 성능에 어떤 영향을 미치는가?
- RQ3성별 정보를 특징으로 통합하면 신장 및 연령 예측 정확도가 향상되는가?
- RQ4어텐션 가중치를 통해 어떤 음소 단위(예: 모음, 정음)가 스피커 신장 및 연령 추정에 가장 예측력이 있는가?
주요 결과
- 제안된 크로스 어텐션 메커니즘이 기존 어텐션 및 마지막 히든 상태 기반 베이스라인을 모두 능가하여 모든 설정에서 가장 낮은 RMSE를 기록하였다.
- TIMIT 테스트 세트에서 남성의 경우 6.92cm, 여성의 경우 6.34cm의 RMSE로 신장 추정 성능을 달성하였다.
- 연령 추정의 경우 남성 7.85년, 여성 8.75년의 RMSE를 기록하여 다수의 이전 방법을 능가하였다.
- 어텐션 분석 결과 어두음소가 가장 높은 어텐션 가중치를 받았으며, 이는 후각 트랙트 길이 및 스피커 특성과의 강한 상관관계를 시사한다.
- 정음 및 일부 탈음음소는 가장 낮은 어텐션 가중치를 받았는데, 이는 갈락트랄 후각 트랙트에 거의 관여하지 않기 때문일 것이다.
- 성별을 이중 특징으로 통합함으로써 모든 메트릭에서 성능 향상이 일관되게 관찰되었으며, 이는 추정 작업에서 성별의 중요성을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.