Skip to main content
QUICK REVIEW

[논문 리뷰] Peking Opera Synthesis via Duration Informed Attention Network

Yusong Wu, Shengchen Li|arXiv (Cornell University)|2020. 08. 07.
Music and Audio Processing참고 문헌 24인용 수 4
한 줄 요약

이 논문은 음악 점수에서의 표현적 베이징 옛가락 노래 합성에 적합한 지속시간 정보를 반영한 어텐션 네트워크(DurIAN)와 라그랑주 승수 최적화를 통한 혼합 밀도 네트워크(MDN)를 통합한 방법을 제안한다. 데이터 기반 최적화를 통해 음소 지속시간을 모델링하고 실제 노래에서 유도된 의사 음악 점수를 사용함으로써, 규칙 기반 방법에 비해 지속시간 예측 오차가 크게 감소하고 더 자연스러운 톤 컨투어를 달성한다. 이는 음악 점수에서 고품질의 표현적 합성을 가능하게 한다.

ABSTRACT

Peking Opera has been the most dominant form of Chinese performing art since around 200 years ago. A Peking Opera singer usually exhibits a very strong personal style via introducing improvisation and expressiveness on stage which leads the actual rhythm and pitch contour to deviate significantly from the original music score. This inconsistency poses a great challenge in Peking Opera singing voice synthesis from a music score. In this work, we propose to deal with this issue and synthesize expressive Peking Opera singing from the music score based on the Duration Informed Attention Network (DurIAN) framework. To tackle the rhythm mismatch, Lagrange multiplier is used to find the optimal output phoneme duration sequence with the constraint of the given note duration from music score. As for the pitch contour mismatch, instead of directly inferring from music score, we adopt a pseudo music score generated from the real singing and feed it as input during training. The experiments demonstrate that with the proposed system we can synthesize Peking Opera singing voice with high-quality timbre, pitch and expressiveness.

연구 동기 및 목표

  • 베이징 옛가락 노래 합성에서 즉흥 연주와 표현적 변형으로 인한 리듬 및 톤 불일치 문제를 해결하기 위해.
  • 베이징 옛가락에서 흔히 나타나는 장시간 지속, 비표준 음소 구조에서 규칙 기반 음소 지속시간 스케일링(예: Fitting Heuristic)의 한계를 극복하기 위해.
  • 실제 노래 웨이브폼에서 유도된 의사 음악 점수를 생성함으로써 음악 점수 입력과 음성 출력 간의 정렬을 향상시키기 위해.
  • 베이징 옛가락의 떨림, 톤 변화, 톤 품질 특성을 잘 반영한 고해상도 표현적 노래 합성을 가능하게 하기 위해.
  • 객관적 지표와 주관적 평균 의견 점수(MOS) 테스트를 통해 시스템 성능을 평가하기 위해.

제안 방법

  • 예측된 톤과 음소 시퀀스에 조건부로 스펙트로그램 특징을 생성하기 위해 DurIAN 기반의 순차적 프레임워크를 사용한다.
  • 라그랑주 승수 최적화를 통한 맥락 인식 혼합 밀도 네트워크(MDN)를 제안하여 규칙 기반 Fitting Heuristic 방법을 대체한다.
  • 라그랑주 승수 방법은 예측된 전체 음소 지속시간이 음악 점수에서 주어진 노트 지속시간과 일치하도록 제약 조건을 강제함으로써 최적의 지속시간 시퀀스 추정을 가능하게 한다.
  • 메로디 트랜스크립션 알고리즘을 통해 실제 노래 웨이브폼에서 의사 음악 점수를 생성하며, 이는 학습 중에 음성 특징과 입력 점수 간의 정렬을 위해 사용된다.
  • 시간적 의존성을 모델링하고 표현적 톤 컨투어를 생성하기 위해 음소 인코더에 CBHG 모듈과 톤 조건부 디코더를 사용한다.
  • 음소, 지속시간, 음역 톤 주파수를 주석 처리한 고유한 베이징 옛가락 데이터셋을 사용하여 모델을 학습한다.

실험 결과

연구 질문

  • RQ1데이터 기반 지속시간 모델링 접근법이 베이징 옛가락에서 매우 변동성이 큰 음소 지속시간을 모델링하는 데 있어 규칙 기반 Fitting Heuristic 방법보다 우수한가?
  • RQ2실제 노래에서 유도된 의사 음악 점수가 입력 점수와 생성된 오디오 간의 정렬 향상에 얼마나 효과적인가?
  • RQ3제안된 시스템이 베이징 옛가락 노래의 표현적 떨림과 톤 변화를 어느 정도 잘 모델링할 수 있는가?
  • RQ4MDN에 라그랑주 최적화를 조합할 경우, 표준 회귀 또는 소프트맥스 기반 방법에 비해 더 정확한 음소 지속시간 예측을 얻을 수 있는가?
  • RQ5합성된 베이징 옛가락 노래의 주관적 자연스러움은 실제 연주와 비교해 어떻게 되는가?

주요 결과

  • 제안된 BiLSTM-MDN-Lag 지속시간 모델은 모든 음표에서 평균 음소 지속시간 예측 오차가 8.91 프레임으로, Fitting Heuristic 기반 베이스라인(19.61 프레임)과 다른 변종들보다 뚜렷이 뛰어나다.
  • 2초 미만의 짧은 음표에 대해서는 제안된 방법이 오직 3.24 프레임의 예측 오차를 기록하여 단기적 맥락에서 뛰어난 정확도를 보였다.
  • 주관적 청취 테스트에서 평균 의견 점수(MOS)는 3.34를 기록하여 자연스러움과 이해 가능성 수준이 보통 수준임을 나타냈다.
  • 생성된 톤 컨투어는 풍부한 떨림과 역동적인 전이를 보이며, 실제 베이징 옛가락 노래의 표현적 특성을 밀도 있게 재현했다.
  • 장시간 음표에서 BiLSTM-MSE-Fit 및 BiLSTM-MDN-Fit에 비해 BiLSTM-MDN-Lag 모델이 더 뛰어난 성능을 보였는데, 이는 주로 주요 부등음을 잘못 식별하는 오류를 방지할 수 있었기 때문이다.
  • 학습 중 의사 음악 점수를 활용함으로써 실제 노래와 입력 음악 점수 간의 일관성 문제를 효과적으로 해결했으며, 학습 및 추론 단계에서의 정렬 향상에 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.