Skip to main content
QUICK REVIEW

[논문 리뷰] Score-informed syllable segmentation for a cappella singing voice with convolutional neural networks

Jordi Pons, Rong Gong|arXiv (Cornell University)|2017. 07. 12.
Music and Audio Processing참고 문헌 16인용 수 3
한 줄 요약

이 논문은 음악 점수의 지속 시간 사전 지식을 활용하여 아카펠라 정구 노래의 음절 분할을 향상시키기 위해 새로운 컨볼루션 신경망(CNN) 아키텍처를 제안한다. 이는 음절 시작 검출 기능(ODF) 추정을 향상시키고, 이후 음악 점수의 지속 시간 사전 지식을 활용한 점수 기반 비터비 알고리즘을 통해 경계 검출을 정밀하게 개선한다. 제안된 방법은 다중 척도 시간-주파수 특징을 효과적으로 포착하고, 점수에서 유래한 사전 지식을 통합하여 분할 오류를 줄임으로써 최신 기술보다 뛰어난 성능을 보인다.

ABSTRACT

This paper introduces a new score-informed method for the segmentation of jingju a cappella singing phrase into syllables. The proposed method estimates the most likely sequence of syllable boundaries given the estimated syllable onset detection function (ODF) and its score. Throughout the paper, we first examine the jingju syllables structure and propose a definition of the term "syllable onset". Then, we identify which are the challenges that jingju a cappella singing poses. Further, we investigate how to improve the syllable ODF estimation with convolutional neural networks (CNNs). We propose a novel CNN architecture that allows to efficiently capture different time-frequency scales for estimating syllable onsets. In addition, we propose using a score-informed Viterbi algorithm -instead of thresholding the onset function-, because the available musical knowledge we have (the score) can be used to inform the Viterbi algorithm in order to overcome the identified challenges. The proposed method outperforms the state-of-the-art in syllable segmentation for jingju a cappella singing. We further provide an analysis of the segmentation errors which points possible research directions.

연구 동기 및 목표

  • 교육 평가에서 정확한 발음과 음정이 중요한 아카펠라 정구 노래에서 자동 음절 분할 문제를 해결하기 위해.
  • 정구 음악의 특수한 발음 구조(두상, 배, 꼬리)와 연주 관행을 고려하여 '음절'과 '음절 시작'을 정의하기 위해.
  • 다양한 시간-주파수 척도를 포착할 수 있도록 다중 필터 CNN 아키텍처를 설계하여 음절 시작 검출 성능을 향상시키기 위해.
  • 특히 음절 지속 시간 사전 지식을 활용하여 비터비 디코딩 과정을 개선하고, 분할의 강건성을 높이기 위해 음악 점수 정보를 통합하기 위해.
  • 분할 오류를 분석하고, 점수-연주 불일치 및 모호한 음절 전환과 같은 주요 실패 원인을 규명하여 향후 개선 방향을 제시하기 위해.

제안 방법

  • 다양한 필터 형상이 첫 번째 컨볼루션 레이어에 적용된 다중 척도 CNN을 제안하여 음절 시작 검출을 위한 보완적인 시간적 및 톤 특징을 학습한다.
  • 시간 역동성에 최적화된 모델과 스펙트럼 톤 특징에 최적화된 모델 간의 예측을 후기 융합함으로써 전체 ODF 추정 성능을 향상시킨다.
  • 상태 전이 확률이 음악 점수에서 유도된 사전 지속 시간 분포를 기반으로 모델링된 점수 기반 비터비 알고리즘을 설계한다.
  • 추정된 ODF와 점수 기반 지속 시간 사전 지식을 사용하여 가장 가능성이 높은 음절 경계 시퀀스를 디코딩하며, 단순 임계값 설정이나 피크 검출 방식을 대체한다.
  • 음절 지속 시간에 대한 사전 지식과 연주 편차 정보를 통합함으로써, 진폭 변동과 연주 변동성에 대한 강건성을 향상시킨다.
  • 디코딩 과정은 점수와 일치하는 고정된 음절 수를 가정하며, 이는 구조적 추론을 가능하게 하지만 점수에 존재하지 않는 삽입 또는 삭제 처리에는 제한이 있다.

실험 결과

연구 질문

  • RQ1딥 러닝 기반 접근법은 기존 수작업 특징 기반 방법에 비해 정구 아카펠라 노래에서 음절 시작 검출 성능을 어떻게 향상시킬 수 있는가?
  • RQ2특히 음절 지속 시간 사전 지식이 연주 변동성 존재 하에서 음절 경계 검출 정확도에 얼마나 기여하는가?
  • RQ3정구 노래에서 분할 오류의 주요 원인은 무엇이며, 이를 체계적으로 분석하고 완화할 수 있는가?
  • RQ4다른 시간-주파수 척도에 특화된 CNN의 후기 융합은 단일 아키텍처 모델에 비해 더 나은 ODF 추정 성능을 낼 수 있는가?
  • RQ5임계값 설정이나 피크 검출 방식에 비해 비터비 디코딩을 통한 사전 지식 통합 방식은 분할 강건성 측면에서 어떻게 비교되는가?

주요 결과

  • 다양한 필터 형상과 후기 융합을 적용한 제안된 CNN 아키텍처는 슐레터 등(2016)의 최신 기술 기반 ODF 추정기보다 음절 시작 검출 성능에서 뛰어나며, 특히 진폭 변동에 대한 처리 능력에서 유의미한 향상을 보였다.
  • 점수 기반 비터비 알고리즘은 음악 점수에서 유도된 지속 시간 사전 지식을 통합함으로써 분할 정확도를 크게 향상시켰으며, 노이즈가 많은 ODF 피크로 인한 오진 억제에 기여했다.
  • 분할 오류의 71.42%는 점수-연주 불일치로 인한 것으로 분석되었으며, 이는 점수에 반영되지 않은 음절 삽입, 삭제, 지속 시간 이격 등이 포함되었다.
  • 15.61%의 오류는 모호한 음절 전환(예: 장음소-장음소 또는 장음소-반장음소 전환)에서 기인했으며, 이는 명확한 스펙트럼적 시작이 없어 기존의 시작 검출 함수로는 감지하기 어려운 영역이었다.
  • 기존 최신 기술보다 더 뛰어난 성능을 정구 아카펠라 노래 데이터셋에서 보였지만, 연주 편차 및 점진적 전환 처리에 대한 과제는 여전히 남아 있었다.
  • 오류 분석 결과, 향후 개선 방향은 공백 문자 모델링, 마지막 음절 연장 처리, 그리고 이산적인 시간 포인트가 아닌 시작 영역 감지에 초점을 맞추는 것이 바람직하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.