Skip to main content
QUICK REVIEW

[논문 리뷰] A Hybrid of Deep Audio Feature and i-vector for Artist Recognition

Jiyoung Park, Donghyun Kim|arXiv (Cornell University)|2018. 07. 24.
Music and Audio Processing참고 문헌 7인용 수 4
한 줄 요약

이 논문은 음악 아티스트 식별을 위해 딥 컨volution 네트워크(DCNN)에서 추출한 음성 특징과 i-vector 표현을 조합하는 라이트 퓨전 하이브리드 모델을 제안한다. DCNN의 분류 능력과 i-vector의 생성적 강건성을 활용하여, 특히 가수 식별에서 뛰어난 성능을 발휘하며 개별 모델을 초월하는 보완적 특징 학습을 실현한다.

ABSTRACT

Artist recognition is a task of modeling the artist's musical style. This problem is challenging because there is no clear standard. We propose a hybrid method of the generative model i-vector and the discriminative model deep convolutional neural network. We show that this approach achieves state-of-the-art performance by complementing each other. In addition, we briefly explain the advantages and disadvantages of each approach.

연구 동기 및 목표

  • 딥 러닝과 전통적인 스피커 모델링 기법을 융합하여 음악 정보 검색에서 아티스트 식별 성능을 향상시키기 위해.
  • 음악 아티스트 스타일을 모델링하는 데 있어 분류적 딥 오디오 특징과 생성적 i-vector 표현 간의 보완적 강점을 탐구하기 위해.
  • DCNN와 i-vector 특징을 융합하는 데 있어 조기 융합과 후기 융합 전략의 성능을 평가하기 위해.
  • 학습용 아티스트 수와 오디오 콘텐츠의 성격(예: 보컬 중심)에 따라 모델 성능이 어떻게 변화하는지 분석하기 위해.
  • 향후 유사 아티스트 추천과 같은 애플리케이션을 위한 하이브리드 모델의 잠재력을 탐색하기 위해.

제안 방법

  • 3초 분량의 멜 스펙트로그램(128개의 버킷)을 기반으로 훈련된 5층의 컨volution 레이어를 갖는 DCNN를 사용해 딥 오디오 특징을 추출하며, 최종 256차원 히든 레이어를 특징 표현으로 사용한다.
  • 20차원의 멜 주파수 해석 계수(MFCC)와 256개의 성분을 갖는 혼합 정규분포 모델(GMM)을 사용해 i-vector를 생성하고, 점수 평가를 위해 확률적 선형 판별 분석(PLDA)을 적용한다.
  • 조기 융합을 위해 DCNN 특징(256차원)과 i-vector(256차원)를 연결하여 단일 512차원 벡터로 융합한 후 점수를 평가한다.
  • 후기 융합을 위해 DCNN 및 i-vector 모델의 PLDA 점수를 평균 내어 각 모델이 최종 결정에 독립적으로 기여하도록 한다.
  • 백만 곡 데이터셋에서 훈련 및 평가를 수행하며, 각 아티스트당 20首씩 필터링하고 평가용으로 500명의 미사용 아티스트를 사용한다.
  • 15개의 등록 트랙에 대한 평균 풀링을 통해 단일 아티스트 모델을 구성하고, 검증에는 등가 오류 비율(EER)을, 식별에는 정확도를 사용하여 평가한다.

실험 결과

연구 질문

  • RQ1학습용 아티스트 수가 증가함에 따라 i-vector와 DCNN의 성능 특성이 어떻게 달라지는가?
  • RQ2i-vector와 DCNN가 음악 아티스트 정체성을 모델링하는 데 어떻게 상호보완적인가?
  • RQ3DCNN와 i-vector의 조기 융합과 후기 융합 중 어느 것이 아티스트 및 가수 식별 작업에서 더 높은 성능을 내는가?
  • RQ4보컬 콘텐츠에 중점을 두었을 때(i.e., 가수 식별), i-vector와 DCNN의 상대적 성능은 어떻게 영향을 받는가?
  • RQ5분류적 모델과 생성적 모델의 강점을 모두 활용함으로써 하이브리드 모델이 아티스트 식별 분야에서 최고 성능을 달성할 수 있는가?

주요 결과

  • DCNN와 i-vector의 후기 융합이 모든 작업에서 최고의 성능을 기록했으며, 가수 식별에서 3.241%의 EER과 76.0%의 정확도를 기록하여 개별 모델을 크게 앞섰다.
  • DCNN 성능은 학습 아티스트 수 증가에 따라 점진적으로 향상되었지만, i-vector 성능은 조기에 포화 상태에 도달하여, i-vector가 비지도 학습 성격 덕분에 학습 데이터 크기에 민감하지 않음을 시사한다.
  • i-vector는 가수 식별(8.257% EER)에서 아티스트 식별(10.785% EER)보다 뛰어난 성능을 보였으며, 이는 보컬 특징을 모델링하는 데의 강점을 반영한다.
  • 조기 융합은 개별 모델보다 성능이 떨어졌는데, 이는 점수 평가 이전에 서로 다른 표현 방식을 융합함으로써 특징 혼란이 발생했기 때문으로 보인다.
  • 혼동 행렬 분석 결과, DCNN는 학습 예제 수가 적은 일부 아티스트에 대해 안정적인 모델을 형성하지 못하는 경향이 있었고, i-vector는 초기에 모델을 형성했지만 학습 크기가 증가함에 따라 아티스트 간 유사도가 증가하는 경향을 보였다.
  • 하이브리드 모델은 강력한 보완성을 보였으며, DCNN는 고차원 음악적 특징을 잘 포착했고, i-vector는 특히 보컬 중심 작업에서 음성 기반의 구분 능력에서 뛰어났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.