Skip to main content
QUICK REVIEW

[논문 리뷰] Towards End-to-End Audio-Sheet-Music Retrieval

Matthias Dorfer, Andreas Arzt|arXiv (Cornell University)|2016. 12. 15.
Music and Audio Processing참고 문헌 7인용 수 5
한 줄 요약

이 논문은 심벌 음악 표현 없이도 오디오 스니펫(스펙트로그램)과 악보 이미지 간의 직접적인 매칭을 가능하게 하는 엔드 투 엔드 딥 러닝 접근법을 제안한다. 이는 심플리피케이션된 캐논리컬 상관분석(DCCA)을 사용하여 구현되며, 미리 보여지지 않은 테스트 데이터에서 중앙값 순위(MR)가 2이며, R@10가 94.2%에 이를 정도로 강력한 성능을 보인다. 이는 제로샷 크로스모달 리트리ieval에서의 뛰어난 성능을 입증한다.

ABSTRACT

This paper demonstrates the feasibility of learning to retrieve short snippets of sheet music (images) when given a short query excerpt of music (audio) -- and vice versa --, without any symbolic representation of music or scores. This would be highly useful in many content-based musical retrieval scenarios. Our approach is based on Deep Canonical Correlation Analysis (DCCA) and learns correlated latent spaces allowing for cross-modality retrieval in both directions. Initial experiments with relatively simple monophonic music show promising results.

연구 동기 및 목표

  • 심벌 음악 표현 없이도 오디오와 악보 이미지 간의 직접적인 크로스모달 리트리ieval을 가능하게 하기 위해.
  • 오디오 및 이미지 모달 간의 상관관계 있는 잠재 표현을 학습하는 엔드 투 엔드 딥 신경망 아키텍처를 개발하기 위해.
  • 오디오 연주와 해당 악보 스니펫을 연결함으로써 대규모 음악 디지털화 과제를 해결하기 위해.
  • 원시 모달 입력을 사용하여 제로샷 오디오-악보 및 악보-오디오 리트리ieval의 가능성을 평가하기 위해.
  • DCCA가 음악적 콘텐츠 리트리ieval을 위해 오디오 및 이미지 임베딩을 효과적으로 정렬할 수 있음을 보여주기 위해.

제안 방법

  • 모델은 오디오 스펙트로그램과 악보 이미지를 공유 잠재 표현으로 변환하기 위해 두 개의 별도된 컨volutional 신경망(CNNs)을 사용한다.
  • 학습된 특징 표현 간의 상관관계를 극대화하기 위해 심플리피케이션된 캐논리컬 상관분석(DCCA)을 적용한다.
  • 최적화 목표는 두 모달 간의 교차공분산 행렬의 특이값의 합을 극대화함으로써, 정렬된 잠재 공간을 촉진한다.
  • 학습 후, CCA 공간으로의 투영을 통해 오디오 및 이미지 스니펫 간의 코사인 유사도를 계산하여 리트리ieval을 수행한다.
  • 차원을 32D로 줄이기 위해 VGG 스타일의 블록, ReLU 유사 ELU 활성화 함수, 배치 정규화 및 글로벌 평균 풀링을 사용한 아키텍처이다.
  • 특징맵 크기를 원하는 32차원 상관공간으로 줄이기 위해 1×1 컨볼루션 레이어 이후 글로벌 평균 풀링을 적용한다.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 딥 러닝이 심벌 음악 표현 없이도 정확한 오디오-악보 리트리ieval을 가능하게 할 수 있는가?
  • RQ2DCCA는 원시 오디오 스펙트로그램과 악보 이미지 간의 상관관계 있는 잠재 표현을 얼마나 잘 학습할 수 있는가?
  • RQ3오디오-악보 및 악보-오디오 양방향에서 미리 보여지지 않은 테스트 데이터에서의 리트리ieval 성능은 어떠한가?
  • RQ4악보 이미지의 미세한 변형이 리트리ieval 정확도에 어느 정도 영향을 미치는가?
  • RQ5학습된 표현은 제로샷 설정에서 미리 보여지지 않은 음악 스니펫으로 일반화하기에 충분히 강건한가?

주요 결과

  • 테스트 세트에서 오디오-악보 리트리ieval의 중앙값 순위(MR)는 16,000개의 후보 중 2로, 상위 순위 결과의 높은 정밀도를 나타낸다.
  • 오디오-악보 리트리ieval의 R@10 비율은 94.2%이며, 이는 오디오 쿼리의 94퍼센트 이상에서 정확한 악보 스니펫이 상위 10개 결과 내에 포함됨을 의미한다.
  • 악보-오디오 리트리ieval의 경우 R@10 비율은 93.7%로, 양방향 리트리ieval에서 모두 뛰어난 성능을 보인다.
  • 검증 세트와 테스트 세트 간의 일관된 성능(예: R@10: 93.1% 대비 94.2%)을 통해 모델이 미리 보여지지 않은 데이터로 잘 일반화됨을 입증한다.
  • 리트리ieval 결과의 시각적 점검 결과, 상위 9개 결과 중 4개가 정답에 가까운 복제 또는 약간의 변형을 가진 것으로 나타나, 미세한 시각적 이동에 대해 강건함을 시사한다.
  • 심벌 음악 변환 없이도 높은 성능을 달성함으로써, 직접적인 모달 매칭의 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.