Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Music Medleys via Playing Music Puzzle Games

Yu-Siang Huang, Szu-Yu Chou|arXiv (Cornell University)|2017. 09. 13.
Music and Audio Processing참고 문헌 29인용 수 4
한 줄 요약

이 논문은 음악 퍼즐 게임을 풀면서 음원 조각을 정확한 시간 순서로 정렬함으로써 음악 메들리를 생성하도록 신경망을 훈련시키는 자기지도 학습 방법인 유사도 임bedding 네트워크(Similaritiy Embedding Network, SEN)를 제안한다. 프레임 수준의 유사도 행렬을 학습하고 이를 공유된 공간에 임bedding함으로써, SEN은 음악 조각 맞추기, 순서 정하기, 메들리 생성 작업에서 기준 모델을 능가하며, 내림표 기반 분할을 사용할 경우 메들리 게임에서 전역 정확도 0.790과 0.750을 달성한다.

ABSTRACT

Generating music medleys is about finding an optimal permutation of a given set of music clips. Toward this goal, we propose a self-supervised learning task, called the music puzzle game, to train neural network models to learn the sequential patterns in music. In essence, such a game requires machines to correctly sort a few multisecond music fragments. In the training stage, we learn the model by sampling multiple non-overlapping fragment pairs from the same songs and seeking to predict whether a given pair is consecutive and is in the correct chronological order. For testing, we design a number of puzzle games with different difficulty levels, the most difficult one being music medley, which requiring sorting fragments from different songs. On the basis of state-of-the-art Siamese convolutional network, we propose an improved architecture that learns to embed frame-level similarity scores computed from the input fragment pairs to a common space, where fragment pairs in the correct order can be more easily identified. Our result shows that the resulting model, dubbed as the similarity embedding network (SEN), performs better than competing models across different games, including music jigsaw puzzle, music sequencing, and music medley. Example results can be found at our project website, https://remyhuang.github.io/DJnet.

연구 동기 및 목표

  • 음원 조각 순서를 지도 신호로 삼아 음악의 순차적 패턴을 학습하는 자기지도 학습 방법을 개발하는 것.
  • 동일하거나 다른 노래의 다초성, 겹치지 않는 음원 조각들을 올바른 순서로 정렬하는 과제를 해결하는 것.
  • 순차적 음성 이해의 실용적 응용으로서 자동 음악 메들리 생성을 가능하게 하는 것.
  • 공유된 임베딩 공간에서 프레임 수준의 유사도 행렬을 학습함으로써 기존의 시아모이 네트워크를 개선하는 것.

제안 방법

  • 모델은 쌍의 음원 조각을 처리하고 그 사이의 프레임 수준 유사도 점수를 계산하기 위해 시아모이 합성곱 네트워크를 사용한다.
  • 이 점수들로부터 유사도 행렬이 구성되며, 이는 조각 쌍 간의 시간적 정렬과 구조적 일관성을 나타낸다.
  • 네트워크는 순서가 올바른(긍정) 쌍이 순서가 어긋난(부정) 쌍보다 더 쉽게 분리될 수 있도록 유사도 행렬을 공통된 공간에 임베딩하도록 학습한다.
  • 모델은 모든 n! 순열을 평가하는 대신 n(n−1)개의 쌍을 평가하는 쌍별 평가 전략을 사용하여 더 큰 조각 집합에 대해서도 확장 가능성을 확보한다.
  • 내림표 추적을 통해 음악적으로 의미 있는 겹치지 않는 조각을 생성함으로써 모델의 일반화 능력을 향상시킨다.
  • 모델은 세 가지 유형의 부정 쌍(R1R3, R2R1, R3R1)을 사용하여 훈련되며, 분석 결과 모든 세 가지를 사용할 경우 성능 향상이 확인되었다.

실험 결과

연구 질문

  • RQ1음악 퍼즐 게임을 기반으로 한 자기지도 학습 프레임워크가 음성의 순차적 패턴을 효과적으로 학습할 수 있는가?
  • RQ2제안된 SEN 모델은 동일하거나 다른 곡의 음원 조각들을 정렬하는 데 있어 기존의 시아모이 네트워크와 비교해 어떤가?
  • RQ3내림표 기반 분할이 모델이 음악적으로 의미 있는 패턴을 학습하는 데 얼마나 기여하는가?
  • RQ4다른 곡의 조각들로 구성된 복잡한 과제인 음악 메들리 생성에 모델이 일반화될 수 있는가?
  • RQ5정확한 시간 순서를 식별하는 데 가장 효과적인 부정 학습 샘플의 유형은 무엇인가?

주요 결과

  • 내림표 기반 분할을 사용해 훈련한 SEN 모델은 내림표 기반 분할을 사용할 경우 메들리 게임에서 전역 정확도 0.790을 달성하며, 기준 모델을 크게 능가한다.
  • 모든 세 가지 유형의 부정 쌍(R1R3, R2R1, R3R1)을 사용해 훈련할 경우 성능이 가장 우수하며, R2R1만 사용할 경우 최적의 결과를 얻을 수 없다.
  • 모델은 순서가 맞는 쌍과 어긋난 쌍뿐 아니라, 연속된(R2R1)과 비연속된(R1R3, R3R1) 쌍을도 구분할 수 있어 순차적 구조에 민감함을 보인다.
  • 분석 결과, 코사인 유사도를 내적(inner product)으로 대체할 경우 유사도 점수의 정규화가 부족해 성능 저하가 발생한다.
  • 모델은 예측에서 국소적 순서를 유지하며, 많은 잘못된 예측조차도 올바른 국소 세그먼트 순서로 인해 음악적으로 타당하게 들릴 정도로 정확한 국소 순서를 반영한다.
  • 학습된 특징의 시각화 결과, 합성곱 필터가 유사도 행렬에서 명확한 패턴과 질감을 탐지함을 확인하여 모델이 의미 있는 구조적 정보를 캐치하고 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.