Skip to main content
QUICK REVIEW

[논문 리뷰] Benchmarks and leaderboards for sound demixing tasks

Roman Solovyev, Alexander Stempkovskiy|arXiv (Cornell University)|2023. 05. 12.
Speech and Audio Processing인용 수 6
한 줄 요약

이 논문은 음원 분離를 위한 두 가지 새로운 벤치마크인 Synth MVSep와 Multisong MVSep를 소개하며, https://mvsep.com/quality_checker/ 에서 운영하는 동적 랭킹을 함께 제공한다. 보컬과 악기 모델(UVR-MDX1, UVR-MDX2, Demucs4)을 활용한 스템 별 모델 앙상블 방법을 제안하고, 테스트 시점 증강과 가중 평균을 적용하여 MDX23 공개 테스트 세트에서 평균 SDR 9.41을 기록하며 2023년 사운드 디믹싱 챌린지에서 상위 3위를 달성했다.

ABSTRACT

Music demixing is the task of separating different tracks from the given single audio signal into components, such as drums, bass, and vocals from the rest of the accompaniment. Separation of sources is useful for a range of areas, including entertainment and hearing aids. In this paper, we introduce two new benchmarks for the sound source separation tasks and compare popular models for sound demixing, as well as their ensembles, on these benchmarks. For the models' assessments, we provide the leaderboard at https://mvsep.com/quality_checker/, giving a comparison for a range of models. The new benchmark datasets are available for download. We also develop a novel approach for audio separation, based on the ensembling of different models that are suited best for the particular stem. The proposed solution was evaluated in the context of the Music Demixing Challenge 2023 and achieved top results in different tracks of the challenge. The code and the approach are open-sourced on GitHub.

연구 동기 및 목표

  • 기존 벤치마크인 MUSDB18과 Divide and Remaster에 대한 과적합 문제를 해결하기 위해, 기존 데이터셋을 초월한 일반화 능력을 평가할 수 있는 새로운 독립적 평가 데이터셋을 도입하기 위함.
  • 여러 벤치마크를 대상으로 최신 모델과 앙상블의 성능을 실시간으로 비교할 수 있도록 동적이고 개방형 랭킹을 제공하기 위함.
  • 특정 스템(보컬 대비 악기)에 맞춰 최적화된 모델 앙상블 기반의 새로운 오디오 분리 파이프라인을 개발하고 검증하기 위함.
  • 보컬 억제, 테스트 시점 증강, 가중 앙상블을 융합한 하이브리드 접근 방식을 통해 2023년 사운드 디믹싱 챌린지에서 높은 성능을 달성하기 위함.
  • 재현 가능성과 음악 디믹싱 분야의 공동체적 발전을 촉진하기 위해 오픈소스 코드와 모델을 공개하기 위함.

제안 방법

  • 저자들은 합성 데이터(Synth MVSep)와 실제 다중 트랙 녹음(Multisong MVSep)을 포함한 두 가지 새로운 벤치마크를 도입하여, 이전 데이터셋을 초월한 일반화 능력을 평가하도록 설계하였다.
  • 동적 랭킹은 https://mvsep.com/quality_checker/ 에서 운영되며, 연구자들이 예측 결과를 업로드하고 실시간으로 모델 성능을 비교할 수 있도록 한다.
  • 보컬 분리에 있어서는 UVR-MDX1 및 UVR-MDX2 모델을 사용하고, 인version 기반의 테스트 시점 증강을 적용하여 혼합 신호를 반전시킨 후 재추론함으로써 모델의 강건성을 향상시킨다.
  • 최종 보컬은 가중 평균을 통해 확보되며, 공식은 $\text{vocals} = \frac{\sum w_i \cdot \text{vocals}_i}{\sum w_i}$ 이며, UVR-MDX1, UVR-MDX2, Demucs4에 대해 최적의 가중치는 각각 12, 8, 3이다.
  • 악기 스템(베이스, 드럼, 기타)에 대해서는 네 가지의 Demucs4 및 Demucs3 버전을 사용하고, 테스트 시점 증강과 가중 앙성합을 적용하며, 각 스템에 맞게 별도의 가중치를 설정하여 성능을 최적화한다.
  • 최종 스템 추정치는 악기 예측치의 선형 조합을 통해 재구성되며, 공식은 $\text{bass} = \frac{1}{3}(\text{instr} - \bar{\text{other}} - \bar{\text{drums}} + 2\cdot\bar{\text{bass}})$ 이며, 드럼과 기타에 대해서도 유사한 식이 적용된다.

실험 결과

연구 질문

  • RQ1MUSDB18과 Divide and Remaster와 같은 유명한 데이터셋에 과적합된 기존 최신 모델들이, MUSDB18 및 Divide and Remaster와는 독립적인 새로운 데이터셋에서 어떻게 성능을 발휘하는가?
  • RQ2보컬과 악기 스템에 맞춰 전용 모델을 선택하는 앙상블 전략이 단일 모델 기반 베이스라인보다 사운드 디믹싱에서 더 우수한 성능을 낼 수 있는가?
  • RQ3웨이브폼 반전을 통한 테스트 시점 증강이 디믹싱 모델의 강건성과 일반화 능력을 얼마나 향상시키는가?
  • RQ4SDR를 전 스템에서 최대화하기 위해 앙성합에 사용되는 최적의 가중치 배분 방식은 무엇인가?
  • RQ5보컬 억제, 모델 앙상블, 테스트 시점 증강을 통합한 통합 오픈소스 파이프라인은 실제 도전 과제인 SDX2023에서 최상위 성능을 달성할 수 있는가?

주요 결과

  • 제안된 앙상블 방법은 MDX23 공개 테스트 세트에서 평균 SDR 9.41을 기록하여 2023년 사운드 디믹싱 챌린지에서 상위 3위를 달성했다.
  • Multisong MVSep 벤치마크에서 앙상블은 평균 SDR 10.11을 기록하였으며, 개별 스템의 SDR는 베이스 12.68, 드럼 11.68, 기타 6.67, 보컬 9.62였다.
  • MDX23의 사전 테스트 세트에서 평균 SDR는 9.25를 기록하여, 모델이 새로운 데이터에 대해 강력한 일반화 능력을 보임을 확인했다.
  • UVR-MDX1과 UVR-MDX2는 보컬 분리에 있어 가장 효과적인 모델로 확인되었고, 'demucs_ft'와 'demucs_6s' 헤드를 가진 Demucs4 버전은 악기 스템 분리에 가장 뛰어난 성능을 보였다.
  • 웨이브폼 반전을 통한 테스트 시점 증강은 특히 보컬 분리에서 모델의 웨이브폼 변동에 대한 강건성을 높여 성능 향상에 기여했다.
  • 최적화된 가중치(보컬: 12, 8, 3; 베이스: 19, 4, 5, 8 등)를 사용한 가중 앙상블은 모든 스템과 데이터셋에서 일관된 성능 향상을 이끌어냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.