Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-modal variational inference for bijective signal-symbol translation

Axel Chemla--Romeu-Santos, Stavros Ntalampiras|arXiv (Cornell University)|2020. 02. 10.
Music and Audio Processing인용 수 4
한 줄 요약

이 논문은 공유된 잠재 공간을 가진 도메인 특화의 변분 자동차오더(VAE) 두 대를 사용하여 교차 모odal 신호-기호 번역을 위한 이항, 변분 추론 기반 프레임워크를 제안한다. 잠재 표현 간의 덧셈 일치를 강제함으로써 모델은 양방향 생성—음성 신호에서 기호로의 음역 변환과 기호에서 음성 신호로의 합성—을 가능하게 하며, 임의의 기호 어휘와 연속 잠재 공간 탐색을 통한 창의적 제어를 지원한다.

ABSTRACT

Extraction of symbolic information from signals is an active field of research enabling numerous applications especially in the Musical Information Retrieval domain. This complex task, that is also related to other topics such as pitch extraction or instrument recognition, is a demanding subject that gave birth to numerous approaches, mostly based on advanced signal processing-based algorithms. However, these techniques are often non-generic, allowing the extraction of definite physical properties of the signal (pitch, octave), but not allowing arbitrary vocabularies or more general annotations. On top of that, these techniques are one-sided, meaning that they can extract symbolic data from an audio signal, but cannot perform the reverse process and make symbol-to-signal generation. In this paper, we propose an bijective approach for signal/symbol translation by turning this problem into a density estimation task over signal and symbolic domains, considered both as related random variables. We estimate this joint distribution with two different variational auto-encoders, one for each domain, whose inner representations are forced to match with an additive constraint, allowing both models to learn and generate separately while allowing signal-to-symbol and symbol-to-signal inference. In this article, we test our models on pitch, octave and dynamics symbols, which comprise a fundamental step towards music transcription and label-constrained audio generation. In addition to its versatility, this system is rather light during training and generation while allowing several interesting creative uses that we outline at the end of the article.

연구 동기 및 목표

  • 음악 정보 검색 분야에서 단방향, 비일반적인 신호에서 기호로의 변환 방법의 한계를 해결한다.
  • 통합 생성 모델을 사용하여 음성 신호와 기호적 표기(예: 음고, 강세, 옥타브) 간의 양방향 번역을 가능하게 한다.
  • 기본 음고 검출을 초월하여 복잡한 음악 기호인 트릴이나 연주 모드와 같은 복잡한 기호 어휘를 포함한 임의의 기호 어휘를 지원한다.
  • 신호 및 기호 생성을 위한 통합된 잠재 공간을 제공하여 창의적 음성 합성과 제어를 가능하게 한다.
  • 원천 분리 기능을 명시적 분해와 통합하여 악기 인식 성능 향상과 모델의 해석 가능성 향상을 도모한다.

제안 방법

  • 음성과 기호 도메인 간의 공동 밀도 추정 문제로 신호-기호 번역을 공식화한다.
  • 스펙트럼 특징(신호)을 위한 VAE와 기호적 표기(예: 음고, 강세)를 위한 VAE를 별도로 학습시키되, 공유된 잠재 공간을 사용한다.
  • 두 VAE의 잠재 표현 간의 덧셈 제약 조건을 통해 잠재 공간의 정렬을 강제하여 교차 도메인 추론을 가능하게 한다.
  • 신호 도메인과 기호 도메인 양쪽의 잠재 변수에 대한 사후 분포를 근사하기 위해 변분 추론을 사용한다.
  • 한 도메인의 잠재 코드를 다른 도메인의 디코더를 사용해 디코딩하는 방식으로 교차 도메인 생성을 가능하게 한다(예: 신호 인코더 → 기호 디코더).
  • 혼합 계수에 대한 베이지안 추론 네트워크를 사용하고, 분리된 디코더를 활용하는 새로운 원천 분리 모듈을 통합하여 악기 인식 성능 향상.

실험 결과

연구 질문

  • RQ1통합된 변분 자동차오더 프레임워크가 음성 신호와 기호 음악 표기 간의 양방향, 이항 번역을 달성할 수 있는가?
  • RQ2이러한 모델이 표준 음고와 강세를 초월하여 임의의 기호 어휘에 대해 얼마나 잘 일반화되는가?
  • RQ3잠재 공간 공유가 제어 가능한 음성 합성과 기호 생성에 얼마나 기여하는가?
  • RQ4스펙트럼 모포링과 잠재 공간 내 시퀀스 기반 탐색과 같은 창의적 음성 생성 작업을 지원할 수 있는가?
  • RQ5명시적 원천 분리 통합이 다성분 음악 변환 성능에 얼마나 기여하는가?

주요 결과

  • 모델은 양방향 번역을 달성한다: 공유된 구조적 잠재 공간을 사용하여 정확한 신호에서 기호로의 변환과 기호에서 신호로의 생성을 수행한다.
  • 시스템은 복잡한 음악 기호인 트릴이나 발음 방식과 같은 복잡한 기호 어휘를 포함하여 임의의 기호 어휘를 지원하여 영리하고 사용자 정의 가능한 표기 체계를 가능하게 한다.
  • 잠재 공간 탐색을 통해 스펙트럼 모포링, 자유로운 궤적 탐색, 시퀀스 기반 음성 생성과 같은 다양한 창의적 응용이 가능해진다.
  • 기호 레이블(예: 특정 음고, 강세)에 조건을 주고 다양한 음성 실현을 샘플링함으로써 반감독 학습 기반의 생성을 지원한다.
  • 분리된 디코더를 사용하는 원천 분리 통합으로 악기 인식 성능 향상과 다성분 혼합의 더 정확한 분해가 가능해졌다.
  • 학습 및 추론 과정에서 계산적으로 효율적이며, 실시간 및 상호작용형 응용에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.