Skip to main content
QUICK REVIEW

[논문 리뷰] Performing Structured Improvisations with pre-trained Deep Learning Models

Pablo Samuel Castro|arXiv (Cornell University)|2019. 04. 30.
Music Technology and Sound Studies인용 수 4
한 줄 요약

이 논문은 인간의 입력을 프리미어(sequence)로 사용하여 사전 훈련된 딥 러닝 모델(MelodyRNN 및 DrumsRNN)을 실시간으로 통합하는 스타일 유지를 고려한 시스템을 제시한다. 이 시스템은 기계 학습 전문 지식이 필요 없이도 즉각적이고 반응성이 뛰어나며 스타일적으로 일관된 음악 생성을 가능하게 하여 라이브 재즈 공연 환경에서 연주자의 개인적 스타일을 성공적으로 유지한다.

ABSTRACT

The quality of outputs produced by deep generative models for music have seen a dramatic improvement in the last few years. However, most deep learning models perform in "offline" mode, with few restrictions on the processing time. Integrating these types of models into a live structured performance poses a challenge because of the necessity to respect the beat and harmony. Further, these deep models tend to be agnostic to the style of a performer, which often renders them impractical for live performance. In this paper we propose a system which enables the integration of out-of-the-box generative models by leveraging the musician's creativity and expertise.

연구 동기 및 목표

  • 고품질이지만 추론 시간이 긴 생성형 AI 모델을 실시간으로 구조화된 음악 공연에 통합하는 데 도전하는 것.
  • 사전 훈련된 모델을 사용하면서도 인간 연주자의 스타일적 정체성을 유지하는 라이브 즉흥연주를 가능하게 하는 것.
  • 고급 생성형 모델을 음악 공연에 사용할 때 기계 학습 전문 지식이 필요 없도록 하는 것.
  • 실시간 인간 입력 처리를 통해 AI 보조 즉흥연주에서 지연 시간을 줄이고 타이밍 제어를 향상시키는 것.
  • AI가 생성한 즉흥연주가 숙련된 연주자가 예측 가능한 패턴을 넘어서는 데 어떻게 기여할 수 있는지 탐구하는 것.

제안 방법

  • 시스템은 사전 훈련된 MelodyRNN 및 DrumsRNN 모델의 프리미어 시퀀스로 인간 연주자의 실시간 MIDI 입력을 사용한다.
  • 연주자의 노트를 인식 지연 없이 실시간으로 처리하여 새로운 멜로디적 및 리듬적 내용을 생성한다.
  • 모델은 인간 입력 시퀀스에 조건화된 톤과 지속시간 토큰의 통계적 분포를 기반으로 새로운 노트를 생성한다.
  • 16분음표 정렬을 피하기 위해 연속 시간 입력을 사용함으로써 더 자연스러운 리듬 표현이 가능해진다.
  • AI가 연주자의 입력을 대체하기 시작하는 시점을 제어하기 위해 MIDI 페달을 도입하였다.
  • MIDI 출력을 통해 어떤 사운드 모듈이나 싱어라이저와도 통합되어 표현력 있고 유기적인 사운드를 구현할 수 있다.

실험 결과

연구 질문

  • RQ1사전 훈련된 딥 생성 모델을 실시간 라이브 음악 즉흥연주에 사용할 수 있을까? 특히 뚜렷한 지연 시간 없이 말이다?
  • RQ2AI가 생성한 콘텐츠를 통합할 때 인간 연주자의 스타일적 정체성을 어떻게 유지할 수 있을까?
  • RQ3고품질이고 반응성이 뛰어난 AI 보조 즉흥연주를 가능하게 하면서도 기계 학습 전문 지식이 필요 없는 시스템을 설계할 수 있을까?
  • RQ4AI가 생성한 콘텐츠의 도입이 숙련된 연주자의 창작 과정과 음악적 탐색에 어떤 영향을 미칠까?
  • RQ5AI 보조 즉흥연주에서 타이밍과 음악적 일관성을 향상시키기 위해 어떤 제어 메커니즘이 효과적일까?

주요 결과

  • 연주자의 입력과 AI가 생성한 출력 사이에 눈에 띄는 지연 시간 없이 실시간 성능을 달성하였다.
  • 연주자의 스타일에 익숙한 청중들은 AI의 개입을 감지하지 못했으며, 이는 강력한 스타일 일관성을 의미한다.
  • 연주자들은 AI가 생성한 노트의 불확실성 덕분에 습관적인 라인에 의존하는 것을 줄이고 새로운 창작 영역으로 나아갔다고 보고하였다.
  • 시스템은 안정적인 화성 구조를 가진 모달 재즈에서 가장 잘 작동했으며, 화성의 변화가 발생할 경우 타이밍 및 음성 이동 문제를 일으켰다.
  • MIDI 페달의 도입으로 AI가 연주자의 노트를 대체하기 시작하는 시점을 제어할 수 있었고, 이는 어색한 전환을 줄이는 데 기여하였다.
  • 시스템은 새로운, 일관된 즉흥연주를 생성하면서도 연주자의 음악적 정체성을 성공적으로 유지하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.