[논문 리뷰] MMM : Exploring Conditional Multi-Track Music Generation with the Transformer
MMM은 고유의 트랙별 토큰 시퀀스 표현을 사용한 조건부 다중 트랙 음악 생성용 Transformer 기반 시스템을 도입하여 트랙 수준 및 마디 수준 인페인팅뿐 아니라 트랙별 속성 제어를 가능하게 한다.
We propose the Multi-Track Music Machine (MMM), a generative system based on the Transformer architecture that is capable of generating multi-track music. In contrast to previous work, which represents musical material as a single time-ordered sequence, where the musical events corresponding to different tracks are interleaved, we create a time-ordered sequence of musical events for each track and concatenate several tracks into a single sequence. This takes advantage of the Transformer's attention-mechanism, which can adeptly handle long-term dependencies. We explore how various representations can offer the user a high degree of control at generation time, providing an interactive demo that accommodates track-level and bar-level inpainting, and offers control over track instrumentation and note density.
연구 동기 및 목표
- 정밀한 사용자인 제어를 가능하게 하여 다중 트랙 생성을 가능하게 함으로써 생성 음악의 실용적 활용성을 향상시키는 것.
- 장거리 의존성을 위한 Transformer 어텐션을 활용하면서 트랙 수준의 컨디셔닝을 보존하는 새로운 표현을 개발하는 것.
- 트랙 수준 및 마디 수준 인페인팅과 트랙별 명시적 악기 및 노트 밀도 제어를 가능하게 하는 것.
제안 방법
- 다중 트랙 음악을 트랙별 토큰 시퀀스로 표현하고 트랙들을 하나의 시퀀스로 연결하는(MultiTrack 표현)으로 표현한다.
- BarFill 표현을 도입하여 대상 마디를 채움 토큰으로 대체하고 생성 후 실제 마디를 덧붙여 마디 수준 인페인팅을 수행한다.
- 4-바 및 8-바 구성을 사용하여 BarFill에서의 MMMBar, MultiTrack에서의 MMMTrack 등 GPT-2 스타일 Transformer 모델을 Lahk MIDI Dataset (LMD)으로 학습시킨다.
- 바당 128 NOTE_ON 토큰, 128 NOTE_OFF 토큰, 그리고 48 TIME_SHIFT 토큰을 사용하고 BAR_START/BAR_END 및 TRACK_START/TRACK_END 메타데이터 토큰, 더불어 트랙당 INSTRUMENT 및 DENSITY_LEVEL 토큰.
- 트랙 인페인팅, 바 인페인팅, 트랙별 악기 및 밀도 속성 제어를 포함한 대화형 생성 모드와 개선을 위한 반복 생성 및 메타 알고리즘을 가능하게 한다.
실험 결과
연구 질문
- RQ1트랙 이벤트를 혼합하지 않고도 Transformer 모델이 다중 트랙 기호 음악을 효과적으로 생성하고 컨디션할 수 있는 방법은?
- RQ2단일 모델 내에서 트랙 수준 및 바 수준 인페인팅을 달성하면서 트랙당 제어 가능한 악기와 노트 밀도를 유지할 수 있는가?
- RQ3다중 트랙 음악 생성에 대한 미세한 제어를 가장 잘 지원하는 표현과 토큰 스키마는 무엇인가?
- RQ4MMM 접근법은 트랙 간의 장거리 의존성을 처리하기 위해 Transformer 어텐션을 어떻게 활용하는가?
주요 결과
- 새로운 MultiTrack/BarFill 토큰 기반 표현은 트랙 수준 및 바 수준 인페인팅과 트랙별 속성 제어를 가능하게 한다.
- MMMBar 및 MMMTrack 모델은 4-바 및 8-바 구간에서 학습되어 트랙 간 조건부 의존성과 함께 유연한 생성을 보여준다.
- BarFill 표현은 미리 지정된 바에 채움 플레이스홀더를 삽입하고 나중에 이를 채워 바 수준 인페인팅을 가능하게 하여 조건화를 가능하게 한다.
- 시스템은 각 트랙에 대해 INSTRUMENT 토큰을 통한 악기 수준 제어와 DENSITY_LEVEL 토큰을 통한 노트 밀도 제어를 지원한다.
- 저자들은 LMD의 10트랙 4바, 10트랙 8바, 10트랙 16바 세그먼트 중 각각 약 99.8%, 86.8%, 38.8%가 <2048 토큰으로 표현될 수 있다고 언급하며 실용적 확장성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.