[논문 리뷰] Automatic Composition of Guitar Tabs by Transformers and Groove Modeling
이 논문은 리듬적 일관성을 향상시키기 위해 그루브 모델링을 통합한 트랜스포머-XL 모델을 제안하며, 자동으로 손가락 연주 기반 기타 탭을 생성하기 위해 미세조정한다. 그루브 인식 생성 방식이 더 음악적으로 일관되고 청취자에게 더 만족스러운 결과를 낳음을 입증하였으며, 인간 청취자들은 모델이 생성한 탭을 실제 인간 작곡과 유사한 음질로 평가하였다.
Deep learning algorithms are increasingly developed for learning to compose music in the form of MIDI files. However, whether such algorithms work well for composing guitar tabs, which are quite different from MIDIs, remain relatively unexplored. To address this, we build a model for composing fingerstyle guitar tabs with Transformer-XL, a neural sequence model architecture. With this model, we investigate the following research questions. First, whether the neural net generates note sequences with meaningful note-string combinations, which is important for the guitar but not other instruments such as the piano. Second, whether it generates compositions with coherent rhythmic groove, crucial for fingerstyle guitar music. And, finally, how pleasant the composed music is in comparison to real, human-made compositions. Our work provides preliminary empirical evidence of the promise of deep learning for tab composition, and suggests areas for future study.
연구 동기 및 목표
- 기타와 같은 프레티드 악기에서 중요한 손가락 위치 정보를 포함한 음표-스트링 손가락 위치를 심벌릭 탭 입력만으로 깊이 학습된 모델이 음악적으로 의미 있는 표현을 생성할 수 있는지 조사한다. 이는 표준 MIDI 기반 모델에서 자주 忽略되는 요소이다.
- 모델이 명시적인 그루브 애너테이션 없이도 표현적인 손가락 연주 기반 기타 연주에 필수적인 일관된 리듬 감각을 학습하여 생성할 수 있는지 평가한다.
- 음악적 연주를 위한 오디오 렌더링과 인간 청취자 평가를 통해 모델이 생성한 기타 탭의 청취자 평가 품질을 실제 인간 작곡 탭과 비교한다.
- 다양한 벡터 양자화된 그루브 표현 방식이 생성된 탭 시퀀스의 품질과 리듬 일관성에 미치는 영향을 탐색한다.
제안 방법
- 모델은 심벌릭 기타 탭 표현을 순차적 토큰으로 처리하기 위해 수정된 Music Transformer-XL 아키텍처를 사용한다.
- 탭 표현은 스트링 위치, 프렛 수, 연주 기법을 인코딩하여 모델이 프렛보드 특화 음조 조합을 학습할 수 있도록 한다.
- 네 가지 벡터 양자화된 그루브 표현 방식을 도입하고 평가한다: 하드, 소프트, 이산 및 연속 임베딩을 사용한 두 가지 변형.
- 그루브 이벤트는 고수준의 리듬적 신호로 입력 시퀀스에 삽입되어 모델이 바 내내 일관된 리듬 감각을 유지하도록 유도한다.
- 모델은 333개의 손가락 연주 기반 기타 탭으로 구성된 정제된 데이터셋으로 미세조정되며, 훈련 데이터는 시간적 정렬을 위해 16분음표 격자에 투영된다.
- 목적적 평가 지표로는 예측된 그루브 패tern과 진짜 값 간의 하드 정확도와 소프트 거리가 사용되며, 주관적 평가는 오디오 재생과 인간 청취자로부터의 리커트 척도 평가를 통해 이루어진다.
실험 결과
연구 질문
- RQ1신경망은 심벌릭 탭 입력만으로도 음표 시퀀스뿐 아니라 기타 프렛보드에서 타당하고 일관된 손가락 위치를 생성할 수 있는가?
- RQ2명시적인 그루브 모델링을 통합함으로써 생성된 기타 탭의 리듬 일관성과 청취자에게 느껴지는 음악성은 향상되는가?
- RQ3모델이 생성한 탭의 오디오 렌더링은 실제 인간 작곡 탭과 비교해 청취자 선호도와 청취 품질 측면에서 어떻게 다른가?
주요 결과
- 그루브 인식 모델은 목적적 평가 지표에서 노-그루빙 기준 모델을 뚜렷이 앞서며, 소프트 및 하드 그루브 표현 방식이 실제 계속된 음악과 더 높은 유사도를 보였다.
- 하드-그루빙 모델은 주관적 평가에서 평균 관점 점수(MOS) 3.43을 기록했으며, 이는 실제 탭(MOS 3.48)과 통계적으로 차이가 없었다.
- 사용자 연구에 참여한 전문가들은 그루브 인식 모델과 노-그루빙 모델을 구별할 수 있었으며, 그루브 인식 생성 결과가 더 우아한 멜로디 연속성과 리듬 감각을 지녔다고 평가했다.
- 장기적인 구조적 일관성 측면에선 실제 인간 작곡보다 성능이 열등하여 장기간 음악적 양식을 모델링하는 데 향후 개선 여지가 있음을 시사한다.
- 16마디의 짧은 구성 길이에도 불구하고 하드-그루빙 생성 결과의 오디오 품질은 실제 인간 탭과 유사하게 평가되었으며, 향후 발전 잠재력이 매우 높음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.