Skip to main content
QUICK REVIEW

[논문 리뷰] Reconstructing Human Expressiveness in Piano Performances with a Transformer Network

Jingjing Tang, Geraínt A. Wiggins|arXiv (Cornell University)|2023. 06. 09.
Music and Audio Processing인용 수 4
한 줄 요약

이 논문은 표준 점수 대신 번역된 점수를 사용하여 피아노 연주에서 인간의 표현성을 재구성하기 위해 다층 양방향 트랜스포머 인코더를 제안한다. 대규모 번역된 연주 데이터셋을 활용하고 피아니스트 신원 임베딩을 통합함으로써, 청취 테스트에서 최신 기술을 능가하는 매우 표현적이고 인간다운 연주를 생성한다. 특히 음량과 장거리 표현성에서 뛰어난 성능을 보이며, 전체적으로 인간의 표현성과의 일관성은 아직 도전 과제로 남아 있다.

ABSTRACT

Capturing intricate and subtle variations in human expressiveness in music performance using computational approaches is challenging. In this paper, we propose a novel approach for reconstructing human expressiveness in piano performance with a multi-layer bi-directional Transformer encoder. To address the needs for large amounts of accurately captured and score-aligned performance data in training neural networks, we use transcribed scores obtained from an existing transcription model to train our model. We integrate pianist identities to control the sampling process and explore the ability of our system to model variations in expressiveness for different pianists. The system is evaluated through statistical analysis of generated expressive performances and a listening test. Overall, the results suggest that our method achieves state-of-the-art in generating human-like piano performances from transcribed scores, while fully and consistently reconstructing human expressiveness poses further challenges.

연구 동기 및 목표

  • 표준 점수에 의존하지 않고 인간다운 표현적 피아노 연주를 생성하는 데 도전하는 것.
  • 최근의 번역 모델에서 유도된 번역된 점수와 연주 정렬을 활용하여 표현적 연주 렌더링(EPR)을 향상시키는 것.
  • 생성 과정에 피아니스트 신원 임베딩을 통합하여 개인의 피아니스트 표현성을 모델링하는 것.
  • 통계적 분석과 인간 청취 테스트를 통해 최신 기술 시스템과의 비교를 통해 모델 성능을 평가하는 것.
  • 번역된 점수가 특히 즉흥적 또는 비노트화된 장식을 포함한 곡에 대해 EPR의 타당하고 표현적인 입력으로 사용될 수 있는지 조사하는 것.

제안 방법

  • 모델은 ATEPP 데이터셋의 쌍화된 번역된 점수와 해당 표현적 연주를 기반으로 다층 양방향 트랜스포머 인코더를 훈련한다.
  • 모델은 번역된 점수를 입력으로 받아 위치 인코딩과 자기주의 주의 메커니즘을 사용하여 표현적 타이밍 및 속도 변형을 생성한다.
  • 피아니스트 신원은 샘플링 과정에 영향을 주는 조건부 제어 신호로 통합되어 다양한 연주자 간의 스타일 모델링이 가능해진다.
  • 표현성과 현실감을 향상시키기 위해 재구성 손실과 적대적 훈련의 조합을 사용하여 모델을 피지컬 튜닝한다.
  • 특징 추출에는 점수에서의 정규화된 속도 및 지속 시간 편차가 포함되며, 일관성을 확보하기 위해 스무딩 및 표준화가 적용된다.
  • 시스템은 표현적 특징의 정량적 분석과 최신 기술 시스템과의 비교를 위한 청취 테스트를 통해 평가된다. 비교 대상은 표준 점수, 번역된 점수, 인간 연주이다.

실험 결과

연구 질문

  • RQ1표준 점수 대신 번역된 점수를 기반으로 훈련된 트랜스포머 기반 모델이 인간의 표현성을 효과적으로 재구성할 수 있는가?
  • RQ2피아니스트 신원에 대한 조건부 조건화를 통해 모델이 개인의 피아니스트 연주 스타일을 어느 정도 포착하고 재현할 수 있는가?
  • RQ3모델의 성능은 청각적 표현성과 음량 변동 측면에서 최신 기술 EPR 시스템과 비교해 어떻게 평가되는가?
  • RQ4번역된 점수에서 생성하는 것이 표준 점수의 직접적 렌더링보다 더 표현적인 결과를 낳는가?
  • RQ5장기적인 표현적 구조와 페달링과 같은 복잡한 기법을 재구성하는 데서 모델의 한계는 무엇인가?

주요 결과

  • 청취 테스트에서 제안된 모델은 VirtuosoNet을 상당히 능가했으며, 전체 선호도에 대해 p값이 0.01 < p < 0.05로 통계적으로 유의미한 청취자 선호도를 보였다.
  • 번역된 점수에서 생성된 연주(G-TS)는 번역된 점수의 직접적 오디오 렌더링(TS)보다 유의미하게 높은 평가를 받았으며, 대부분의 곡에서 p < 0.05를 기록하여 표현성 재구성에 성공했다.
  • 장기적인 음량 및 속도 변동을 포착하는 데 뛰어난 성능을 보였으며, VirtuosoNet과 표준 점수 렌더링 모두를 능가했고, 특히 복잡한 파트에서 두드러졌다.
  • 모델가 생성한 연주는 어떤 기준보다도 인간 연주에 더 가까운 청각적 표현성을 보였지만, 항상 인간 연주자의 표현성 수준을 일관되게 따라가진 못했다.
  • 번역된 점수(TS)는 표준 점수(S)보다 더 높은 표현성을 보였고, 모델의 출력(G-TS)은 이를 더욱 향상시켜 미세한 표현적 뉘앙스의 효과적인 재구성을 보여주었다.
  • 모델는 강력한 일반화 능력을 보였으며, 알려지지 않은 표준 점수에서도 표현적인 연주를 생성했으며, G-S는 V보다 속도 변동 모델링에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.