Skip to main content
QUICK REVIEW

[논문 리뷰] A Survey of AI Music Generation Tools and Models

Yueyue Zhu, Jared Baca|arXiv (Cornell University)|2023. 08. 24.
Music Technology and Sound Studies인용 수 4
한 줄 요약

이 종합 검토는 파arameter 기반, 텍스트 기반(프롬프트 기반), 시각 기반 접근 방식으로 분류된 인공지능 음악 생성 도구 및 모델에 대한 포괄적인 분석을 제공한다. 이들은 기능, 한계, 그리고 기반 메커니즘을 평가하며, 초보자에서 전문가에 이르기까지 다양한 사용자 그룹에서의 투명성, 맞춤형 설정, 사용 용이성에 중점을 둔다.

ABSTRACT

In this work, we provide a comprehensive survey of AI music generation tools, including both research projects and commercialized applications. To conduct our analysis, we classified music generation approaches into three categories: parameter-based, text-based, and visual-based classes. Our survey highlights the diverse possibilities and functional features of these tools, which cater to a wide range of users, from regular listeners to professional musicians. We observed that each tool has its own set of advantages and limitations. As a result, we have compiled a comprehensive list of these factors that should be considered during the tool selection process. Moreover, our survey offers critical insights into the underlying mechanisms and challenges of AI music generation.

연구 동기 및 목표

  • 기능성과 사용자 접근성에 중점을 두어 AI 음악 생성 도구 및 모델에 대한 체계적인 종합 검토를 제공하기.
  • 음악 생성 접근 방식을 세 가지 범주로 분류하기: 파arameter 기반, 텍스트 기반(프롬프트 기반), 시각 기반 방법.
  • 오픈소스 및 상용 AI 음악 도구의 강점과 한계를 평가하기, 특히 투명성, 맞춤형 설정, 음질 측면에서.
  • AI 음악 생성의 주요 과제를 특정하기, 즉 창의성 부족, 장기적 일관성 결여, 모델 해석 가능성 부족.
  • 사용자의 음악적 필요, 기술적 숙련도, 제어 수준에 따라 적절한 도구를 선택하는 데 도움을 주기.

제안 방법

  • AI 음악 생성 도구를 세 가지 유형으로 분류: 파arameter 기반(예: Mubert, Boomy), 텍스트 기반(예: SongR, Aiva.ai), 시각 기반(예: 비디오-에서-MIDI 모델).
  • 공개 데모, 문서, 기술 설명을 바탕으로 도구를 수집하고 분석하며, 모델의 투명성과 사용자 인터페이스 설계에 중점을 둔다.
  • 다양한 악기 지원, 음악 편집의 유연성, 소프트웨어 싱어라이저와의 통합 등 기준을 사용해 모델을 평가한다.
  • 시퀀스 생성을 위해 MusicVAE, TransformerVAE, 확산 모델(예: Denoising Diffusion Probabilistic Models) 등의 신경망 아키텍처를 분석한다.
  • 공연 영상에서의 신체 관절 지점 정보를 사용해 MIDI 표현을 유추하는 시각 기반 모델을 분석하며, 영상 기반 음악 생성을 가능하게 한다.
  • MIDI가 후처리 편집 가능성을 높이고, 합성 이전에 편집이 가능한 해석 가능한 중간 표현 방식으로서의 역할을 평가한다.

실험 결과

연구 질문

  • RQ1파arameter 기반, 텍스트 기반, 시각 기반 AI 음악 생성 도구는 功能, 사용자 제어, 출력 품질 측면에서 어떻게 다릅니까?
  • RQ2상용 AI 음악 도구의 주요 기술적 및 사용성 한계는 무엇이며, 특히 투명성과 모델 설명 가능성 측면에서 어떻게 나타납니까?
  • RQ3AI가 생성한 음악은 얼마나 오랜 구성에서 음악적 일관성과 스타일 일관성을 유지할 수 있습니까?
  • RQ4다양한 모델 아키텍처(예: VAE, Transformer, 확산 모델)는 생성 음악의 품질과 창의성에 어떤 영향을 미칩니까?
  • RQ5MIDI 표현 방식은 AI 음악 생성에서 이해 가능성과 후처리의 유연성을 어떻게 가능하게 합니까?

주요 결과

  • Mubert나 Boomy와 같은 파arameter 기반 도구는 분위기, 장르, 템포 등의 사용자 정의 파라미터를 통해 빠른 음악 생성이 가능하지만, 깊은 맞춤형 설정이나 모델 투명성에 빈도가 낮습니다.
  • 텍스트 기반 및 프롬프트 기반 모델, 특히 확산 아키텍처를 사용하는 모델들은 더 음악적으로 정교한 구성물을 생성하지만, 악기 선택 및 배열 측면에서 영향을 받을 수 있습니다.
  • 시각 기반 모델은 공연 영상에서의 신체 관절 지점 정보를 사용해 MIDI 표현으로 변환하는 데 성공하며, 영상 기반 음악 생성을 가능하게 하고, 이해 가능하고 편집 가능한 출력 결과를 제공합니다.
  • 진전이 있었음에도 불구하고, 대부분의 모델는 일관된 모티프나 구조적 방향성을 유지하는 장기적 음악 생성에 어려움을 겪고 있어, 장기적 일관성 문제를 나타냅니다.
  • MIDI 기반 출력은 높은 이해 가능성과 편집 가능성을 제공하지만, 청취 가능한 웨이브폼을 생성하기 위해 외부 소프트웨어 싱어라이저가 필요하여 워크플로우에 복잡성을 더합니다.
  • 상용 도구는 일반적으로 기반 모델 아키텍처를 은폐하고 있어 재현 가능성과 종합적 평가를 제한하며, 특히 기술적 통찰이 필요한 연구자들에게 어려움을 줍니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.