Skip to main content
QUICK REVIEW

[論文レビュー] Talking Drums: Generating drum grooves with neural networks

Patrick Hutchings|arXiv (Cornell University)|Jun 29, 2017
Music and Audio Processing参考文献 6被引用数 5
ひとこと要約

本論文では、音声機械翻訳にインspiredされたシーケンス・ツー・シーケンスRNNモデルを提示し、スタイル・コンディショナルなトークン化スキームを用いてキックドラム入力からフル・ドラムキットグルーブを生成する。最も優れた性能は、各分割ごとに最も確率の高い3つのドラムヒットをサンプリングすることで達成され、ユーザーレビューで39%の「良い」との評価を得た。性能は音楽的スタイルに強く依存する。

ABSTRACT

Presented is a method of generating a full drum kit part for a provided kick-drum sequence. A sequence to sequence neural network model used in natural language translation was adopted to encode multiple musical styles and an online survey was developed to test different techniques for sampling the output of the softmax function. The strongest results were found using a sampling technique that drew from the three most probable outputs at each subdivision of the drum pattern but the consistency of output was found to be heavily dependent on style.

研究の動機と目的

  • 多様な音楽的スタイルに適合するフル・ドラムキットパートをリアルタイムに生成できるパーカッションエージェントの開発。
  • 元々機械翻訳を目的として開発されたシーケンス・ツー・シーケンスニューラルネットワークを、音楽的に整合性のあるドラムパターンの生成に適応すること。
  • モデルのソフトマックス出力のサンプリング戦略を評価・最適化し、聴覚的な音楽的質を向上させること。
  • 出力品質を確率分布に関連付けることで、マルチエージェント音楽構成システムにおける自己評価を可能にすること。
  • ドラムグルーブを、共通の意味的意図を持つ構造的・マルチインstrument「言語」としてモデル化する可能性を検討すること。

提案手法

  • ポップ、ロック、ファンク、アフロ・キューバンのジャンルから250件のドラムキット譜面(1ジャンルあたり7,000~7,500小節)をMusicXML形式に変換し、4/4小節ごとに48分割にトークン化した。
  • 各ドラム種別(例:Kをキック、Sをスネア)に固有のアルファベットトークンを割り当て、スタイル記述子を特別トークンとして使用することで、1つのネットワーク内で複数のスタイルをモデル化可能とした。
  • 128ユニットの層と3段スタックされた層を備えたRNNシーケンス・ツー・シーケンスアーキテクチャを採用し、学習率0.55と勾配降下法最適化で訓練した。
  • エンコーダー入力を逆転させ、キックドラムパターンを入力シーケンスとして処理するため、ワンホットエンコーディングを用いた。
  • 3つのサンプリング手法を実装した:グリーディデコード、全確率ルーレットホイールサンプリング、トップ3確率ルーレットホイールサンプリング。
  • ユーザーがキックパターンを入力し、サンプリングされたドラムサウンドでリアルタイムに生成されたグルーブを評価できるウェブインターフェースを開発した。

実験結果

リサーチクエスチョン

  • RQ1キックドラム入力からドラムタブローチャーでトレーニングされたシーケンス・ツー・シーケンスニューラルネットワークは、音楽的に整合性のあるフル・ドラムキットグルーブを生成できるか?
  • RQ2モデルのソフトマックス出力に対するどのサンプリング戦略が、人間の聴衆にとって最も聴覚的に快適なドラムグルーブを生み出すか?
  • RQ3特にアフロ・キューバンとファンクにおいて、生成されたグルーブの評価品質はどのように変動するか?
  • RQ4モデルの内部確率分布を用いて、マルチエージェント音楽構成システムにおける自己評価を可能にできるか?
  • RQ5アフロ・キューバン音楽におけるクラーベパターンのようなスタイル制約は、モデルのトレーニングおよび生成プロセスから自然に出現するか?

主な発見

  • トップ3確率サンプリング法(手法3)が、オンラインレビューで最多の「良い」との評価(39%)を達成し、グリーディデコードおよび全確率ルーレットサンプリングを上回った。
  • グリーディデコーダー(手法1)は、最も一貫性はあったが、最も好まれなかった結果を示し、70%の評価が「平均」と分類された。
  • 全確率にわたるルーレットホイールサンプリング(手法2)は、「悪い」との評価が最も高く(28%)なっており、過剰なランダム化が音楽的整合性を損なったことが示された。
  • 平均評価は、初期確率が0.7~0.8の間にあるドラムノートで最高値1.54を記録し、聴覚的質の「最適領域」が確率の信頼性に依存することを示した。
  • アフロ・キューバンスタイルのパターンは、他のスタイル(16~18%)と比較して著しく「悪い」との評価が高かった(24%)、すなわち、熟練したリズム的構造を捉える能力に限界がある可能性がある。
  • モデルの出力品質は非常にスタイル依存であり、ポップ、ロック、ファンクでは高い一貫性と高い聴衆評価を得たが、アフロ・キューバンパターンではそれらを下回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。