Skip to main content
QUICK REVIEW

[論文レビュー] Computer Assisted Composition with Recurrent Neural Networks

Christian Walder, Dongwoo Kim|arXiv (Cornell University)|Dec 1, 2016
Music and Audio Processing参考文献 15被引用数 4
ひとこと要約

本稿では、LSTMベースの再帰的ニューラルネットワークと、有限状態マシンによる人間のガイド付き制約を組み合わせたハイブリッドシステムを提案し、コンピュータ支援音楽作曲を可能にする。非マルコフ連鎖モデルにおける近似サンプリングのための効率的な逐次モンテカルロ(SMC)手法を導入し、条件付き確率最大化のためのビームサーチと比較することで、許容的な制約下でも、より音楽的に多様で自然な結果が得られることを示している。

ABSTRACT

Sequence modeling with neural networks has lead to powerful models of symbolic music data. We address the problem of exploiting these models to reach creative musical goals, by combining with human input. To this end we generalise previous work, which sampled Markovian sequence models under the constraint that the sequence belong to the language of a given finite state machine provided by the human. We consider more expressive non-Markov models, thereby requiring approximate sampling which we provide in the form of an efficient sequential Monte Carlo method. In addition we provide and compare with a beam search strategy for conditional probability maximisation. Our algorithms are capable of convincingly re-harmonising famous musical works. To demonstrate this we provide visualisations, quantitative experiments, a human listening test and audio examples. We find both the sampling and optimisation procedures to be effective, yet complementary in character. For the case of highly permissive constraint sets, we find that sampling is to be preferred due to the overly regular nature of the optimisation based results. The generality of our algorithms permits countless other creative applications.

研究の動機と目的

  • 高度なニューラルシーケンスモデルを用いて、人間の作曲家との共同作曲を可能にするシステムの開発。
  • 最適化ベース手法による出力の過度な規則的パターンの制限を克服するため、確率的サンプリングの導入。
  • 従来のマルコフ連鎖モデルと有限状態制約の研究を、LSTMのような非マルコフ連鎖で表現力のあるシーケンスモデルへ一般化。
  • 音楽的に整合的で多様な再ハーモナイゼーションを生成する際、サンプリングと最適化の有効性を評価。
  • 音声例、可視化、および人間の聴取テストを通じて、本手法の実用性と創造的潜在能力を実証。

提案手法

  • タイミングと持続時間の条件下での音符シーケンスの条件付き分布をモデル化するために、長短記憶(LSTM)再帰的ニューラルネットワークを採用。
  • 人間の入力を、許可される音楽的シーケンスの言語を定義する有限状態マシン(FSM)として表現。
  • システム的リサンプリングを用いた逐次モンテカルロ(SMC)を用い、FSM制約下での条件付き分布からの近似推論とサンプリングを実行。
  • 同じ制約下で条件付き確率を最大化する代替手法として、ビームサーチを実装。
  • 因果的要因分解を適用し、タイミングと持続時間の条件下での音符シーケンスの条件付き確率をモデル化することで、計算を効率化。
  • サンプリングと最適化戦略を統合し、柔軟でインタラクティブな音楽作曲を可能に。

実験結果

リサーチクエスチョン

  • RQ1LSTMのような非マルコフ連鎖モデルを、人間が提供する制約と効果的に組み合わせて創造的音楽作曲に応用できるか。
  • RQ2許容的な制約下で、サンプリングベースと最適化ベースのアプローチは、音楽的多様性と整合性の観点でどのように比較されるか。
  • RQ3逐次モンテカルロ(SMC)が、有限状態マシンによる制約を受ける表現力のある非マルコフ連鎖モデルにおいて、効果的な近似推論を可能にするか。
  • RQ4本システムは、リズム的構造と音楽的意図を保ちながら、古典的楽曲の信頼性のある再ハーモナイゼーションを生成できるか。
  • RQ5人間の聴取者にとって、SMCによって生成された音楽とビームサーチ出力の音楽的質感はどのように認識されるか。

主な発見

  • 逐次モンテカルロ(SMC)サンプリング手法は、許容的な制約下でも、ビームサーチよりも音楽的に多様で自然な再ハーモナイゼーションを生成した。
  • ビームサーチの結果は、制約がゆるい場合に特に過度に規則的かつ反復的であることが判明し、モデルが高確率だが重複するパターンを好む傾向に起因した。
  • 少なくとも1つのヴォイスが固定制約として与えられた場合、サンプリングと最適化の両手法が良好に機能した。これは、わずかな人間の入力でも高品質な作曲を導けることを示している。
  • パーティクルフィルタ(SMC)は、制約なしの場合と比較してわずかに性能が劣ったが、制約なし実行で見られた最悪の和音解決を回避した。
  • 人間の聴取テストの結果、SMCによって生成された音楽はビームサーチ出力よりも音楽的に興味深く多様であると認識された。
  • 本システムは、メロディを固定することで、モーツァルトの弦楽四重奏曲を再ハーモナイズし、和声的に整合的でスタイルに適した伴奏を生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。