Skip to main content
QUICK REVIEW

[論文レビュー] Deep Predictive Models in Interactive Music

Charles Martín, Kai Olav Ellefsen|arXiv (Cornell University)|Jan 31, 2018
Music Technology and Sound Studies参考文献 13被引用数 3
ひとこと要約

本論文は、デジタル・ミュージカル・インストゥルメント(DMIs)における深層予測モデルが、音楽的パフォーマンスにおける人間の認知的予測をどのように拡張するかを調査している。リアルタイムでの音楽的継続、適応的制御、アンサンブル・インタラクションを可能にする。マッピングとモデリングを予測タスクとして再定式化することで、著者らは再帰的ニューラルネットワーク(RNNs)やその他の機械学習モデルが、長期記憶と知的な反応性を備えた表現的でインタラクティブな音楽システムを強化することを示している。

ABSTRACT

Musical performance requires prediction to operate instruments, to perform in groups and to improvise. In this paper, we investigate how a number of digital musical instruments (DMIs), including two of our own, have applied predictive machine learning models that assist users by predicting unknown states of musical processes. We characterise these predictions as focussed within a musical instrument, at the level of individual performers, and between members of an ensemble. These models can connect to existing frameworks for DMI design and have parallels in the cognitive predictions of human musicians. We discuss how recent advances in deep learning highlight the role of prediction in DMIs, by allowing data-driven predictive models with a long memory of past states. The systems we review are used to motivate musical use-cases where prediction is a necessary component, and to highlight a number of challenges for DMI designers seeking to apply deep predictive models in interactive music systems of the future.

研究の動機と目的

  • 予測機械学習モデルがデジタル・ミュージカル・インストゥルメント(DMIs)における音楽的パフォーマンスをどのように支援するかを調査すること。
  • DMIsにおける予測モデルを、楽器レベル、パフォーマー・レベル、アンサンブル・レベルに分類して特定すること。
  • インタラクティブ音楽におけるマッピングとモデリングを予測の形として再定式化し、それをミュージシャンの認知プロセスと結びつけること。
  • 今後のDMI設計における深層学習の統合における課題と機会を浮き彫りにすること。
  • 特にセンサ入力から音声出力へのエンド・ツー・エンド学習を可能にする予測を、インタラクティブ音楽システムの統合的フレームワークとして提唱すること。

提案手法

  • 予測のレベルに応じて既存のDMIシステムを分類する:楽器レベル(例:ジェスチャーから音へのマッピング)、パフォーマー・レベル(例:音楽的フレーズの継続)、アンサンブル・レベル(例:グループ間の相互作用の予測)。
  • 文献から18のDMIシステムと2つの自社開発システム(GloveTalk II, PiaF)をレビューし、その機械学習モデル、入力、出力を分析する。
  • 再帰的ニューラルネットワーク(RNNs)、サポートベクターマシン(SVMs)、隠れマルコフモデル(HMMs)、その他のモデルを用いて、音楽的シーケンスをモデル化し、センサデータを音声パラメータにマッピングする。
  • 音楽的マッピング(制御から音へのマッピング)とモデリング(音楽的プロセスの表現)を、別個ではあるが関連する予測の形として定式化する。
  • 長期記憶と文脈に配慮した処理を通じて、リズム、和声、メロディといった時間的構造がどのように処理されるかを分析する。
  • 深層学習モデル、特にRNNsが、センサデータが直接表現的かつ適応的な音声生成を駆動するエンド・ツー・エンドの予測システムを可能にすると提言する。

実験結果

リサーチクエスチョン

  • RQ1DMIsにおける深層予測モデルは、音楽的パフォーマンスにおける認知的予測をどのように支援・拡張するか?
  • RQ2インタラクティブ音楽におけるマッピングとモデリングは、どのように予測タスクとして再解釈できるか?
  • RQ3リアルタイムで表現的な音楽的インタラクションを実現するための予測モデルを搭載したDMIを設計するにあたり、主な課題は何か?
  • RQ4RNNs、HMMs、SVMsなどの異なる機械学習モデルは、楽器レベル、パフォーマー・レベル、アンサンブル・レベルで予測をどのように支援するか?
  • RQ5将来のインタラクティブ音楽システムに予測知能を統合するための設計原則とフレームワークは何か?

主な発見

  • 特にRNNsを用いたDMIsにおける予測モデルは、長期間にわたる音楽的状態の記憶を可能にし、文脈に配慮した音楽的継続と適応を実現する。
  • AI Duet や RoboJam といったシステムは、RNNsを用いてシンボリック音楽入力を用いてリアルタイムで音楽的フレーズを継続し、パフォーマー・レベルの予測の有効性を示している。
  • MalLo(パーカッション・ストロークの予測) や Neural Touchscreen Ensemble(ジェスチャークラスの予測) といったモデルにより、共同即興演奏におけるアンサンブル・レベルの予測が実現可能であることが示された。
  • BRAAHMSにおけるfNIRSおよびBCIの使用は、脳波信号が予測的和声伴奏の入力として利用可能であることを示しており、センサモダリティの拡張を示している。
  • 潜在的可能性は大きいものの、RNNsのような深層学習モデルはまだDMIsで広く採用されていないことから、実装のギャップが存在することが示された。
  • 予測モデルの統合により、音楽的表現性が向上し、特にライブパフォーマンスや即興演奏の文脈で、新たなクリエイティブな可能性が開かれた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。