Skip to main content
QUICK REVIEW

[論文レビュー] From Bach to the Beatles: The simulation of human tonal expectation using ecologically-trained predictive models

Carlos Cancino-Chacón, Maarten Grachten|arXiv (Cornell University)|Jul 19, 2017
Music and Audio Processing被引用数 7
ひとこと要約

本稿では、バッハのウェルトテン・クラヴィーアやビートルズの実際の音楽録音から得た生のオーディオデータを学習させた再帰的ニューラルネットワーク(RNN)が、人間のプローブ・トーン評価と類似した調性の期待を示すことを示している。これは、調性構造が暗黙的に学習されていることを示している。主な発見は、調性構造は正確な音楽的予測に不可欠であるが、それだけでは十分ではなく、リズムやボイス・リーディングといった時間的側面も予測に重要な役割を果たしていることである。

ABSTRACT

Tonal structure is in part conveyed by statistical regularities between musical events, and research has shown that computational models reflect tonal structure in music by capturing these regularities in schematic constructs like pitch histograms. Of the few studies that model the acquisition of perceptual learning from musical data, most have employed self-organizing models that learn a topology of static descriptions of musical contexts. Also, the stimuli used to train these models are often symbolic rather than acoustically faithful representations of musical material. In this work we investigate whether sequential predictive models of musical memory (specifically, recurrent neural networks), trained on audio from commercial CD recordings, induce tonal knowledge in a similar manner to listeners (as shown in behavioral studies in music perception). Our experiments indicate that various types of recurrent neural networks produce musical expectations that clearly convey tonal structure. Furthermore, the results imply that although implicit knowledge of tonal structure is a necessary condition for accurate musical expectation, the most accurate predictive models also use other cues beyond the tonal structure of the musical context.

研究の動機と目的

  • 生態的条件下で学習された予測モデルが、行動研究で観察された人間の調性的期待を模倣できるかどうかを調査すること。
  • 記号的表現ではなく生のオーディオで学習させた再帰的ニューラルネットワーク(RNN)が、露出によって暗黙的に調性構造を学習できるかどうかを特定すること。
  • 計算モデルにおいて、調性構造が正確な音楽的予測に必要な条件であるかどうかを評価すること。
  • 調性以外の側面、例えばリズム、ボイス・リーディング、終止形といった要因が、調性構造を超えて音楽的予測にどのように寄与するかを調査すること。

提案手法

  • バッハのウェルトテン・クラヴィーアおよびビートルズの商業的CD録音の生オーディオスペクトログラム(CQT)を用いて、さまざまなタイプの再帰的ニューラルネットワーク(RNN)を訓練する。
  • 予測符号化の原則を用いる:モデルは、現在の文脈に基づいて将来の音楽的出来事の予測誤差を最小化するように訓練される。
  • 人間のプローブ・トーン評価(Krumhansl&Kessler, 1982)との相関を用いて、モデルの予測を評価し、ピアソン相関係数を指標とする。
  • 順序を入れ替えた音声データと元のデータの両方でモデルの性能を比較し、逐次的構造の役割を隔離する。
  • 平均交差エントロピー損失を用いて予測精度を測定し、人間のプローブ・トーンプロファイルとの平均相関を用いて調性構造の度合いを測定する。
  • 単音ピアノとマルチインストゥルメンタル・ポップ音楽の違いなど、異なる音楽的ジャンルや構造的複雑さの文脈でモデルの挙動を分析する。

実験結果

リサーチクエスチョン

  • RQ1生の音楽録音から学習させたRNNは、人間の聴取者と同様に、調性構造を学習できるか?
  • RQ2予測モデルにおいて調性構造は正確な音楽的予測に不可欠な条件か?
  • RQ3リズム、ボイス・リーディング、終止形といった非調性的側面が、調性構造を超えて音楽的予測にどの程度寄与しているか?
  • RQ4時間的に入れ替えた音声データで学習させた場合、モデルの性能と調性的期待にどのような影響が生じるか。これは、逐次的順序の役割を明らかにするものか?

主な発見

  • ビートルズおよびバッハのWTCの生オーディオから学習させたRNNは、人間のプローブ・トーン評価と強く相関する音楽的予測を示しており、人間の調性階層を効果的に模倣していることが示された。
  • 入れ替えられた音声データで学習させたモデルは、特にバッハのWTCにおいて、予測精度が著しく低下し、調性構造の表現も弱くなることが判明した。これは、時間的順序が学習に重要であることを示している。
  • 調性構造は、正確な音楽的予測に不可欠な条件である。予測誤差が低いモデルは、常に人間の評価と高い相関を示した。
  • しかし、調性構造だけでは正確な予測に十分ではなく、高水準の調性相関を示すモデルでも高い予測誤差を示すことがある。これは、リズムやボイス・リーディングといった追加の手がかりの影響があることを示している。
  • データの入れ替えによる悪影響は、バッハのWTCにおいてビートルズの録音よりも顕著であった。これは、バッハの作品に比類なき調性的・メロディックな複雑さとキー変化が多用されているためと考えられる。
  • マルチインストゥルメンタルで比較的単純な音楽的構造を持つビートルズの録音であっても、RNNは依然として効果的に調性構造を学習している。これは、生態的妥当な訓練データが、強固な知覚的学習を支える可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。