Skip to main content
QUICK REVIEW

[論文レビュー] Modeling Musical Context with Word2vec

Dorien Herremans, Ching‐Hua Chuan|arXiv (Cornell University)|Jun 28, 2017
Music and Audio Processing参考文献 16被引用数 14
ひとこと要約

本稿では、ベートーベンのピアノソナタから抽出した音楽スライスの意味的ベクトル表現を学習するために、ネガティブサンプリングを用いたword2vecベースのスキップグラムモデルを提案する。多音的音楽を文脈豊かなセグメントの列として扱い、明示的な音楽的特徴(コードやリズムなど)を用いずに、調性関係を捉える。コサイン類似度に基づく置換により、低調性距離を維持することができ、分布的意味論による音楽的文脈の有効なモデリングを示している。

ABSTRACT

We present a semantic vector space model for capturing complex polyphonic musical context. A word2vec model based on a skip-gram representation with negative sampling was used to model slices of music from a dataset of Beethoven's piano sonatas. A visualization of the reduced vector space using t-distributed stochastic neighbor embedding shows that the resulting embedded vector space captures tonal relationships, even without any explicit information about the musical contents of the slices. Secondly, an excerpt of the Moonlight Sonata from Beethoven was altered by replacing slices based on context similarity. The resulting music shows that the selected slice based on similar word2vec context also has a relatively short tonal distance from the original slice.

研究の動機と目的

  • 音楽的特徴(コードやリズムなど)を明示的に用いずに、word2vecが複雑な多音的音楽的文脈をモデリングできるかを調査すること。
  • ベクトル空間における意味的類似度が、音楽における調性的近接性に対応するかを評価すること。
  • 文脈類似度に基づく音楽スライスの置換を実施し、調性の連続性を評価することで、モデルの実用的有用性を検証すること。
  • 伝統的な音楽学的特徴を超えた、ニューラルネットワークベースの分布的意味論が音楽表現にどのように応用可能かを探索すること。

提案手法

  • 各音楽的楽曲を、ノートオンセット間の最頻回の時間間隔に基づいて、重複のない等長のスライスに分割する。
  • 各スライスをコーパス内の「語」(word)として扱い、保持中の音を含むすべてのアクティブなピッチを保持する。
  • スライスの高次元空間内での密なベクトル表現を学習するため、ネガティブサンプリングを用いたスキップグラムモデルを訓練する。
  • スライスベクトル間のコサイン類似度を用いて、文脈的に類似した音楽的セグメントを同定する。
  • t-SNEを用いて高次元ベクトル空間を低次元化し、可視化することで、調性関係をマッピングする。
  • 元の音楽抜粋からスライスを、モデル内の文脈的に最も類似したスライスに置換し、トネッツに基づく指標を用いて調性距離を測定する。

実験結果

リサーチクエスチョン

  • RQ1rawな音楽スライスを用いて訓練されたword2vecモデルは、明示的な音楽的特徴工学を用いずに、意味的な音楽的文脈表現を学習できるか?
  • RQ2ピッチやコード情報が直接与えられていないにもかかわらず、得られたベクトル空間が、完全第五や augmented fourth(トライトン)といった調性的関係を反映しているか?
  • RQ3word2vecの類似度に基づく音楽スライスの置換によって、音楽抜粋における調性の連続性はどの程度維持されるか?
  • RQ4複数のスライスにまたがる持続音はモデルがどのように処理するか。これにより、どのような制限が明らかになるか?
  • RQ5本モデルは、孤立したコードを超えて、複雑な多音的テクスチャのような音楽的構造に対しても一般化可能か?

主な発見

  • 学習されたベクトル空間のt-SNE可視化から、CとG(完全第五)といった調性的に関連するコードが、明示的な調性情報がなくてもクラスタを形成することが確認された。
  • 調性的に遠い関係にあるスライス(例:EとEb)は、低次元空間で明確に分離したクラスタを形成しており、調性的近接性が埋め込みに符号化されていることが裏付けられた。
  • 元のスライスをコサイン類似度に基づく文脈的に類似したスライスに置換した場合、元のスライスと置換後のスライス間の平均調性距離は低く保たれた(例:D♭メジャー・アコルドの置換で1.25)。
  • 置換後の音楽抜粋が聴覚的・定量的に連続性を保っていることから、モデルが多音的音楽における文脈的類似性を効果的に捉えていることが示された。
  • ベクトルの独立性を考慮しない音楽的声部進行(voice-leading)の制約はモデルが捉えていないことが判明した。特に、音高のレジストレーションを調整することでより良い声部進行が可能になる事例が観察され、声部の独立性をモデリングする点での限界が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。