Skip to main content
QUICK REVIEW

[論文レビュー] Vector Quantized Contrastive Predictive Coding for Template-based Music Generation

Gaëtan Hadjeres, Léopold Crestel|arXiv (Cornell University)|Apr 21, 2020
Music and Audio Processing参考文献 39被引用数 11
ひとこと要約

本稿では、バッハのコラールにおけるバーやその他の意味のある構造的単位をコードブックにクラスタリングすることで、自己教師あり手法としてのベクトル量子化対照的予測符号化(VQ-CPC)を提案する。対照的損失による情報含量の制御と、変換器デコーダーにおける特化したアテンション機構を用いることで、教師なしまたはアノテーションなしに、与えられたテンプレートと知覚的に類似した高品質で一貫性のある音楽的バリエーションを生成する。

ABSTRACT

In this work, we propose a flexible method for generating variations of discrete sequences in which tokens can be grouped into basic units, like sentences in a text or bars in music. More precisely, given a template sequence, we aim at producing novel sequences sharing perceptible similarities with the original template without relying on any annotation; so our problem of generating variations is intimately linked to the problem of learning relevant high-level representations without supervision. Our contribution is two-fold: First, we propose a self-supervised encoding technique, named Vector Quantized Contrastive Predictive Coding which allows to learn a meaningful assignment of the basic units over a discrete set of codes, together with mechanisms allowing to control the information content of these learnt discrete representations. Secondly, we show how these compressed representations can be used to generate variations of a template sequence by using an appropriate attention pattern in the Transformer architecture. We illustrate our approach on the corpus of J.S. Bach chorales where we discuss the musical meaning of the learnt discrete codes and show that our proposed method allows to generate coherent and high-quality variations of a given template.

研究の動機と目的

  • 教師なしまたはアノテーションを必要とせず、テンプレート・シーケンスに基づいた音楽的バリエーションを生成する自己教師あり手法の開発。
  • 意味のある部分列をコードブックにクラスタリングすることで、構造的離散的シーケンス(例:音楽のバーや文)の高レベルで分離された表現を学習すること。
  • 対照的予測符号化の目的関数を通じて、学習された離散的表現内の情報含量を制御することで、制御可能な生成を可能にすること。
  • 変換器デコーダーに特化したアテンション機構を設計し、離散的コード列に効率的に条件づけることで、一貫性があり高精度な生成を実現すること。
  • J.S. バッハのコラールを用いた記号的音楽生成において、知覚的に意味があり、音楽的に一貫性のあるバリエーションを示すことで、本手法の有効性を実証すること。

提案手法

  • 本手法は、部分列の文脈的表現を学ぶために対照的予測符号化(CPC)フレームワークを用い、その後、ベクトル量子化(VQ)によりそれらを離散的コードブックにマッピングする。
  • 部分列の表現が将来の部分列を予測できるようにするため、ノイズ対照推定(NCE)損失が適用され、意味のあるクラスタリングを促進する。
  • すべてのコードが使用されるよう促すために、コードブックはコミットメント損失で訓練され、空のクラスタが生じず、安定した表現学習が保証される。
  • 離散的コードは、変換器デコーダーにおける条件付けとして使用され、変更されたマルチヘッド自己アテンション機構により、効率的かつ一貫性のある自己回帰的生成が可能になる。
  • モデルはエンドツーエンドで訓練される:エンコーダーが入力シーケンスから表現を抽出し、それらがベクトル量子化されて離散的コードに変換され、デコーダーがこれらのコードに条件づけて新しいシーケンスを生成する。
  • データオーギュメンテーションや補助タスクを必要としないが、対照的損失のみで、トランスポジション不変で知覚的に意味のあるクラスタを学習する。

実験結果

リサーチクエスチョン

  • RQ1教師なしまたはアノテーションなしで、テンプレート・シーケンスの音楽的に一貫性のあるバリエーションを生成できる自己教師あり表現学習手法は存在するか?
  • RQ2離散的表現の情報含量をどのように制御すれば、意味のあるバリエーション生成が可能になるか?
  • RQ3ベクトル量子化と対照的予測符号化を組み合わせることで、バーレベルの構造のような、解釈可能な高レベルの抽象表現を音楽的シーケンスから得られるか?
  • RQ4変換器デコーダーにおける特化したアテンション機構は、離散的コード列に条件づけられた生成バリエーションの品質と一貫性を向上させるか?
  • RQ5学習された離散的コードは、キーやボイスレンジのような文脈で意味的で知覚的に解釈可能な意味を持つのか?

主な発見

  • VQ-CPCモデルは、明示的な教師信号なしに、キーやスオラノ・ボイスレンジといった知覚的に意味のある音楽的特徴に対応する離散的コードを学習した。
  • モデルは、元のテンプレートと調性的・構造的に類似した、高品質で一貫性のあるバッハ・コラールのバリエーションを生成した。
  • コードブックは完全に活用されており、空のクラスタが存在しなかったため、ベクトル量子化と対照的損失による安定的かつ効果的な表現学習が実現された。
  • 対照的損失を通じて表現内の情報含量を制御することで、補助損失やマスクサイズのようなハイパーパrameterを必要とせず、制御可能な生成が達成された。
  • 変換器デコーダーに提案されたアテンション機構により、離散的コード列に条件づけられた効率的で一貫性のある自己回帰的生成が可能となり、定量的・定性的にベースライン手法を上回った。
  • データオーギュメンテーションなしでも、モデルはトランスポジション不変のクラスタを学習し、表現空間におけるピッチシフトに対して強い耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。