Skip to main content
QUICK REVIEW

[論文レビュー] Artificial Musical Intelligence: A Survey

Elad Liebman, Peter Stone|arXiv (Cornell University)|Jun 17, 2020
Music and Audio Processing参考文献 278被引用数 6
ひとこと要約

本サーベイは、音楽の知覚、認知、生成を統合する多次元的分野としての人工音楽的知能(AMI)を定義し、音楽的知能の構成要素の分類法を提唱するとともに、リアルタイムで音楽を知覚・推論・創造する統合的でエンドツーエンドのAIシステムの構築を提言する。文化的に意味のある音楽との相互作用を進めるために、大規模なアノテート済み音声ベンチマークと人間中心の評価の必要性を強調する。

ABSTRACT

Computers have been used to analyze and create music since they were first introduced in the 1950s and 1960s. Beginning in the late 1990s, the rise of the Internet and large scale platforms for music recommendation and retrieval have made music an increasingly prevalent domain of machine learning and artificial intelligence research. While still nascent, several different approaches have been employed to tackle what may broadly be referred to as "musical intelligence." This article provides a definition of musical intelligence, introduces a taxonomy of its constituent components, and surveys the wide range of AI methods that can be, and have been, brought to bear in its pursuit, with a particular emphasis on machine learning methods.

研究の動機と目的

  • 人工知能における「音楽的知能」の概念を定義・形式化し、その複雑さと多面性に対処すること。
  • 知覚、抽象化、モデリング、生成を含む、音楽的知能の根幹をなす要素の包括的な分類法を確立すること。
  • 音楽分析および生成に応用された既存のAIおよび機械学習手法を調査し、統合性とスケーラビリティの欠如を浮き彫りにすること。
  • 画像認識分野におけるImageNetに類似した大規模かつ豊富にアノテートされた音声ベンチマークを基盤として整備することの必要性を主張すること。
  • 人間の音楽家と閉ループで協働するリアルタイムで相互作用可能なAI音楽システムの開発を促進すること。

提案手法

  • ビート、ピッチ、トーンカラー、コード、インターバル、音量、テンポ、プレイリストを基礎的構成要素として含む、音楽的知能構成要素の構造的分類法を提唱する。
  • ルールベースの作曲、マルコフ連鎖、確率的モデリング、文法ベースのシステム、進化的アルゴリズムを含む、音楽分野における歴史的および現代的なAIアプローチをレビューする。
  • 音楽情報検索(MIR)分野における最新の機械学習応用、例えばジャンル分類、調性解析、メロディックセグメンテーション、パフォーマンスモデリングを検討する。
  • 知覚、推論、リアルタイム音楽生成を統合するエンドツーエンドAIシステムの概念を導入し、人間とAIの協働的音楽的文脈での応用を想定する。
  • 主観的感想を超えてAI生成音楽を評価するための、専門家パanelとクラウドソーシングを組み合わせた二重評価フレームワークを提言する。
  • 人間の知覚的・感情的反応と整合性を持つAI設計を実現するため、認知科学および音楽認知分野の知見をAI設計に統合するよう提言する。

実験結果

リサーチクエスチョン

  • RQ1人工知能における「音楽的知能」とは何か。形式的に定義され、測定可能な構成要素に分解可能か。
  • RQ2既存のAIおよび機械学習手法は、音楽分析および生成に体系的に分類・適用可能か。
  • RQ3人間の音楽家とリアルタイムで協働して音楽を創造可能なエンドツーエンドAIシステムを構築するにあたり、主な課題は何か。
  • RQ4ImageNetに類似した大規模かつ豊富にアノテートされた音声データセットをどのように開発し、音楽AI研究の共通ベンチマークとして機能させるか。
  • RQ5芸術的、知覚的、認知的次元において、AI生成音楽を客観的に比較可能にするために必要な評価基準およびフレームワークは何か。

主な発見

  • 音楽的知能は、知覚、認知、創造的生成を統合する多面的構造であり、複数のAI分野の統合が不可欠である。
  • 音楽情報検索やアルゴリズム的作曲分野での顕著な進展にもかかわらず、大多数のシステムは機能的に孤立しており、エンドツーエンドの整合性に欠けている。
  • ImageNetに類似した、複雑なアノテーションを備えた大規模な音声レベルのベンチマークの欠如が、音楽AIの発展を妨げる主要な障壁のままだ。
  • 現在のAI生成音楽の評価は主観的または集団的感想に大きく依存しており、より厳密で専門家による検証が行われ、マルチモーダルな評価プロトコルの導入が不可欠である。
  • 音楽AIと認知科学の橋渡しにより、人間の知能と整合性を持つシステムが実現され、人工的および人間の音楽認知の理解が深まる可能性がある。
  • リアルタイムで協働する音楽生成システムは、知覚、モデリング、予測、意思決定の分野におけるAI分野のイノベーションを牽引する統合的課題である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。