Skip to main content
QUICK REVIEW

[論文レビュー] Virtual Piano using Computer Vision

Seongjae Kang, Jaeyoon Kim|arXiv (Cornell University)|Oct 28, 2019
Music and Audio Processing参考文献 13被引用数 7
ひとこと要約

この論文では、ハフ変換、二値化しきい値処理、および新しい空間時間的CNNアーキテクチャを用いて、視覚入力からのみキーボードの押下状態と速度を検出するコンピュータビジョンベースのバーチャルピアノシステムを提案する。スタックド差分画像特徴量を用いることで、白色鍵と黒色鍵の強度レベル分類においてそれぞれ53.2%および57.8%の精度を達成し、微小な動きに敏感であるため、光流に基づく手法を上回る性能を発揮する。

ABSTRACT

In this research, Piano performances have been analyzed only based on visual information. Computer vision algorithms, e.g., Hough transform and binary thresholding, have been applied to find where the keyboard and specific keys are located. At the same time, Convolutional Neural Networks(CNNs) has been also utilized to find whether specific keys are pressed or not, and how much intensity the keys are pressed only based on visual information. Especially for detecting intensity, a new method of utilizing spatial, temporal CNNs model is devised. Early fusion technique is especially applied in temporal CNNs architecture to analyze hand movement. We also make a new dataset for training each model. Especially when finding an intensity of a pressed key, both of video frames and their optical flow images are used to train models to find effectiveness.

研究の動機と目的

  • 音声入力なしで、視覚データのみを用いて完全なピアノ演奏分析を可能にする。
  • どの鍵が押されたかを検出するだけでなく、各鍵押下の強度を検出する。
  • 微細な手の動きや鍵圧の変動に対応できる新しいデータセットおよびモデルアーキテクチャを開発する。
  • 強度推定において、光流とスタックド画像特徴量の有効性を評価する。

提案手法

  • 入力動画フレームに対してハフ変換と二値化しきい値処理を用いてピアノ鍵盤と個々の鍵を検出する。
  • 現在のフレームと背景画像との差分画像から特徴ベクトルを抽出し、鍵押下の変化を捉える。
  • 空間的および時間的特徴をスタックド画像系列から組み合わせる3次元CNNアーキテクチャで、早期融合を適用する。
  • 光流マップを別個の3次元CNNバージョンの入力として用い、動きに基づく強度検出を比較する。
  • 強度レベルのラベル連続性を考慮するため、Kullback–Leibler散逸損失を用いたラベル分布ラベル付けでモデルを訓練する。
  • 両方の強度および押下検出タスクにおいて、固定学習率0.001で15エポックにわたってAdam最適化手法を用いる。

実験結果

リサーチクエスチョン

  • RQ1音声信号なしで、視覚データのみを用いてピアノ演奏における鍵押下強度を正確に推定できるか?
  • RQ2スタックド差分画像と比較して、光流は微細な鍵圧変動を検出するのにどの程度有効か?
  • RQ33次元CNNにおける空間的および時間的特徴の早期融合は、標準的な2次元CNNに比べて強度分類性能を向上させるか?
  • RQ4Kullback–Leibler散逸損失を用いたラベル分布モデリングは、連続的な強度ラベルに対する性能にどのような影響を与えるか?
  • RQ5入力解像度および動きスケールは、光流に基づく強度推定にどのような影響を与えるか?

主な発見

  • このシステムは、音声なしの静止動画からのみ視覚的手がかりを用いて、どの鍵が押されたか、そしてその持続時間も正確に検出できる。
  • スタックド差分画像特徴量を用いると、白色鍵の強度分類で53.2%、黒色鍵で57.8%の精度を達成した。
  • 光流ベースの入力では、白色鍵で50.2%、黒色鍵で51.3%の精度にとどまり、微小で正確な鍵の動きに不向きであることが示された。
  • 性能の差は、ピアノ演奏で一般的な微細な手の動きを検出するには、光流が大規模なジェスチャーに比べて不適切である可能性を示唆している。
  • Kullback–Leibler散逸損失を用いたラベル分布モデリングにより、連続的な強度ラベルに対するモデルの一般化性能が向上した。
  • 本手法により、音声なしでピアノ演奏の高精度な視覚的分析が可能であることが示され、音楽技術および演奏分析分野における新たな応用が可能となる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。