Skip to main content
QUICK REVIEW

[論文レビュー] Perceived Audiovisual Quality Modelling based on Decison Trees, Genetic Programming and Neural Networks

Edip Demirbilek, Jean‐Charles Grégoire|arXiv (Cornell University)|Dec 6, 2017
Image and Video Quality Assessment参考文献 21被引用数 3
ひとこと要約

本稿では、リアルタイムマルチメディアデータセットから抽出したビットストリーム特徴量から直接音声視覚品質を予測するための機械学習モデル——特にランダムフォレスト、バギング、ディープラーニング、遺伝的プログラミング——を提案する。125の相関特徴量を有するINRS音声視覚品質データセットを用いて、ランダムフォレストとバギングが最も高い精度(最小のRMSEと最大のピアソン相関)を達成し、ディープラーニングと遺伝的プログラミングを上回った。後者2つは、ピーク性能に到達するまでに少ない特徴量で十分であった。

ABSTRACT

Our objective is to build machine learning based models that predict audiovisual quality directly from a set of correlated parameters that are extracted from a target quality dataset. We have used the bitstream version of the INRS audiovisual quality dataset that reflects contemporary real-time configurations for video frame rate, video quantization, noise reduction parameters and network packet loss rate. We have utilized this dataset to build bitstream perceived quality estimation models based on the Random Forests, Bagging, Deep Learning and Genetic Programming methods. We have taken an empirical approach and have generated models varying from very simple to the most complex depending on the number of features used from the quality dataset. Random Forests and Bagging models have overall generated the most accurate results in terms of RMSE and Pearson correlation coefficient values. Deep Learning and Genetic Programming based bitstream models have also achieved good results but that high performance was observed only with a limited range of features. We have also obtained the epsilon-insensitive RMSE values for each model and have computed the significance of the difference between the correlation coefficients. Overall we conclude that computing the bitstream information is worth the effort it takes to generate and helps to build more accurate models for real-time communications. However, it is useful only for the deployment of the right algorithms with the carefully selected subset of the features. The dataset and tools that have been developed during this research are publicly available for research and development purposes.

研究の動機と目的

  • 中間の品質関数を経由せずに、ビットストリームパラメータから直接知覚される音声視覚品質を予測する機械学習モデルの開発を目的とする。
  • ランダムフォレスト、バギング、ディープラーニング、遺伝的プログラミングといった多様な機械学習アルゴリズムの、リアルタイムマルチメディア品質データセットにおける性能を評価することを目的とする。
  • リアルタイム通信システムにおける予測精度を最大化するための最適なビットストリーム特徴量のサブセットを特定することを目的とする。
  • 知覚品質モデリングにおけるモデルの複雑さ、トレーニングに要する時間、および予測精度の間のトレードオフを評価することを目的とする。
  • 今後の研究開発のためのデータセットとツールを、品質体験(QoE)モデリング分野で公開することを目的とする。

提案手法

  • 映像フレームレート、量子化、ノイズ低減、パケット損失率などのメディアおよびネットワークパラメータから導出された125の特徴量を有する、INRS音声視覚品質データセットのビットストリーム版を構築した。
  • ランダムフォレストを用いた1人を除いた交差検証を実施し、特徴量の重要度を順位付けし、各アルゴリズムごとに1〜125の特徴量を用いた125個の段階的モデルを生成した。
  • 同じデータセットを用いて、ランダムフォレスト、バギング、ディープラーニング、遺伝的プログラミングの4つの機械学習モデルを、増加する特徴量サブセットでトレーニングおよび評価した。
  • RMSE、ピアソン相関係数、およびエプシロンに敏感なRMSE(RMSE*)を測定し、モデルの性能の頑健性および差の有意性を評価した。
  • モデル間の相関係数の差の有意性を検証するために、フィッシャーz変換を適用した。
  • 性能のトレンドと計算コストに基づき、最適な特徴量サブセットを選定した。モデルの効率性と精度のトレードオフに重点を置いた。

実験結果

リサーチクエスチョン

  • RQ1どの機械学習アルゴリズムが、ビットストリーム特徴量から音声視覚品質を予測する際に最も高い精度を達成するか?
  • RQ2モデルのパフォーマンスは入力特徴量の数にどのように依存するか?各アルゴリズムの最適な特徴量サブセットのサイズは何か?
  • RQ3異なるアルゴリズム間で、モデルの複雑さ、トレーニング時間、および予測精度の間のトレードオフはどのようなものか?
  • RQ4RMSE、相関係数、RMSE*といったパフォーマンス指標は、ランダムフォレスト、バギング、ディープラーニング、遺伝的プログラミングの間でどのように比較されるか?
  • RQ5リアルタイム通信システムにおける知覚品質モデルの精度向上に、ビットストリーム情報の計算がどの程度寄与するか?

主な発見

  • ランダムフォレストおよびバギングモデルが、全特徴量数にわたり、最小のRMSEと最大のピアソン相関係数を達成し、全体として最良のパフォーマンスを示した。
  • ディープラーニングおよび遺伝的プログラミングモデルは、上位7つの特徴量でのみピークパフォーマンスに到達した。これは、特徴量選択に対する高い感受性を示している。
  • ランダムフォレストベースのモデルは、上位20個の特徴量を使用した場合に他のすべてのモデルを上回り、著しく少ないチューニングとトレーニング時間を要した。
  • 遺伝的プログラミングモデルは、最も計算リソースを要し、最も長いトレーニング時間を要し、多数のハイパーパrameterチューニングを要したが、最も低いパフォーマンスを示した。
  • RMSE*の値から、特徴量数が2つを超えて増加するにつれて、モデルのパフォーマンス差が顕著に顕在した。これは、特徴量の豊かさに価値があることを示している。
  • 本研究は、ビットストリーム特徴量を抽出することは、モデル精度の向上に価値があると確認したが、適切なアルゴリズムと慎重に選択された特徴量サブセットと組み合わせる必要があると結論づけた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。