Skip to main content
QUICK REVIEW

[論文レビュー] Quantum Cognitively Motivated Decision Fusion for Video Sentiment Analysis

Dimitris Gkoumas, Qiuchi Li|arXiv (Cornell University)|Jan 12, 2021
Statistical Mechanics and Entropy参考文献 42被引用数 7
ひとこと要約

本論文は、動画センチメント分析のための量子認知的動機付けられた意思決定統合モデルを提案する。センチメント判断をヒルベルト空間上の量子重ね合わせとして扱い、言語的、視覚的、音声的モダリティ間の非可換性を、互いに非可換な観測可能量によってモデル化する。この手法は、コンテンツレベルおよび意思決定レベルの最先端手法を著しく上回り、CMU-MOSIでは84.6%の正確性と84.5%のF1スコアを達成し、CMU-MOSEIでは84.9%の正確性と91.1%のF1スコアを達成する。特に、すべての単モダリティ分類器が失敗する状況において顕著な性能を発揮する。

ABSTRACT

Video sentiment analysis as a decision-making process is inherently complex, involving the fusion of decisions from multiple modalities and the so-caused cognitive biases. Inspired by recent advances in quantum cognition, we show that the sentiment judgment from one modality could be incompatible with the judgment from another, i.e., the order matters and they cannot be jointly measured to produce a final decision. Thus the cognitive process exhibits "quantum-like" biases that cannot be captured by classical probability theories. Accordingly, we propose a fundamentally new, quantum cognitively motivated fusion strategy for predicting sentiment judgments. In particular, we formulate utterances as quantum superposition states of positive and negative sentiment judgments, and uni-modal classifiers as mutually incompatible observables, on a complex-valued Hilbert space with positive-operator valued measures. Experiments on two benchmarking datasets illustrate that our model significantly outperforms various existing decision level and a range of state-of-the-art content-level fusion approaches. The results also show that the concept of incompatibility allows effective handling of all combination patterns, including those extreme cases that are wrongly predicted by all uni-modal classifiers.

研究の動機と目的

  • 古典的確率論がモデル化できない認知バイアス、特にモダリティ間の順序依存性および非可換性のある判断を扱うため。
  • 言語的、視覚的、音声的モダリティからのセンチメント判断における非古典的で量子的な非可換性を捉える意思決定レベルの統合戦略を開発するため。
  • 単モダリティ分類器が文脈によって互いに影響し合うことにより、複素ヒルベルト空間における重ね合わせ状態としてセンチメントをモデル化するため。
  • すべての単モダリティ分類器が失敗する極端な状況においても、マルチモーダルセンチメント予測を向上させるために、量子確率を活用して非可換性を解消するため。

提案手法

  • 各発話文を、測定前の不定な認知状態を表す、複素ヒルベルト空間上での肯定的・否定的センチメントの量子重ね合わせ状態として形式化する。
  • 単モダリティセンチメント分類器をヒルベルト空間上での互いに非可換な観測可能量としてモデル化し、判断が測定順序や文脈に依存することを反映する。
  • 非可換なモダリティの同時測定を近似するために、正作用素値測定(POVM)を用い、一般化された量子確率を可能にする。
  • 学習データからヒルベルト空間構造および観測可能量の演算子を推定し、テスト発話文に対して量子状態の崩壊を介して最終的なマルチモーダルセンチメント状態を推論する。
  • 非可換性を統合プロセスに組み込み、個々の分類器が不確実性や矛盾を示す場合に、特にエッジケースで意思決定を是正する。
  • CMU-MOSIおよびCMU-MOSEIでエンドツーエンドにモデルを訓練・評価し、古典的意思決定レベルおよび最先端コンテンツレベル統合ベースラインと比較する。

実験結果

リサーチクエスチョン

  • RQ1量子認知は、古典的確率論に比べて、動画センチメント分析における意思決定統合をより正確にモデル化できるか?
  • RQ2モダリティ間のセンチメント判断の非可換性が最終的なセンチメント予測に与える影響は何か? そして、量子形式的枠組みを用いて効果的にモデル化できるか?
  • RQ3量子インスピレーションを受ける統合モデルは、古典的意思決定レベルおよび最先端コンテンツレベル統合手法を上回れるか?
  • RQ4すべての単モダリティ分類器が誤って予測する状況において、量子重ね合わせと非可換性を活用することで、モデルがどれほど誤った予測を是正できるか?
  • RQ5モダリティ評価の順序が、古典モデルが捉えきれない方法でセンチメント判断に影響を与えるか? そして、量子力学はこの効果をモデル化できるか?

主な発見

  • 提案モデルは、CMU-MOSIデータセットで84.6%の正確性と84.5%のF1スコアを達成し、最先端のMulTモデル(80.2%の正確性)および他のベースラインを著しく上回った。
  • CMU-MOSEIデータセットでは、84.9%の正確性と91.1%のF1スコアを達成し、最先端のMulTモデル(80.0%の正確性)およびすべてのコンテンツレベルおよび意思決定レベル統合手法を上回った。
  • 他の意思決定レベル統合手法が成功した33件中31件、CMU-MOSEIの1,547件すべてのケースで正しく予測し、非可換性に対する頑健性を示した。
  • すべての単モダリティ分類器が誤って予測する状況において、モデルはCMU-MOSIで686件中39件、CMU-MOSEIで4,643件中633件で、誤った信号を統合して正しくセンチメントを予測した。
  • アブレーションスタディの結果、3モダリティ統合が2モダリティの組み合わせをすべて上回り、CMU-MOSIでは正確性で5.0%、CMU-MOSEIでは2.2%の向上を示し、完全なマルチモーダル非可換性モデル化の価値を強調した。
  • ケーススタディでは、個々のモダリティ(例:言語的および視覚的・音声的)の高い不確実性が重ね合わせ状態を引き起こし、非可換性が矛盾する予測を正しいマルチモーダル判断に是正した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。