Skip to main content
QUICK REVIEW

[논문 리뷰] Quantum Cognitively Motivated Decision Fusion for Video Sentiment Analysis

Dimitris Gkoumas, Qiuchi Li|arXiv (Cornell University)|2021. 01. 12.
Statistical Mechanics and Entropy참고 문헌 42인용 수 7
한 줄 요약

이 논문은 비디오 감성 분석을 위한 양자 인지 기반 결정 융합 모델을 제안하며, 감성 판단을 힐베르트 공간 상의 양자 중첩으로 간주하여, 언어적, 시각적, 청각적 모odal 간의 상호 불가침성을 상호 불가침 관측량을 통해 모델링한다. 이 방법은 최첨단의 콘텐츠 수준 및 결정 수준 융합 방법보다 뚜렷하게 뛰어나며, CMU-MOSI에서 84.6%의 정확도와 84.5%의 F1을 기록하고, CMU-MOSEI에서는 84.9%의 정확도와 91.1%의 F1을 달성하여, 모든 단모달 분류기가 실패하는 경우에도 특히 뛰어난 성능을 보였다.

ABSTRACT

Video sentiment analysis as a decision-making process is inherently complex, involving the fusion of decisions from multiple modalities and the so-caused cognitive biases. Inspired by recent advances in quantum cognition, we show that the sentiment judgment from one modality could be incompatible with the judgment from another, i.e., the order matters and they cannot be jointly measured to produce a final decision. Thus the cognitive process exhibits "quantum-like" biases that cannot be captured by classical probability theories. Accordingly, we propose a fundamentally new, quantum cognitively motivated fusion strategy for predicting sentiment judgments. In particular, we formulate utterances as quantum superposition states of positive and negative sentiment judgments, and uni-modal classifiers as mutually incompatible observables, on a complex-valued Hilbert space with positive-operator valued measures. Experiments on two benchmarking datasets illustrate that our model significantly outperforms various existing decision level and a range of state-of-the-art content-level fusion approaches. The results also show that the concept of incompatibility allows effective handling of all combination patterns, including those extreme cases that are wrongly predicted by all uni-modal classifiers.

연구 동기 및 목표

  • 고전적 확률 이론이 모델링할 수 없는 감성 분석의 인지 편향, 특히 모달 간 순서 의존성 및 불가침성 판단을 다루기 위해.
  • 언어적, 시각적, 청각적 모달에서 유도된 감성 판단의 비고전적, 양자 유사한 불가침성을 반영하는 결정 수준 융합 전략을 개발하기 위해.
  • 각 단모달 분류기가 서로 불가침 관측량으로 영향을 주고받는 맥락에서, 감성을 복소 힐베르트 공간 상의 중첩 상태로 모델링하기 위해.
  • 모든 단모달 분류기가 실패하는 극단적인 경우에 다중모달 감성 예측을 향상시키기 위해, 양자 확률을 활용하여 불가침성을 해결하기 위해.

제안 방법

  • 각 발화를 복소수 힐베르트 공간 상의 정서적 긍정 및 부정 감성의 양자 중첩 상태로 공식화하여, 측정 이전의 불확정적 인지 상태를 표현하기 위해.
  • 각 단모달 감성 분류기를 힐베르트 공간 상의 상호 불가침 관측량으로 모델링하여, 판단이 측정 순서와 맥락에 따라 달라짐을 반영하기 위해.
  • 서로 불가침한 모달을 동시에 측정할 수 있도록 정규화된 양자 확률을 가능하게 하는 Positive-Operator Valued Measures(POVM)를 사용하기 위해.
  • 훈련 데이터로부터 힐베르트 공간의 구조와 관측량 연산자를 추정한 후, 테스트 발화에 대해 양자 상태 붕괴를 통해 최종 다중모달 감성 상태를 추론하기 위해.
  • 개별 분류기가 불확실하거나 모순될 경우, 융합 과정에 불가침성을 통합하여 결정을 수정하기 위해, 특히 극단적인 경우에 유용하게 활용하기 위해.
  • CMU-MOSI 및 CMU-MOSEI에서 종합적으로 모델을 훈련하고 평가하며, 고전적 결정 수준 및 최첨단 콘텐츠 수준 융합 기반 모델과 비교하기 위해.

실험 결과

연구 질문

  • RQ1양자 인지 이론은 고전적 확률 이론보다 비디오 감성 분석의 결정 융합을 더 정확하게 모델링할 수 있는가?
  • RQ2다양한 모달 간 감성 판단의 불가침성이 최종 감성 예측에 어떤 영향을 미치며, 양자 수학적 형식으로 효과적으로 모델링할 수 있는가?
  • RQ3양자 유사 융합 모델은 비디오 감성 분석에서 고전적 결정 수준 및 최첨단 콘텐츠 수준 융합 접근 방식을 초월할 수 있는가?
  • RQ4모든 단모달 분류기가 실패할 경우, 양자 중첩과 불가침성을 활용하여 잘못된 예측을 얼마나 잘 수정할 수 있는가?
  • RQ5모달 평가 순서가 감성 판단에 영향을 미치며, 고전적 모델이 포착하지 못하는 방식으로 작용하는가? 그리고 양자역학은 이러한 영향을 모델링할 수 있는가?

주요 결과

  • 제안된 모델은 CMU-MOSI 데이터셋에서 84.6%의 정확도와 84.5%의 F1을 기록하여 최첨단 MulT 모델(80.2% 정확도) 및 기타 기준 모델을 뚜렷이 앞서며 성능을 뛰어올랐다.
  • CMU-MOSEI 데이터셋에서는 84.9%의 정확도와 91.1%의 F1을 달성하여 최첨단 MulT 모델(80.0% 정확도)과 모든 콘텐츠 수준 및 결정 수준 융합 접근 방식을 초월하였다.
  • 기타 결정 수준 융합 방법이 성공한 33개의 경우 중 31개를 정확히 예측했으며, CMU-MOSEI의 1,547개 모든 케이스에서도 정확히 예측하여 불가침성에 대한 강건성을 입증하였다.
  • 모든 단모달 분류기가 잘못 예측한 경우, 모델은 CMU-MOSI에서 686개의 발화 중 39개, CMU-MOSEI에서는 4,643개 중 633개에서 갈등하는 신호를 성공적으로 융합하여 정확한 감성 예측을 내놓았다.
  • 제거 실험 결과, 삼모달 동역학이 모든 이모달 조합보다 CMU-MOSI에서 정확도 5.0% 향상, CMU-MOSEI에서 2.2% 향상하여 전체 다중모달 불가침성 모델링의 가치를 입증하였다.
  • 사례 연구에서는 개별 모달에서의 높은 불확실성(예: 언어적 및 시각-청각적 모달)이 중첩 상태로 이어지고, 불가침성이 갈등하는 예측을 정확한 다중모달 판단으로 해결하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.