Skip to main content
QUICK REVIEW

[论文解读] Quantum Cognitively Motivated Decision Fusion for Video Sentiment Analysis

Dimitris Gkoumas, Qiuchi Li|arXiv (Cornell University)|Jan 12, 2021
Statistical Mechanics and Entropy参考文献 42被引用 7
一句话总结

该论文提出了一种用于视频情感分析的量子认知启发决策融合模型,将情感判断视为希尔伯特空间上的量子叠加态,通过相互不相容的可观测量建模模态间(如语言、视觉、听觉)的不相容性。该方法显著优于最先进内容级和决策级融合方法,在CMU-MOSI上达到84.6%的准确率和84.5%的F1,在CMU-MOSEI上达到84.9%的准确率和91.1%的F1,尤其在所有单模态分类器均失败的情况下表现优异。

ABSTRACT

Video sentiment analysis as a decision-making process is inherently complex, involving the fusion of decisions from multiple modalities and the so-caused cognitive biases. Inspired by recent advances in quantum cognition, we show that the sentiment judgment from one modality could be incompatible with the judgment from another, i.e., the order matters and they cannot be jointly measured to produce a final decision. Thus the cognitive process exhibits "quantum-like" biases that cannot be captured by classical probability theories. Accordingly, we propose a fundamentally new, quantum cognitively motivated fusion strategy for predicting sentiment judgments. In particular, we formulate utterances as quantum superposition states of positive and negative sentiment judgments, and uni-modal classifiers as mutually incompatible observables, on a complex-valued Hilbert space with positive-operator valued measures. Experiments on two benchmarking datasets illustrate that our model significantly outperforms various existing decision level and a range of state-of-the-art content-level fusion approaches. The results also show that the concept of incompatibility allows effective handling of all combination patterns, including those extreme cases that are wrongly predicted by all uni-modal classifiers.

研究动机与目标

  • 为解决经典概率无法建模的视频情感分析中的认知偏差,特别是模态间顺序依赖性和不相容性判断。
  • 开发一种决策级融合策略,以捕捉来自语言、视觉和听觉模态的情感判断中的非经典、量子类不相容性。
  • 将情感建模为复希尔伯特空间中的叠加态,其中单模态分类器作为相互不相容的可观测量,通过上下文相互影响。
  • 在所有单模态分类器均失败的极端情况下,通过量子概率提升多模态情感预测性能。

提出的方法

  • 将每个话语形式化为复值希尔伯特空间中正向与负向情感的量子叠加态,表示测量前的不确定认知状态。
  • 将单模态情感分类器建模为希尔伯特空间上相互不相容的可观测量,反映判断依赖于测量顺序和上下文。
  • 使用正算子值测度(POVMs)近似不相容模态的同时测量,实现广义的量子概率。
  • 从训练数据中估计希尔伯特空间结构和可观测量算符,然后通过量子态坍缩推断测试话语的最终多模态情感状态。
  • 将不相容性整合到融合过程中,在单个分类器不确定或冲突时纠正决策,尤其在边缘情况下表现突出。
  • 在CMU-MOSI和CMU-MOSEI上端到端训练并评估模型,与经典决策级及最先进内容级融合基线进行比较。

实验结果

研究问题

  • RQ1量子认知能否为视频情感分析中的决策融合提供比经典概率理论更准确的框架?
  • RQ2模态间情感判断的不相容性如何影响最终情感预测?能否通过量子形式化有效建模?
  • RQ3基于量子启发的融合模型能否在视频情感分析中超越经典决策级和最先进内容级融合方法?
  • RQ4在所有单模态分类器均失败的情况下,该模型在多大程度上能通过量子叠加和不相容性纠正错误预测?
  • RQ5模态评估顺序是否以经典模型无法捕捉的方式影响情感判断?量子力学能否有效建模此效应?

主要发现

  • 所提模型在CMU-MOSI数据集上达到84.6%的准确率和84.5%的F1,显著优于最先进模型MulT(80.2%准确率)及其他基线模型。
  • 在CMU-MOSEI数据集上,模型达到84.9%的准确率和91.1%的F1,超越最先进模型MulT(80.0%准确率)及所有其他内容级与决策级融合方法。
  • 在其他决策级融合方法成功预测的33个案例中,该模型正确预测了31个;在CMU-MOSEI的全部1,547个案例中也全部正确,展现出对不相容性的强鲁棒性。
  • 在所有单模态分类器均预测错误的情况下,该模型成功融合了冲突信号,在CMU-MOSI的686个话语中正确预测了39个,在CMU-MOSEI的4,643个话语中正确预测了633个。
  • 消融实验表明,三模态动态性能在CMU-MOSI上比所有双模态组合高出5.0%的准确率,在CMU-MOSEI上高出2.2%,凸显了完整多模态不相容性建模的价值。
  • 案例研究显示,单个模态(如语言和视听)的高不确定性导致叠加态形成,而不相容性将冲突预测有效整合为正确的多模态判断。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。