Skip to main content
QUICK REVIEW

[论文解读] Bridge the Gap Between VQA and Human Behavior on Omnidirectional Video: A Large-Scale Dataset and a Deep Learning Model

Chen Li, Mai Xu|arXiv (Cornell University)|Jul 29, 2018
Image and Video Quality Assessment参考文献 40被引用 9
一句话总结

本文提出了VQA-OV,一个大规模全景视频数据集,结合了观察者的主观质量评分与头部运动(HM)和眼动(EM)数据。该研究提出了一种深度学习模型,通过整合HM和EM图来提升客观视觉质量评估性能,在使用真实行为数据时,皮尔逊相关系数(PCC)达到0.81,斯皮尔曼等级相关系数(SRCC)达到0.83,实现了当前最优性能,表明人类行为对感知视频质量具有显著影响。

ABSTRACT

Omnidirectional video enables spherical stimuli with the $360 imes 180^ \circ$ viewing range. Meanwhile, only the viewport region of omnidirectional video can be seen by the observer through head movement (HM), and an even smaller region within the viewport can be clearly perceived through eye movement (EM). Thus, the subjective quality of omnidirectional video may be correlated with HM and EM of human behavior. To fill in the gap between subjective quality and human behavior, this paper proposes a large-scale visual quality assessment (VQA) dataset of omnidirectional video, called VQA-OV, which collects 60 reference sequences and 540 impaired sequences. Our VQA-OV dataset provides not only the subjective quality scores of sequences but also the HM and EM data of subjects. By mining our dataset, we find that the subjective quality of omnidirectional video is indeed related to HM and EM. Hence, we develop a deep learning model, which embeds HM and EM, for objective VQA on omnidirectional video. Experimental results show that our model significantly improves the state-of-the-art performance of VQA on omnidirectional video.

研究动机与目标

  • 弥合全景视频主观视觉质量评估(VQA)与人类行为之间的差距。
  • 收集一个大规模数据集,其中不仅包含主观质量评分,还包含观察者头部运动(HM)和眼动(EM)数据。
  • 研究人类行为模式(HM与EM)与全景视频感知视觉质量之间的相关性。
  • 开发一种基于深度学习的客观VQA模型,整合HM与EM数据以提升预测准确性。
  • 证明建模人类行为可提升全景视频客观VQA的性能。

提出的方法

  • 作者构建了VQA-OV数据集,包含60个参考视频和540个受损全景视频序列,收集了受试者的主观DMOS评分、HM和EM数据。
  • 该数据集包含多样化的内容、时长、分辨率以及由压缩和地图投影引起的失真。
  • 提出一种深度学习模型,将视频帧及预测或真实HM与EM图作为输入,以估计客观质量评分。
  • 该模型采用源自DeepQA(Kim和Lee,2017a)的卷积神经网络(CNN)架构,并将HM与EM图作为额外输入通道。
  • HM与EM图使用现有模型(Xu等,2018;Pan等,2017)进行预测,以实现实际部署;而真实HM与EM图则用于消融研究。
  • 性能通过标准指标进行评估:PCC、SRCC、RMSE和MAE,并应用非线性回归对客观与主观评分进行对齐。

实验结果

研究问题

  • RQ1全景视频的主观视觉质量与头部运动(HM)和眼动(EM)行为之间有何相关性?
  • RQ2将HM与EM数据整合到深度学习模型中,能否提升全景视频客观VQA的准确性?
  • RQ3与忽略人类行为的最先进方法相比,行为感知VQA模型能带来多大的性能提升?
  • RQ4HM与EM预测的准确性如何影响最终客观VQA性能?
  • RQ5当使用真实HM与EM数据时,行为感知VQA模型的性能上限是多少?

主要发现

  • 所提出的深度学习模型显著优于现有最先进方法,在使用预测HM与EM图时,PCC达到0.77,SRCC达到0.80。
  • 使用真实HM与EM图时,模型PCC达到0.81,SRCC达到0.83,表明该方法的性能上限。
  • 与仅使用图像特征的基线DeepQA模型相比,该模型将RMSE降低1.20,MAE降低0.95。
  • 结果证实主观VQA评分与观察者行为(尤其是HM与EM)之间存在强相关性,验证了建模人类感知的重要性。
  • 消融研究显示,使用真实HM与EM图而非预测图时性能进一步提升,表明预测准确性是影响模型性能的关键因素。
  • 客观评分与主观评分的散点图显示,所提模型在回归线周围的分布更紧密,表明其与人类感知的对齐性更好。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。