[论文解读] How do people explore virtual environments?
本文对沉浸式虚拟现实(VR)中的视觉探索行为进行了大规模研究,记录了169名用户在三种观看条件(HMD站立、HMD就坐、桌面)下的1980条注视与头部运动轨迹。研究揭示了传统2D观看中不存在的VR固定注视偏差,表明仅通过头部运动即可高精度预测视觉显著性,并基于数据驱动的洞察与改进的显著性模型,推动了如显著性感知压缩与自动视频摘要等新型VR应用的发展。
Understanding how people explore immersive virtual environments is crucial for many applications, such as designing virtual reality (VR) content, developing new compression algorithms, or learning computational models of saliency or visual attention. Whereas a body of recent work has focused on modeling saliency in desktop viewing conditions, VR is very different from these conditions in that viewing behavior is governed by stereoscopic vision and by the complex interaction of head orientation, gaze, and other kinematic constraints. To further our understanding of viewing behavior and saliency in VR, we capture and analyze gaze and head orientation data of 169 users exploring stereoscopic, static omni-directional panoramas, for a total of 1980 head and gaze trajectories for three different viewing conditions. We provide a thorough analysis of our data, which leads to several important insights, such as the existence of a particular fixation bias, which we then use to adapt existing saliency predictors to immersive VR conditions. In addition, we explore other applications of our data and analysis, including automatic alignment of VR video cuts, panorama thumbnails, panorama video synopsis, and saliency-based compression.
研究动机与目标
- 理解用户在沉浸式虚拟环境中的探索行为,特别是立体静态全景图中头部运动与注视的作用。
- 分析VR中的行为模式,并与传统的桌面观看条件进行比较。
- 评估并改进现有显著性预测模型,以适用于VR应用。
- 基于显著性洞察开发实用的VR应用,如缩略图生成、视频摘要与压缩。
- 为未来研究提供公开可获取的头部与注视轨迹数据集。
提出的方法
- 在三种条件下(站立VR、就坐VR、桌面观看)收集了169名参与者通过HMD和桌面显示器获取的1980条头部与注视轨迹。
- 使用配备眼动追踪与惯性传感器的HMD,在立体全景图中记录注视与头部朝向数据。
- 分析扫描路径,识别固定注视偏差、观看模式(注意力与重新定向)、以及视觉探索的时间动态。
- 通过整合头部运动与场景显著性统计信息,对原本专为窄视场2D视频设计的显著性预测器进行改进,以适配VR环境。
- 证明仅通过头部运动即可实现合理准确的显著性预测,从而降低对昂贵眼动追踪的依赖。
- 开发并评估了多项应用,包括自动全景图缩略图生成、VR视频摘要与基于显著性的压缩,均基于所推导的行为模型。
实验结果
研究问题
- RQ1在注视与头部运动方面,沉浸式VR中的视觉探索行为与传统桌面观看有何不同?
- RQ2在无直接注视追踪的情况下,头部运动能在多大程度上独立预测VR中的显著性?
- RQ3场景层面的显著性分布在多大程度上影响VR中的用户注意力模式?
- RQ4能否有效将为2D数据训练的现有显著性模型适配于立体全景VR全景图?
- RQ5用户在VR中的注意力时间动态特征是什么?这些模式随时间的稳定性如何?
主要发现
- VR中存在显著的固定注视偏差,这在传统2D观看中并不存在,表明用户因立体视觉与运动学约束而系统性地注视特定区域。
- 仅使用头部朝向数据即可高精度预测显著性,表明许多VR应用可能无需依赖眼动追踪。
- 显著性预测在接触新场景的最初几秒内最为准确,之后用户间差异显著增大。
- 场景中显著区域的数量强烈影响注意力部署:显著区域越少,注意力集中得越快、越集中。
- 可基于头部与注视运动模式实时识别出两种不同的观看模式——注意力与重新定向,从而支持交互式应用。
- 现有显著性模型可经少量修改适配于VR,且所提出的数据显示可显著提升VR视频压缩与缩略图生成等应用的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。