[论文解读] EgoEnv: Human-centric environment representations from egocentric video
该论文提出EgoEnv,一种通过在模拟视频数据上训练基于Transformer的模型来预测第一视角观察者周围物体的局部3D布局,从而从第一视角视频中学习以人为中心的环境表征。尽管仅在合成数据上进行训练,EgoEnv在真实世界第一视角视频任务中显著提升了性能——在Ego4D NLQ挑战赛中达到最先进结果,并在未见环境中的房间分类和语言定位任务上优于基线模型。
First-person video highlights a camera-wearer's activities in the context of their persistent environment. However, current video understanding approaches reason over visual features from short video clips that are detached from the underlying physical space and capture only what is immediately visible. To facilitate human-centric environment understanding, we present an approach that links egocentric video and the environment by learning representations that are predictive of the camera-wearer's (potentially unseen) local surroundings. We train such models using videos from agents in simulated 3D environments where the environment is fully observable, and test them on human-captured real-world videos from unseen environments. On two human-centric video tasks, we show that models equipped with our environment-aware features consistently outperform their counterparts with traditional clip features. Moreover, despite being trained exclusively on simulated videos, our approach successfully handles real-world videos from HouseTours and Ego4D, and achieves state-of-the-art results on the Ego4D NLQ challenge. Project page: https://vision.cs.utexas.edu/projects/ego-env/
研究动机与目标
- 通过建模第一视角观察者的持续物理环境上下文,解决第一视角视频中缺乏以人为中心的环境理解问题。
- 克服基于片段的视频模型仅捕捉瞬时视觉外观而缺乏空间定位的局限。
- 通过环境感知特征,使模型能够联合推理人类行为及其周围物理环境。
- 通过在模拟第一视角视频上进行训练并泛化到真实世界第一视角数据集(如HouseTours和Ego4D),弥合模拟到真实世界的差距。
- 开发一种即插即用的特征表征(EgoEnv),在不改变网络架构的前提下,为现有视频模型增强长程环境上下文信息。
提出的方法
- 将局部环境状态定义为在每个时间步,相机佩戴者可见的物体及其相对于佩戴者的相对位置(前方、左侧、右侧、后方)的集合。
- 使用在模拟3D环境(HM3D)中导航的智能体生成的视频片段,训练视觉Transformer编码器来预测该局部环境状态。
- 采用记忆机制,在时间窗口(W)内采样帧,并构建上下文感知的环境记忆(K帧),以支持长时程推理。
- 通过结合目标检测和距离预测的多任务损失,联合监督环境的语义和几何方面。
- 通过提取编码环境上下文的EgoEnv特征,将训练好的模型应用于真实世界第一视角视频,随后将这些特征与标准的clip特征融合,用于下游任务。
- 利用Transformer解码器中的注意力机制,可视化模型如何关注非相邻、空间上分散的视角,以重建周围环境布局。
实验结果
研究问题
- RQ1我们能否从仅在模拟数据上训练的第一视角视频中学习到具有泛化能力的环境感知表征,使其在多样化的现实世界环境中表现良好?
- RQ2与标准的clip级特征相比,所提出的局部环境状态预测任务在提升下游第一视角视频理解方面有多有效?
- RQ3模型在理解更广泛物理上下文方面的能力,能在多大程度上提升需要联合推理行为与环境的任务的性能?
- RQ4窗口大小、记忆大小和损失权重等超参数如何影响模型在真实世界数据上的泛化能力和鲁棒性?
- RQ5模型是否能够关注非连续、空间上分散的视角以重建相机佩戴者的环境,表明其具备有效的长程空间推理能力?
主要发现
- EgoEnv在Ego4D NLQ挑战赛中达到最先进性能,显著优于先前方法。
- 在RoomPred任务中,EgoEnv在HouseTours上达到62.68%的准确率,在Ego4D上达到51.07%,优于所有基线模型,包括使用预训练视觉特征的模型。
- 该模型在从模拟到真实世界数据的泛化方面表现出色,尤其在环境上下文至关重要的困难样本上持续提升性能。
- 消融实验表明,窗口大小为256、记忆大小为64时,在NLQ等长时程推理任务上表现最优。
- 最优损失权重(λ=0.1)在语义和几何监督之间实现平衡,提升了对目标和距离预测误差的鲁棒性。
- 注意力可视化结果证实,模型学会了关注空间上分散的非相邻视角,表明其有效构建了环境记忆。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。