[论文解读] From Third Person to First Person: Dataset and Baselines for Synthesis and Retrieval
本文提出了一种新型的合成与真实世界同步的自指(第一人称)与他指(第三人称)视频对数据集,并提出一种基于条件生成对抗网络(cGAN)的框架,用于从第三人称视角生成第一人称图像。结果表明,通过将合成数据域适应到真实数据,可提升跨视角检索性能,在使用双流卷积神经网络进行域适应的情况下,真实自指数据上的顶级1准确率达到30.82%。
First-person (egocentric) and third person (exocentric) videos are drastically different in nature. The relationship between these two views have been studied in recent years, however, it has yet to be fully explored. In this work, we introduce two datasets (synthetic and natural/real) containing simultaneously recorded egocentric and exocentric videos. We also explore relating the two domains (egocentric and exocentric) in two aspects. First, we synthesize images in the egocentric domain from the exocentric domain using a conditional generative adversarial network (cGAN). We show that with enough training data, our network is capable of hallucinating how the world would look like from an egocentric perspective, given an exocentric video. Second, we address the cross-view retrieval problem across the two views. Given an egocentric query frame (or its momentary optical flow), we retrieve its corresponding exocentric frame (or optical flow) from a gallery set. We show that using synthetic data could be beneficial in retrieving real data. We show that performing domain adaptation from the synthetic domain to the natural/real domain, is helpful in tasks such as retrieval. We believe that the presented datasets and the proposed baselines offer new opportunities for further research in this direction. The code and dataset are publicly available.
研究动机与目标
- 通过创建同步录制的新数据集,弥合自指(第一人称)与他指(第三人称)视频域之间的差距。
- 尽管视场角与视角存在显著差异,仍实现从第三人称视角生成第一人称视频,采用条件生成对抗网络(cGAN)。
- 通过利用合成数据进行域自适应,提升真实自指数据上的跨视角检索性能。
- 评估在自指与他指域之间学习的视角不变表征在检索与动作识别任务中的有效性。
提出的方法
- 使用游戏引擎收集大规模合成数据集,包含帧级标注的自指/他指相机位姿与人体动作。
- 构建较小规模的真实世界数据集,包含同步佩戴于身体上的(自指)与固定安装的(他指)相机录制的多样化人体动作。
- 训练一个条件生成对抗网络(cGAN),根据场景与姿态信息,从他指输入图像生成自指图像。
- 设计一个双流3D卷积神经网络,利用光流(2通道)与RGB(3通道)输入,学习视角不变特征,用于跨视角检索。
- 通过在真实自指数据上微调在合成数据上训练的检索网络,实现从合成数据到真实数据的域自适应。
- 在最后一层全连接层提取的特征上使用支持向量机(SVM)评估视角不变性与动作识别性能。
实验结果
研究问题
- RQ1即使视觉重叠有限,条件生成对抗网络是否能有效从第三人称视频帧生成合理的自指图像?
- RQ2合成的自指数据在多大程度上能提升真实自指数据上的跨视角检索性能?
- RQ3深度神经网络能否学习到在自指与他指视频域之间泛化的视角不变表征?
- RQ4从合成数据到真实数据的域自适应在自指-他指跨视角设置中如何影响检索准确率?
- RQ5结合自指与他指视角的特征是否能提升动作识别性能,相较于单独使用任一视角?
主要发现
- 所提出的基于cGAN的生成网络能够成功从他指输入中“幻觉”生成逼真的自指视角图像,同时保持高层语义一致性。
- 当使用在合成数据上训练并在真实数据上微调的检索网络时,真实自指数据上的检索性能达到30.82%的顶级1准确率。
- 在真实RGB数据上训练的检索网络达到42.58%的顶级1准确率,优于仅使用合成数据的基线,表明真实数据在微调中的价值。
- 从合成数据到真实数据的域自适应提升了检索性能,最佳结果(30.82%)由在合成数据上训练并在真实数据上微调的网络实现。
- 检索网络学习到的视角不变表征保留了动作识别性能,联合视角SVM在真实数据上达到30.82%的准确率,且在某些情况下优于单一视角分类器。
- 在合成光流数据上训练的检索网络在真实自指数据上达到32.31%的顶级1准确率,表明合成数据可有效支持基于运动的检索。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。