[论文解读] Future Person Localization in First-Person Videos
本文提出在第一人称视频中进行未来人物定位,提出一种多流卷积-反卷积网络,利用自我运动、尺度线索和人体姿态来预测未来位置。该方法在新构建的首人称移动(FPL)数据集和公开的社会互动数据集上均达到最先进性能,轨迹预测精度优于先前方法如Social LSTM。
We present a new task that predicts future locations of people observed in first-person videos. Consider a first-person video stream continuously recorded by a wearable camera. Given a short clip of a person that is extracted from the complete stream, we aim to predict that person's location in future frames. To facilitate this future person localization ability, we make the following three key observations: a) First-person videos typically involve significant ego-motion which greatly affects the location of the target person in future frames; b) Scales of the target person act as a salient cue to estimate a perspective effect in first-person videos; c) First-person videos often capture people up-close, making it easier to leverage target poses (e.g., where they look) for predicting their future locations. We incorporate these three observations into a prediction framework with a multi-stream convolution-deconvolution architecture. Experimental results reveal our method to be effective on our new dataset as well as on a public social interaction dataset.
研究动机与目标
- 为解决在拥挤环境中预测第一人称视频流中人物未来位置的挑战,尤其是在碰撞规避至关重要的场景中。
- 开发一种有效建模动态视觉线索(如自我运动、视角缩放和人体姿态)的方法,以提升未来定位性能。
- 构建一个新的基准数据集——首人称移动(FPL)数据集,以支持第一人称轨迹预测研究。
- 通过未来人物定位实现对视障用户的实时导航引导,支持辅助技术应用。
提出的方法
- 该方法采用多流卷积-反卷积架构,从视频帧中提取的自我运动、尺度和姿态特征中编码时间动态信息。
- 通过光流建模自我运动,以捕捉摄像者运动,其对场景中人物的表观运动具有显著影响。
- 利用左右髋部之间归一化距离获得的尺度线索,用于估计视角效应和深度变化。
- 通过关键点位置(如髋部、肩膀)提取姿态信息,以推断运动方向和未来轨迹。
- 网络处理1秒的特征历史(10帧,帧率为10 fps),并预测目标人物在未来1秒内的位置。
- 采用合适的卷积核大小和转置卷积层,以实现空间和时间上一致的未来边界框位置重建。
实验结果
研究问题
- RQ1能否有效利用第一人称视频中的自我运动来提升未来人物定位的准确性?
- RQ2尺度变化和视角效应在多大程度上影响第一人称视角下未来人类位置的预测?
- RQ3姿态信息(如视线方向或身体朝向)在多大程度上提升第一人称视频序列中的未来轨迹预测性能?
- RQ4单个第一人称摄像头是否足以实现准确的未来人物定位,还是需要多摄像头同步?
- RQ5与现有最先进模型(如Social LSTM)相比,该方法在多样化环境中的泛化能力和鲁棒性如何?
主要发现
- 在FPL数据集上,所提方法的最终位移误差(FDE)为124.85,显著优于Social LSTM在预测两秒未来时的FDE(223.16)。
- 在社会互动数据集上,当结合输入特征(X_in + E_in + P_in)时,FDE降低至125.42,而Social LSTM的FDE为299.81。
- 消融实验表明,引入自我运动(E_in)和姿态(P_in)特征相比仅使用外观或运动线索,均带来一致的性能提升。
- 模型在多种环境(包括室内和室外场景)中表现出鲁棒性,定性结果已验证此点。
- 较长的输入序列(T_prev = 10)相比更短序列(T_prev = 6)提升了性能,表明时间上下文有助于增强预测稳定性。
- 即使在复杂的自我运动场景(如摄像者为避让行人而转向)中,该方法仍优于基线模型,尽管在高度动态情况下出现轻微性能下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。