Skip to main content
QUICK REVIEW

[论文解读] SimAug: Learning Robust Representations from Simulation for Trajectory Prediction

Junwei Liang, Lu Jiang|arXiv (Cornell University)|Apr 4, 2020
Video Surveillance and Tracking Methods参考文献 75被引用 15
一句话总结

本文提出 SimAug,一种仅在 3D 模拟数据上训练轨迹预测模型的数据增强方法,以实现对未见过的真实世界摄像头视角的鲁棒泛化。通过将对抗性扰动与特定视角的困难样本挖掘相结合,利用特征的凸组合,SimAug 在无需任何真实世界训练数据的情况下,在 Stanford Drone 和 VIRAT/ActEV 基准上实现了最先进性能,展示了对新型摄像头视角的强大零样本泛化能力。

ABSTRACT

This paper studies the problem of predicting future trajectories of people in unseen cameras of novel scenarios and views. We approach this problem through the real-data-free setting in which the model is trained only on 3D simulation data and applied out-of-the-box to a wide variety of real cameras. We propose a novel approach to learn robust representation through augmenting the simulation training data such that the representation can better generalize to unseen real-world test data. The key idea is to mix the feature of the hardest camera view with the adversarial feature of the original view. We refer to our method as SimAug. We show that SimAug achieves promising results on three real-world benchmarks using zero real training data, and state-of-the-art performance in the Stanford Drone and the VIRAT/ActEV dataset when using in-domain training data.

研究动机与目标

  • 解决轨迹预测模型在真实世界部署中对新型摄像头视角和场景泛化能力差的问题。
  • 实现在无任何真实数据微调的情况下,从 3D 模拟数据到真实世界视频的零样本迁移。
  • 通过学习解耦人类行为与摄像头特定因素(如视角和场景纹理)的不变表示,提升模型鲁棒性。
  • 开发一种有效的数据增强策略,以增强仅使用模拟数据训练设置下的泛化能力。
  • 为基于模拟的学习在轨迹预测中建立新基准,证明无需真实世界数据即可实现有效性。

提出的方法

  • 该方法使用 3D 模拟器(CARLA)生成多视角、像素级精确的语义分割特征,用于轨迹,模拟多样化的摄像头角度和场景。
  • 提出一种新颖的增强策略,通过凸组合将最困难的摄像头视角特征与原始视角的对抗性特征相结合。
  • 通过在训练期间识别使模型分类损失最大的摄像头视角,执行困难视角选择,确保聚焦于最具挑战性的视角。
  • 使用白盒攻击方法对原始视角特征施加对抗性扰动,以提升对分布偏移的鲁棒性。
  • 最终模型通过最小化在增强轨迹分布上的经验邻域风险进行训练,利用对抗训练和 Mixup 的原理。
  • 使用场景语义特征而非 RGB 像素,以降低对光照和传感器噪声的敏感性,提升领域泛化能力。

实验结果

研究问题

  • RQ1仅在 3D 模拟数据上训练的轨迹预测模型,能否有效泛化到具有新型摄像头视角和场景的真实世界视频?
  • RQ2模拟环境中的数据增强如何提升对摄像头视角和场景外观变化的鲁棒性?
  • RQ3哪些特定的增强组件——对抗性样本、视角选择或多视角数据——对零样本泛化提升最为关键?
  • RQ4在标准基准上,与经过真实数据微调的模型相比,仅使用模拟数据训练并结合 SimAug 是否能实现最先进性能?
  • RQ5在缺乏真实训练数据的情况下,所提出的方法是否能超越现有的数据增强和对抗性训练基线?

主要发现

  • SimAug 在 Stanford Drone 数据集上实现了最先进性能(minADE 1: 15.7,minFDE 1: 30.2),且未使用任何真实世界训练数据。
  • 在 VIRAT/ActEV 基准上,SimAug 超过了在相同真实数据上训练的 Multiverse 模型,实现 minADE 1: 21.7 和 minFDE 1: 42.2,且未使用真实数据。
  • 在真实数据微调后,SimAug 在 VIRAT/ActEV 上达到最佳性能,实现 minADE 1: 10.27 和 minFDE 1: 19.71。
  • 消融研究显示,若移除对抗性攻击或视角选择,性能显著下降,尤其在更具挑战性的 Argoverse 数据集上。
  • 多视角数据中包含俯视图可提升性能,且随机扰动对鲁棒性至关重要,尤其在 Argoverse 上。
  • 该方法展现出强大的零样本泛化能力,在所有三个基准上均优于标准增强、对抗性训练和模仿学习等基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。