[论文解读] InternVideo-Ego4D: A Pack of Champion Solutions to Ego4D Challenges
该论文提出了一种基于视频基础模型的 InternVideo-Ego4D 方法,在 Ego4D ECCV 2022 挑战赛的全部五个赛道中均取得了最先进性能。通过利用基于 VideoMAE 和 UniFormer 的 InternVideo 主干网络,并结合简单、任务特定的分类头,该方法在时刻查询、自然语言查询、未来手部预测、状态变化物体检测以及短期物体交互预测任务上均优于先前的 SOTA 模型。
In this report, we present our champion solutions to five tracks at Ego4D challenge. We leverage our developed InternVideo, a video foundation model, for five Ego4D tasks, including Moment Queries, Natural Language Queries, Future Hand Prediction, State Change Object Detection, and Short-term Object Interaction Anticipation. InternVideo-Ego4D is an effective paradigm to adapt the strong foundation model to the downstream ego-centric video understanding tasks with simple head designs. In these five tasks, the performance of InternVideo-Ego4D comprehensively surpasses the baseline methods and the champions of CVPR2022, demonstrating the powerful representation ability of InternVideo as a video foundation model. Our code will be released at https://github.com/OpenGVLab/ego4d-eccv2022-solutions
研究动机与目标
- 开发一种统一且高效的方法,用于多种第一人称视频理解任务,仅依赖单一视频基础模型。
- 通过在 Ego4D 数据集上微调,缓解通用视频数据集与第一人称视频数据之间的领域差异。
- 展示 InternVideo 作为基础模型在多种第一人称感知任务中强大的迁移能力与适应性。
- 探索不同主干网络架构与融合策略在第一人称视频理解中的有效性。
- 通过依赖强大且预训练的基础模型,最小化对复杂、任务特定分类头工程的依赖。
提出的方法
- 在所有五个任务中均采用 InternVideo(结合 VideoMAE 与 UniFormer 的视频基础模型)作为主干网络。
- 通过 VideoMAE 的掩码视频重建预训练方法,从未经修剪的第一人称视频中学习时空表征。
- 整合 UniFormer 的统一卷积与自注意力机制,以提升视频表征学习中的效率与准确性。
- 在 Ego4D 数据集上微调预训练的 InternVideo 模型,以缩小通用视频数据与第一人称视频数据之间的领域差距。
- 为 Ego4D 挑战赛的五个赛道分别设计轻量化、任务特定的分类头,包括检测头(VSGN、ActionFormer)以及用于时间到接触预测的回归头。
- 通过将可学习的位置编码应用于边界框坐标,并将其与 RoI 特征拼接,以增强特征融合,提升定位与回归性能。
实验结果
研究问题
- RQ1一个强大且统一的视频基础模型是否能在无需大量分类头工程的情况下,有效泛化到多种第一人称视频理解任务?
- RQ2InternVideo 在 Ego4D 挑战赛五个赛道中的性能与现有 SOTA 方法相比如何?
- RQ3在 Ego4D 数据集上微调在多大程度上缓解了通用视频数据集与第一人称视频数据之间的领域偏移?
- RQ4将位置编码整合到 RoI 特征中对时间到接触预测等回归任务有何影响?
- RQ5将模型预测结果与官方基线输出进行结果融合,在多大程度上能提升整体性能?
主要发现
- InternVideo-Ego4D 在 Ego4D 挑战赛全部五个赛道中均获得第一名,证明了其在多种第一人称视频任务中强大的泛化能力与鲁棒性。
- 该方法在全部 10 项评估指标上均优于基线模型与 CVPR 2022 挑战赛冠军模型,证实了基础模型方法的优越性。
- 在 Ego4D 数据集上微调预训练的 InternVideo 主干网络显著缩小了领域差距,从而在所有任务中均带来了稳定的性能提升。
- 将位置编码与 RoI 特征结合后,时间到接触预测性能得到提升,表明空间归纳偏置有助于增强回归性能。
- 通过融合模型预测与官方基线输出的 top-10 检测框,性能优于单一预测结果,且采用高 IoU 阈值进行 NMS 以去除冗余。
- 基于名词分类分数筛选前 5 个检测框可提升推理速度与泛化能力,而保留前 3 个检测框则在验证集上出现过拟合现象。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。