[论文解读] 3rd Continual Learning Workshop Challenge on Egocentric Category and Instance Level Object Understanding
本论文介绍了第三届计算机视觉持续学习(CLVision)研讨会挑战赛,该挑战赛基于EgoObjects数据集构建了一个大规模第一人称视角目标检测基准,用于评估类别级与实例级目标理解的持续学习算法。挑战赛聚焦于在增量学习体验中缓解灾难性遗忘问题,最优提交方案通过经验均衡回放与知识蒸馏技术实现了54.7 mAP的性能。
Continual Learning, also known as Lifelong or Incremental Learning, has recently gained renewed interest among the Artificial Intelligence research community. Recent research efforts have quickly led to the design of novel algorithms able to reduce the impact of the catastrophic forgetting phenomenon in deep neural networks. Due to this surge of interest in the field, many competitions have been held in recent years, as they are an excellent opportunity to stimulate research in promising directions. This paper summarizes the ideas, design choices, rules, and results of the challenge held at the 3rd Continual Learning in Computer Vision (CLVision) Workshop at CVPR 2022. The focus of this competition is the complex continual object detection task, which is still underexplored in literature compared to classification tasks. The challenge is based on the challenge version of the novel EgoObjects dataset, a large-scale egocentric object dataset explicitly designed to benchmark continual learning algorithms for egocentric category-/instance-level object understanding, which covers more than 1k unique main objects and 250+ categories in around 100k video frames.
研究动机与目标
- 通过引入一个复杂且贴近现实的基准,推动计算机视觉领域持续学习的发展,该基准针对第一人称视角目标检测。
- 激发对持续目标检测的研究兴趣,该领域相较于持续分类仍较少被探索。
- 在大规模、长尾分布、增量式目标检测任务上,评估并比较最先进的持续学习方法。
- 促进高效内存利用且具备鲁棒性的持续学习解决方案的发展,以适应真实场景的部署需求。
提出的方法
- 挑战赛使用了EgoObjects数据集,该数据集是一个大规模第一人称视频数据集,包含约10万个帧、1110种独特物体和250多个类别。
- 参赛者在400多个增量体验中逐步训练目标检测器,模拟无历史数据访问的终身学习过程。
- 评估重点在于使用mAP和AP50指标衡量类别级与实例级检测性能。
- 表现最佳的方法采用了经验均衡回放缓冲区、知识蒸馏技术,以及在COCO或LVIS上预训练的ResNet骨干网络。
- 竞赛采用多轨道设置:实例分类、类别检测与实例检测,最终在预留的测试集上进行评估。
- 解决方案的评估重点在于泛化能力与遗忘缓解效果,性能在增量学习各阶段进行测量。
实验结果
研究问题
- RQ1不同回放策略(经验、视频、实例均衡)对持续目标检测性能有何影响?
- RQ2知识蒸馏在多大程度上可减少持续目标检测中的灾难性遗忘?
- RQ3现有检测模型能否在无灾难性遗忘的前提下,泛化到第一人称视频中的长尾、增量类流?
- RQ4在真实的第一人称场景中,不同持续学习设置下,mAP与AP50等性能指标如何变化?
- RQ5哪些关键的网络架构与训练设计选择导致了持续目标检测中的顶尖性能?
主要发现
- 第一名提交方案(Tecent Youtu Lab)通过使用经验均衡回放缓冲区与知识蒸馏,实现了54.7 mAP与61.2 AP50的性能。
- 第二名团队(NUS&A*STAR)采用视频均衡回放缓冲区与Faster R-CNN及ResNet50,实现了45.4 mAP与56.0 AP50的性能。
- 第三名提交方案(Angelo Menezes)采用实例均衡回放缓冲区与FCOS及ResNet50,实现了41.7 mAP与51.1 AP50的性能。
- 所有顶尖模型均依赖完整的回放缓冲区,表明其在持续检测中实现高性能的必要性。
- 前两名团队均使用了知识蒸馏技术,表明其在缓解检测头遗忘方面具有显著有效性。
- 挑战赛共收到360份有效的实例分类赛道提交,105份类别检测赛道提交,53份实例检测赛道提交,显示出社区的广泛参与。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。