[论文解读] Trespassing the Boundaries: Labeling Temporal Bounds for Object Interactions in Egocentric Video
本文揭示了在三个数据集中,对于第一人称视角物体交互行为的时间边界标注存在显著不一致,表明即使时间起点/终点发生微小偏移,最先进的模型识别准确率也会下降高达10%。为解决此问题,作者提出Rubicon Boundaries——受认知心理学启发——基于不同的动作阶段对标注进行标准化,使GTEA Gaze+数据集的准确率提升4%,并使55%的动作类别实现更高的分类性能。
Manual annotations of temporal bounds for object interactions (i.e. start and end times) are typical training input to recognition, localization and detection algorithms. For three publicly available egocentric datasets, we uncover inconsistencies in ground truth temporal bounds within and across annotators and datasets. We systematically assess the robustness of state-of-the-art approaches to changes in labeled temporal bounds, for object interaction recognition. As boundaries are trespassed, a drop of up to 10% is observed for both Improved Dense Trajectories and Two-Stream Convolutional Neural Network. We demonstrate that such disagreement stems from a limited understanding of the distinct phases of an action, and propose annotating based on the Rubicon Boundaries, inspired by a similarly named cognitive model, for consistent temporal bounds of object interactions. Evaluated on a public dataset, we report a 4% increase in overall accuracy, and an increase in accuracy for 55% of classes when Rubicon Boundaries are used for temporal annotations.
研究动机与目标
- 调查在三个公开数据集中,第一人称视频中物体交互行为的时间边界标注在跨数据集和数据集内部的一致性。
- 评估最先进动作识别模型——改进型密集轨迹(Improved Dense Trajectories)和双流卷积神经网络(Two-Stream Convolutional Neural Networks)——在时间边界扰动下的鲁棒性。
- 提出一种受认知心理学启发的标注框架Rubicon Boundaries,基于不同的动作阶段对时间边界标注进行标准化。
- 证明通过Rubicon Boundaries实现的一致标注可提升识别准确率与泛化能力,即使在应用数据增强时亦然。
提出的方法
- 系统分析三个第一人称数据集(GTEA Gaze+、GTEA Gaze+ Extended 和 EPFL-CD)中时间边界标注的不一致性。
- 对真实时间边界(IoU > 0.5)施加受控扰动,以评估IDT与2SCNN模型的识别鲁棒性。
- 提出Rubicon Boundaries,一种基于认知心理学的标注方案,定义三个动作阶段:预动作阶段(pre-actional)、动作阶段(actional)和后动作阶段(post-actional)。
- 使用Rubicon Boundaries对GTEA Gaze+数据集进行重新标注,生成两种变体:'act'(仅包含动作阶段)和'full'(包含整个Rubicon阶段)。
- 在相同条件下,对2SCNN模型在传统标注与Rubicon标注的片段上进行训练与评估,以隔离边界一致性的影响。
- 通过真实标注与生成的具有不同起止时间的片段,比较传统标注与Rubicon标注数据的性能表现。
实验结果
研究问题
- RQ1在第一人称视频数据集之间及内部,物体交互行为的时间边界标注一致性如何?
- RQ2标注的时间边界变化在多大程度上影响最先进动作识别模型的性能?
- RQ3受认知心理学启发的标注框架能否提升第一人称动作识别中的一致性与识别准确率?
- RQ4与传统标注相比,使用Rubicon Boundaries是否能带来更好的泛化能力与鲁棒性?
主要发现
- 在三个第一人称数据集之间及内部,时间边界标注存在显著不一致,即使同一动作类别也表现出高度变异性。
- 当时间边界发生扰动时,IDT与2SCNN模型的识别准确率最高下降10%,即使与真实标注的IoU > 0.5。
- 与传统标注相比,使用Rubicon Boundaries进行标注使GTEA Gaze+数据集的整体识别准确率提升4%。
- 在42个动作类别中,55%(23个)的类别在使用完整Rubicon边界段时识别准确率得到提升,仅10个类别无变化。
- Rubicon标注的片段在边界扰动下表现出更强的鲁棒性,其准确率高于相同条件下生成的传统标注片段。
- 准确率的提升完全归因于边界一致性的改善,单纯的数据增强无法复制Rubicon标注带来的性能增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。