Skip to main content
QUICK REVIEW

[论文解读] The EPIC-KITCHENS Dataset: Collection, Challenges and Baselines

Dima Damen, Hazel Doughty|arXiv (Cornell University)|Apr 29, 2020
Human Pose and Action Recognition参考文献 11被引用 7
一句话总结

本论文介绍了EPIC-KITCHENS,这是一个大规模的视角内视频数据集,包含由来自4个国家的32名参与者记录的55小时自然、非脚本化的厨房活动,涵盖39,600个动作片段和454,158个物体边界框的密集标注。该数据集支持多模态动作识别与预测基准,基线实验表明,显式的时间建模与音视频融合能显著提升对细微视角内动作(如‘打开’与‘关闭’水龙头)的性能表现。

ABSTRACT

Since its introduction in 2018, EPIC-KITCHENS has attracted attention as the largest egocentric video benchmark, offering a unique viewpoint on people's interaction with objects, their attention, and even intention. In this paper, we detail how this large-scale dataset was captured by 32 participants in their native kitchen environments, and densely annotated with actions and object interactions. Our videos depict nonscripted daily activities, as recording is started every time a participant entered their kitchen. Recording took place in 4 countries by participants belonging to 10 different nationalities, resulting in highly diverse kitchen habits and cooking styles. Our dataset features 55 hours of video consisting of 11.5M frames, which we densely labelled for a total of 39.6K action segments and 454.2K object bounding boxes. Our annotation is unique in that we had the participants narrate their own videos after recording, thus reflecting true intention, and we crowd-sourced ground-truths based on these. We describe our object, action and. anticipation challenges, and evaluate several baselines over two test splits, seen and unseen kitchens. We introduce new baselines that highlight the multimodal nature of the dataset and the importance of explicit temporal modelling to discriminate fine-grained actions e.g. 'closing a tap' from 'opening' it up.

研究动机与目标

  • 创建一个大规模、真实的视角内视频数据集,用于捕捉多样文化与环境背景下自然、非脚本化的日常厨房活动。
  • 利用音频、视频与时间推理,开发用于视角内动作识别与预测的多模态基准。
  • 提供密集的、由参与者叙述的标注,以反映真实意图,提升动作与物体交互标注的真实感与准确性。
  • 为视角内视频中的动作识别、物体检测与动作预测建立开放挑战与基线,并提供已见与未见厨房的测试划分。
  • 支持在复杂多任务视角内场景中对细粒度动作区分与时间建模的研究。

提出的方法

  • 数据集由来自10个国籍、4个国家的32名参与者在其原生厨房中收集,记录所有未脚本化的厨房活动。
  • 参与者在录制后叙述其动作,这些叙述通过众包方式生成动作片段的真值标注。
  • 每段视频均被密集标注了39,600个动作片段的起止时间,以及454,158个物体边界框,以反映现实世界中的交互动态。
  • 数据集包含RGB视频、光流与音频流,音频被处理为256×256大小的对数频谱图,以支持多模态建模。
  • 基线模型采用多模态模型(RGB、光流、音频)进行后期融合,架构包括TSN、TRN、2SCNN、DMR与ED,用于动作预测。
  • 通过TSN(3段)与ED(16帧观测)等方法强调时间建模,而DMR采用两阶段训练流程实现基于图像的预测。

实验结果

研究问题

  • RQ1显式的时间建模在细粒度视角内动作识别(如区分‘打开’与‘关闭’水龙头)中的性能提升程度如何?
  • RQ2与单模态方法相比,多模态输入(RGB、光流、音频)在视角内视频中的动作识别与预测中提升了多少性能?
  • RQ3在EPIC-KITCHENS上训练的模型对未见厨房的泛化能力如何?已见与未见环境之间的性能差距有多大?
  • RQ4与传统人工标注相比,参与者叙述的标注是否能产生更准确、更具意图感知的动作标注?
  • RQ5在视角内设置中,音频模态对动作预测与识别的影响如何,特别是在短时或模糊动作中?

主要发现

  • EPIC-KITCHENS数据集包含55小时视频、1150万帧、39,600个动作片段与454,158个物体边界框,数据采集自多样化的现实厨房环境。
  • 基线结果表明,多模态融合——尤其是RGB、光流与音频的结合——显著优于单模态模型的动作识别准确率。
  • 显式时间建模(如TSN与TRN实现)在细粒度动作(如‘倒出’与‘搅拌’)上优于简单的时序池化方法。
  • 在已见厨房中训练的模型性能高于在未见厨房中的表现,凸显了视角内动作识别中领域泛化挑战。
  • 使用256×256大小的音频对数频谱图能有效提升对短时或模糊动作的区分能力,尤其在与视觉特征融合时。
  • DMR与ED基线表明,随着观察窗口延长(如4秒)与多模态特征融合,预测性能提升,尤其在早期预测场景中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。