[论文解读] BON: An extended public domain dataset for human activity recognition
本论文介绍了BON,这是一个大规模、公开可用的首人称视觉(FPV)数据集,涵盖在巴塞罗那、牛津和内罗毕三个地点,由25名受试者使用胸前佩戴的GoPro相机采集的18种常见办公活动。该数据集包含2,639段五秒长的视频片段,并配有详细标注,同时提供了来自IEEE VIP Cup 2019的三个表现最佳的基线模型,使得在存在类内差异和类间相似性等挑战的情况下,仍能实现对第一人称办公活动识别的稳健基准测试。
Body-worn first-person vision (FPV) camera enables to extract a rich source of information on the environment from the subject's viewpoint. However, the research progress in wearable camera-based egocentric office activity understanding is slow compared to other activity environments (e.g., kitchen and outdoor ambulatory), mainly due to the lack of adequate datasets to train more sophisticated (e.g., deep learning) models for human activity recognition in office environments. This paper provides details of a large and publicly available office activity dataset (BON) collected in different office settings across three geographical locations: Barcelona (Spain), Oxford (UK) and Nairobi (Kenya), using a chest-mounted GoPro Hero camera. The BON dataset contains eighteen common office activities that can be categorised into person-to-person interactions (e.g., Chat with colleagues), person-to-object (e.g., Writing on a whiteboard), and proprioceptive (e.g., Walking). Annotation is provided for each segment of video with 5-seconds duration. Generally, BON contains 25 subjects and 2639 total segments. In order to facilitate further research in the sub-domain, we have also provided results that could be used as baselines for future studies.
研究动机与目标
- 解决首人称视觉办公活动识别领域缺乏大规模、公开可用数据集的问题,特别是基于第一人称视觉的场景。
- 在多个地理区域收集多样化的真实办公活动数据,以提升模型的泛化能力。
- 提供一个丰富标注的数据集,包含18种不同的办公活动,分为人际互动、人机互动和本体感觉动作三类。
- 通过发布基于完整BON数据集的IEEE VIP Cup 2019挑战赛中表现最佳的基线模型,促进基准测试。
- 突出展示办公环境中真实存在的挑战,如光照变化、遮挡、类内差异和类间相似性。
提出的方法
- 使用胸前佩戴的GoPro Hero3+相机,在1280×720分辨率和30 fps下,从三个全球办公场所的25名受试者中采集视频数据。
- 对2,639段视频片段(每段5秒)进行标注,涵盖18种办公活动,分为三类:人际互动、人机互动和本体感觉动作。
- 在不同地点(巴塞罗那、牛津、内罗毕)和受试者之间进行分层数据采集,以确保模型训练的多样性和鲁棒性。
- 采用时空注意力网络(STANet)、Inception-V3与MLP结合,以及带有注意力机制的集成RNN模型进行基线模型开发。
- 使用预训练的ImageNet模型(如DenseNet、Wide-ResNet)进行特征提取,通过微调和平衡批次采样缓解类别不平衡问题。
- 将光流和RGB帧作为输入,以增强最先进STANet基线模型中的时空建模能力。
实验结果
研究问题
- RQ1如何在多样化的地理和环境条件下构建大规模、公开可用的首人称视觉办公活动识别数据集?
- RQ2从首人称视频中识别办公活动的关键挑战是什么,例如类内差异和类间相似性?
- RQ3不同深度学习架构在真实世界首人称办公活动识别基准上的表现如何?
- RQ4迁移学习和注意力机制在具有挑战性且多样化的BON数据集上能在多大程度上提升识别准确率?
- RQ5大型竞赛中公开发布的基线模型能否作为未来在BON数据集上研究的可靠性能基准?
主要发现
- BON数据集包含2,639个标注视频片段,涵盖18种不同的办公活动,数据来自三个国家的25名受试者,确保了地理和环境的多样性。
- 基于STANet的最先进基线模型在BON数据集上实现了0.749的平均F1分数,优于IEEE VIP Cup 2019挑战赛中的其他方法。
- 基于Inception-V3与MLP的第二名模型实现了0.678的平均F1分数,表明简单架构也能表现出色。
- 基于集成RNN的第三名模型实现了0.658的平均F1分数,显示出结合多模型、注意力机制和类别平衡采样策略的有效性。
- 该数据集表现出显著的真实世界挑战,包括光照变化、遮挡,以及较高的类内差异(如使用自动售货机的不同方式)和类间相似性(如“阅读”与“打字”、“机器”与“取用”)。
- 不同办公环境的多样性(如不同类型的干手器和行走环境)凸显了在真实部署中需要具备鲁棒性和泛化能力的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。