[论文解读] Assembly101: A Large-Scale Multi-View Video Dataset for Understanding Procedural Activities
Assembly101 引入了一个大规模、多视角的视频数据集,包含 4321 个视频序列,记录了人们从 8 种静态视角和 4 种第一视角视角对 101 种可拆卸玩具车辆进行组装与拆卸的过程。该数据集包含超过 100 万个细粒度动作片段、1800 万个 3D 手部姿态,并引入了一项新颖的错误检测任务,支持在动作识别、预测、时序分割以及跨玩具、视角和技能水平的泛化能力方面进行基准测试,通过多视角融合可实现显著的性能提升。
Assembly101 is a new procedural activity dataset featuring 4321 videos of people assembling and disassembling 101 "take-apart" toy vehicles. Participants work without fixed instructions, and the sequences feature rich and natural variations in action ordering, mistakes, and corrections. Assembly101 is the first multi-view action dataset, with simultaneous static (8) and egocentric (4) recordings. Sequences are annotated with more than 100K coarse and 1M fine-grained action segments, and 18M 3D hand poses. We benchmark on three action understanding tasks: recognition, anticipation and temporal segmentation. Additionally, we propose a novel task of detecting mistakes. The unique recording format and rich set of annotations allow us to investigate generalization to new toys, cross-view transfer, long-tailed distributions, and pose vs. appearance. We envision that Assembly101 will serve as a new challenge to investigate various activity understanding problems.
研究动机与目标
- 创建一个大规模、多视角的自然、目标导向的程序性活动视频数据集,且不局限于厨房场景。
- 捕捉现实世界中组装与拆卸任务期间动作顺序、错误及纠正的丰富变化。
- 支持在动作识别、预测、时序分割以及一项新颖的错误检测任务上的基准测试。
- 支持跨视角泛化、长尾分布鲁棒性以及姿态与外观理解方面的研究。
- 提供同步的静态视角与第一视角,以提升对手-物体交互的 3D 理解能力。
提出的方法
- 使用 8 个静态摄像头和 4 个第一视角摄像头,同步采集参与者组装与拆卸 101 种玩具车辆的多视角视频。
- 每个视频序列标注了 1380 种细粒度动作类别和 202 种粗粒度动作类别,包含超过 10 万个粗粒度动作片段和 100 万个细粒度动作片段,以及 1800 万个 3D 手部姿态。
- 在动作识别与预测任务中,使用帧级交叉熵损失(带类别权重)和均方误差损失,对 MS-TCN++ 和 C2F-TCN 等模型进行训练。
- 在错误检测任务中,采用修改后的 TempAgg 模型,使用 60 秒上下文窗口和多尺度时间聚合,以检测错误与纠正行为。
- 通过固定视角与第一视角得分的平均池化实现多视角融合,以提升识别与预测性能。
- 训练流程采用 TSM 特征,结合 Adam 优化、学习率衰减和 Dropout,以增强对类别不平衡的鲁棒性。
实验结果
研究问题
- RQ1来自同步静态视角与第一视角的多视角监督在多大程度上提升了动作识别与预测性能?
- RQ2模型在未见过的玩具类别上,尤其是动作类别呈现长尾分布时,其泛化能力如何?
- RQ3模型能否在非脚本化、自由风格的程序性活动中有效检测错误与纠正行为?
- RQ4在程序性任务中,基于姿态的特征与基于外观的特征在理解手-物体交互方面表现如何比较?
- RQ5技能水平与动作顺序变化对程序性活动理解中模型性能的影响是什么?
主要发现
- 多视角融合显著提升了动作识别的 Top-5 准确率,细粒度动作的准确率从 58.5%(Overall)提升至 71.6%(Fusion)。
- 表现最佳的模型在固定视角上的 Top-5 准确率为 88.5%,在第一视角上的准确率为 82.7%,多视角融合进一步将性能提升至 88.5%。
- 通过使用 60 秒上下文窗口和多尺度聚合的 TempAgg 模型,错误检测任务取得了良好效果,错误与纠正类别的召回率均得到提升。
- ‘transporter’ 玩具类别因录制密度高(22 名参与者)而达到最高的识别准确率(91.2% Top-5)。
- 动词如 ‘pick up’ 和 ‘put down’ 的识别召回率最高,而 ‘attempt to’ 类动词的召回率最低,表明建模意图存在挑战。
- 粗粒度动作识别结果显示,‘demonstrate’、‘attach’ 和 ‘detach’ 的召回率最高,而 ‘position’、‘remove’ 和 ‘attempt to screw’ 是最具挑战性的动词。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。