Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Action Segmentation by Joint Representation Learning and Online Clustering

Sateesh Kumar, Sanjay Haresh|arXiv (Cornell University)|May 27, 2021
Human Pose and Action Recognition被引用 4
一句话总结

本文提出了一种联合表示学习与在线聚类框架,用于无监督动作分割,通过时间最优传输保留动作顺序。通过在线处理小批量数据并整合时间正则化,该方法在公共数据集和自定义数据集上实现了最先进性能,且相比先前的离线、顺序方法,内存使用量显著降低。

ABSTRACT

We present a novel approach for unsupervised activity segmentation which uses video frame clustering as a pretext task and simultaneously performs representation learning and online clustering. This is in contrast with prior works where representation learning and clustering are often performed sequentially. We leverage temporal information in videos by employing temporal optimal transport. In particular, we incorporate a temporal regularization term which preserves the temporal order of the activity into the standard optimal transport module for computing pseudo-label cluster assignments. The temporal optimal transport module enables our approach to learn effective representations for unsupervised activity segmentation. Furthermore, previous methods require storing learned features for the entire dataset before clustering them in an offline manner, whereas our approach processes one mini-batch at a time in an online manner. Extensive evaluations on three public datasets, i.e. 50-Salads, YouTube Instructions, and Breakfast, and our dataset, i.e., Desktop Assembly, show that our approach performs on par with or better than previous methods, despite having significantly less memory constraints. Our code and dataset are available on our research website: https://retrocausal.ai/research/

研究动机与目标

  • 为解决顺序表示学习与聚类在无监督动作分割中的局限性,这些局限性阻碍了各阶段之间的反馈,且需要为离线特征存储消耗大量内存。
  • 将表示学习与聚类统一为单一端到端框架,直接优化无监督活动分割目标。
  • 通过在聚类过程中引入时间顺序保持约束,利用最优传输方法,利用视频中的时间结构。
  • 通过以在线小批量方式处理数据,而非存储所有特征用于离线聚类,从而降低内存消耗。
  • 在公共基准(50-Salads、YouTube Instructions、Breakfast)和一个包含23个动作类别的新、多样化Desktop Assembly数据集上评估该方法。

提出的方法

  • 该方法使用视频帧聚类作为先验任务,在单一框架中联合优化表示学习与在线聚类。
  • 引入时间最优传输(TOT)模块,通过在连续帧间正则化聚类分配,强制在伪标签分配过程中保持时间顺序。
  • 框架采用对比学习目标(TCL),结合温度缩放和动量更新,以提升特征判别能力。
  • 每次仅处理一个小型批量,每个批量包含来自两段视频的帧,从而实现在线学习并保持极低的内存占用。
  • 模型使用ResNet-18主干网络,以ImageNet预训练特征作为输入,并通过Sinkhorn-Knopp迭代高效求解最优传输问题。
  • 超参数如温度(τ=0.1)、窗口大小(λ=30)和学习率(1e-3)根据数据集进行调优,以平衡聚类与表示学习。

实验结果

研究问题

  • RQ1联合表示学习与在线聚类是否能优于无监督动作分割中的顺序方法?
  • RQ2通过最优传输引入时间顺序是否能提升聚类质量与表示学习性能?
  • RQ3在线小批量处理策略在多大程度上降低了内存使用量,同时不损害性能?
  • RQ4该方法在多样化数据集上的泛化能力如何,包括新收集的包含23个动作类别的Desktop Assembly数据集?
  • RQ5使用时间最优传输是否能生成比标准聚类更连贯、时间上更一致的动作分割?

主要发现

  • 所提方法在三个公共数据集(50-Salads、YouTube Instructions、Breakfast)上的性能与最先进无监督动作分割方法相当或更优。
  • 在50-Salads数据集上,该方法在评估粒度下取得0.891的F1分数,在中间粒度下取得0.863,两种设置下均优于先前方法。
  • 在YouTube Instructions数据集上,该方法取得0.832的F1分数,表明其在多样化视频分布中具有强大的泛化能力。
  • 在Breakfast数据集上,该方法取得0.801的F1分数,表明其在多个动作类别和不同视频长度下均表现稳定。
  • 通过在线小批量处理方式,该方法显著降低了内存使用量,避免了为离线聚类存储所有特征的需求。
  • 消融实验验证了时间最优传输与对比学习(TOT+TCL)组合的最优性能,证实了联合学习框架的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。