Skip to main content
QUICK REVIEW

[论文解读] Self-Supervised Keypoint Discovery in Behavioral Videos

Jennifer J. Sun, Serim Ryou|arXiv (Cornell University)|Dec 9, 2021
Human Pose and Action Recognition被引用 8
一句话总结

本文提出 B-KinD,一种无需人工标注的自监督方法,用于在行为视频中发现语义上有意义的关键点。通过使用带有几何瓶颈的编码器-解码器架构,重建视频帧之间的时空差异,模型聚焦于运动的主体,实现了在关键点回归任务上的最先进性能,并在包括小鼠、果蝇、人类、水母和树木在内的多种生物的行为分类任务中达到与监督方法相当的结果。

ABSTRACT

We propose a method for learning the posture and structure of agents from unlabelled behavioral videos. Starting from the observation that behaving agents are generally the main sources of movement in behavioral videos, our method, Behavioral Keypoint Discovery (B-KinD), uses an encoder-decoder architecture with a geometric bottleneck to reconstruct the spatiotemporal difference between video frames. By focusing only on regions of movement, our approach works directly on input videos without requiring manual annotations. Experiments on a variety of agent types (mouse, fly, human, jellyfish, and trees) demonstrate the generality of our approach and reveal that our discovered keypoints represent semantically meaningful body parts, which achieve state-of-the-art performance on keypoint regression among self-supervised methods. Additionally, B-KinD achieve comparable performance to supervised keypoints on downstream tasks, such as behavior classification, suggesting that our method can dramatically reduce model training costs vis-a-vis supervised methods.

研究动机与目标

  • 在无需人工标注的情况下实现行为视频中的关键点发现,降低行为分析的训练成本。
  • 解决现有自监督关键点方法依赖边界框或在多主体或非中心化主体情况下失效的局限性。
  • 利用行为视频中静态背景的结构特性,提升关键点定位性能。
  • 在下游行为分析任务中实现与监督关键点检测器相当的性能。
  • 生成语义上有意义、低维且可解释的表示,便于行为特征计算。

提出的方法

  • 该方法采用带有几何瓶颈的编码器-解码器架构,重建连续视频帧之间的时空差异。
  • 重建目标为时间维度上的像素强度差异,从而突出运动区域(主要为行为主体),同时抑制静态背景。
  • 关键点从瓶颈层的潜在表示中预测,置信度分数基于热力图峰值值获得。
  • 模型通过在原始视频帧上使用重建损失进行端到端训练,无需边界框或人工标注的关键点标签。
  • 应用数据增强和图像对齐(如用于无人机拍摄的树木视频)以提升对相机漂移和运动变化的鲁棒性。
  • 通过聚焦于运动驱动的结构变化而非外观或特定对象特征,该方法在不同生物间具有良好的泛化能力。

实验结果

研究问题

  • RQ1自监督关键点发现能否在无需人工标注的真实世界行为视频中有效应用?
  • RQ2与单帧重建相比,重建时空差异是否能提升关键点定位性能?
  • RQ3所发现的关键点能否在形态和运动方式各异的多种生物间实现泛化?
  • RQ4自监督关键点在下游行为分类和关键点回归任务中的性能与监督基线相比如何?
  • RQ5模型热力图预测的置信度分数是否有助于识别被遮挡或可见度低的身体部位?

主要发现

  • B-KinD 在所有测试数据集(包括 CalMS21、Fly-vs-Fly、Human 3.6M、Jellyfish 和 Vegetations)上均实现了自监督关键点回归的最先进性能。
  • 该方法在行为分类任务中的准确率与监督关键点模型相当,显著降低了标注成本。
  • 所发现的关键点具有语义意义,能一致地定位到小鼠、果蝇、人类和水母的鼻尖、脊柱、关节和翅膀尖端等解剖特征。
  • 置信度分数与可见性相关——背景或被遮挡部位的置信度较低,而明显可见的身体部位(如小鼠的鼻尖)置信度较高。
  • 模型能泛化至多主体(如同一帧中的果蝇和小鼠)和复杂运动(如摇曳的树木和人类的自遮挡)。
  • 局限性包括对称姿势下的左右互换问题,以及在严重遮挡情况下的准确率下降,提示未来可通过 3D 多视角扩展进一步改进。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。