Skip to main content
QUICK REVIEW

[论文解读] Learning When to Look: On-Demand Keypoint-Video Fusion for Animal Behavior Analysis

Weihan Li, Jingyang Ke|arXiv (Cornell University)|Mar 7, 2026
Zebrafish Biomedical Research Applications被引用 0
一句话总结

LookAgain 将基于关键点的运动与按需视觉定位相结合,用以分析动物行为,训练一个门控模块仅在关键点信号模糊时激活视频处理,从而在大幅减少帧数的情况下实现可比的性能。

ABSTRACT

Understanding animal behavior from video is essential for neuroscience research. Modern laboratories typically collect two complementary data streams: skeletal keypoints from pose estimation tools and raw video recordings. Keypoint-based methods are efficient but suffer from geometric ambiguity, environmental blindness, and sensitivity to occlusions. Video-based methods capture rich context but require processing every frame, making them impractical for the hundreds of hours of recordings that modern experiments produce. We introduce LookAgain, a multimodal framework that combines the efficiency of keypoints with the representational power of video through on-demand visual grounding. During training, LookAgain uses dense visual features to pretrain a motion encoder and to train a gating module that learns which frames require visual context. During inference, this gating module activates visual processing only when keypoint signals are ambiguous, while maintaining performance comparable to using all frames. Experiments on single-animal and multi-animal benchmarks show that LookAgain achieves strong performance with significantly reduced computational cost, enabling high-quality behavior analysis on long-duration recordings.

研究动机与目标

  • 通过同时利用关键点和视频来实现高效的动物行为分析。
  • 开发一个训练-推理解耦框架,在预训练阶段使用密集视觉特征,在推理阶段通过学习到的门控实现按需推断。
  • 在长时段记录上实现监督行为分类和无监督行为分割。

提出的方法

  • 使用四个损失(遮罩、跨模态视觉预测、运动重构、RVQ 承诺)对包含密集视觉引导的关键点序列预训练运动编码器。
  • 使用残差向量量化对运动进行分词,并用变换器建模时序上下文;当存在多只动物时,使用跨动物注意力建模社交上下文。
  • 从冻结的视觉编码器提取视觉特征,并通过视觉投影模块将其对齐到运动空间。
  • 通过一个门控模块进行微调,选择前 k 帧以激活视觉处理,实现运动和视觉特征的按需融合。
  • 将门控的视觉表示与运动嵌入融合,用于监督分类和无监督分割,使用基于 DEC 的聚类进行分割,并引入总变差惩罚以促进时序一致性。

实验结果

研究问题

  • RQ1在动物行为分析中,按需视觉定位门是否能在降低计算量的同时保持性能?
  • RQ2带密集视觉预训练的训练-推理解耦是否能在标签稀缺条件下提升下游分类和分割的性能?
  • RQ3关键点-视频融合在单一动物与多动物社会行为中的表现,尤其在遮挡或身份模糊时有何差异?
  • RQ4门控组件(关键点可靠性、运动显著性、语义上下文)对门控有效性的影响是什么?

主要发现

  • 仅对 25% 的帧启用按需视觉定位即可在监督任务中达到与使用全部帧相当的性能。
  • 以密集视觉特征对运动编码器进行预训练,显著提高下游的监督与无监督性能,相较从零开始训练有明显提升。
  • 门控机制优于均匀帧采样,其中运动显著性(q_t)是最关键的组成部分。
  • 关键点-视频融合在多种社交行为中表现最强,尽管某些行为如 Oral Contact 可能更依赖于精确的几何关键点。
  • 无监督分割在视觉定位的帮助下受益匪浅,能够发现可解释的行为如 Feeding,而关键点单独难以发现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。