Skip to main content
QUICK REVIEW

[論文レビュー] Learning When to Look: On-Demand Keypoint-Video Fusion for Animal Behavior Analysis

Weihan Li, Jingyang Ke|arXiv (Cornell University)|Mar 7, 2026
Zebrafish Biomedical Research Applications被引用数 0
ひとこと要約

LookAgain は keypoint ベースの動作とオンデマンドの視覚 grounding を組み合わせて動物行動を分析し、 keypoint 信号が曖昧なときにのみビデオ処理を有効化するゲーティングモジュールを訓練し、はるかに少ないフレーム数で同等の性能を達成します。

ABSTRACT

Understanding animal behavior from video is essential for neuroscience research. Modern laboratories typically collect two complementary data streams: skeletal keypoints from pose estimation tools and raw video recordings. Keypoint-based methods are efficient but suffer from geometric ambiguity, environmental blindness, and sensitivity to occlusions. Video-based methods capture rich context but require processing every frame, making them impractical for the hundreds of hours of recordings that modern experiments produce. We introduce LookAgain, a multimodal framework that combines the efficiency of keypoints with the representational power of video through on-demand visual grounding. During training, LookAgain uses dense visual features to pretrain a motion encoder and to train a gating module that learns which frames require visual context. During inference, this gating module activates visual processing only when keypoint signals are ambiguous, while maintaining performance comparable to using all frames. Experiments on single-animal and multi-animal benchmarks show that LookAgain achieves strong performance with significantly reduced computational cost, enabling high-quality behavior analysis on long-duration recordings.

研究の動機と目的

  • keypoints と video の両方を活用して効率的な動物行動分析を動機づける。
  • 密な視覚特徴を事前訓練に用い、推論時には学習されたゲートでオンデマンド推論を行う訓練・推論分離フレームワークを開発する。
  • 長時間録画に対して監督付き行動分類と教師なし行動セグメンテーションの両方を可能にする。

提案手法

  • 4つの損失(マスク、クロスモーダル視覚予測、動作再構成、RVQコミットメント)を用いて keypoint シークエンス上で密な視覚指針を用いたモーションエンコーダを事前訓練する。
  • Residual Vector Quantization で動作をトークン化し、Transformer で時系列コンテキストをモデル化し、複数の動物が存在する場合はクロスアニマルアテンションで社会的文脈をモデル化する。
  • 凍結されたビジョンエンコーダから視覚特徴を抽出し、視覚投影モジュールを介して動作空間に整列させる。
  • ゲーティングモジュールでトップk の有益なフレームを選択して視覚処理を有効化し、動作と視覚特徴のオンデマンド融合を可能にする。
  • ゲートされた視覚表現を動作埋め込みと融合して監督付き分類と教師なしセグメンテーションを行い、DEC ベースのクラスタリングでセグメンテーションを行い、全変動ペナルティで時系列コヒーレンスを促進する。

実験結果

リサーチクエスチョン

  • RQ1オンデマンド視覚 grounding ゲートは動物行動分析において計算量を削減しつつ性能を維持できるか?
  • RQ2密な視覚事前訓練を用いた訓練–推論分離はラベル不足条件下で下流の分類・セグメンテーションを改善するか?
  • RQ3キー・ポイントとビデオの融合は単一動物対複数動物の社会行動でどのように機能するか、特に遮蔽や同定の曖昧さがある場合は?
  • RQ4ゲーティング要素(キー・ポイント信頼性、動作顕在性、意味的文脈)がゲーティング有効性に与える影響は?

主な発見

  • オンデマンド視覚 grounding によって全フレームのうち25% のみを有効化しても、監督付きタスクで全フレームを用いる場合と同等の性能を達成する。
  • 密な視覚特徴を用いてモーションエンコーダを事前訓練すると、ゼロから訓練する場合より下流の監督付きおよび教師なしの性能が向上する。
  • ゲーティング機構は均一なフレームサンプリングより優れており、動作顕在性(q_t)が最も重要な要素である。
  • キー point- video 融合は複数の社会的行動で最も強い結果を示す一方で、 Oral Contact のような一部の行動は正確な幾何学的キー ポイントに依存する場合がある。
  • 教師なしセグメンテーションは視覚 grounding の恩恵を受け、Keypoints のみでは見逃される Feeding のような解釈可能な行動を発見できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。