Skip to main content
QUICK REVIEW

[論文レビュー] MABe22: A Multi-Species Multi-Task Benchmark for Learned Representations of Behavior

Jennifer J. Sun, Marks, Markus|arXiv (Cornell University)|Jul 21, 2022
Species Distribution and Climate Change被引用数 11
ひとこと要約

MABe22は、マウス、コ walk ハエ、コ walk ハエのビデオおよびポーズトラッキングデータを用いて、動物行動の学習済み表現を評価する大規模かつマルチスペーシーズのベンチマークを導入する。実験的条件の分類やエキスパートアノテーション付き行動の分類といった多様な下流タスクにおいて自己教師あり表現学習手法を評価し、ヒトの行動データセットで事前学習したモデルが動物行動に一般化しにくく、トランスフォーマー型アーキテクチャが主要タスクで最先端の性能を達成することを示している。

ABSTRACT

We introduce MABe22, a large-scale, multi-agent video and trajectory benchmark to assess the quality of learned behavior representations. This dataset is collected from a variety of biology experiments, and includes triplets of interacting mice (4.7 million frames video+pose tracking data, 10 million frames pose only), symbiotic beetle-ant interactions (10 million frames video data), and groups of interacting flies (4.4 million frames of pose tracking data). Accompanying these data, we introduce a panel of real-life downstream analysis tasks to assess the quality of learned representations by evaluating how well they preserve information about the experimental conditions (e.g. strain, time of day, optogenetic stimulation) and animal behavior. We test multiple state-of-the-art self-supervised video and trajectory representation learning methods to demonstrate the use of our benchmark, revealing that methods developed using human action datasets do not fully translate to animal datasets. We hope that our benchmark and dataset encourage a broader exploration of behavior representation learning methods across species and settings.

研究の動機と目的

  • マルチエージェント動物行動の学習済み表現を評価するための標準化された大規模ベンチマークの不足に対処すること。
  • 生物学的実験から得た本物のデータに基づくアノテーションに依存しない下流評価タスクを提供し、表現の質を客観的に評価すること。
  • 最先端の自己教師あり動画および軌道表現学習手法が、異なる種や実験的条件間でどれほど一般化するかを評価すること。
  • 局所的な時間的ダイナミクスと実験的変調を捉える、より強力でデータ効率の良い行動表現モデルの開発を可能にすること。
  • 遺伝的・光遺伝学的・サーカディアン操作下での行動変化の分析を自動化するための表現を生物学者に提供すること。

提案手法

  • ベンチマークは、マウス(三連組)、共生するコ walk ハエ-アリペア、およびハエ(グループ)の3種から、変化する実験的条件のもとで高解像度のビデオおよび2次元ポーズトラッキングデータを収集する。
  • 実験的変数(系統、1日中の時間帯、光遺伝学的刺激)およびエキスパートアノテーション付き行動(例:追跡、団欒、嗅覚行動)をフレーム単位で分類する50以上の下流分類タスクのスイートを導入する。
  • 対照的学習、マスキング自己オートエンコーダ、トランスフォーマー(例:T-Perceiver、T-GPT、T-PointNet)を用いた動画クリップや軌道シーケンスへの適用により、表現を学習する。
  • 評価にはタスク固有の指標を用いる:連続変数には平均二乗誤差(MSE)、2値または多値分類の行動ラベルにはF1スコアを用い、5つのランダムシードで平均化する。
  • 行動イベント検出の整合性を保つために、行動バースト(例:最小継続時間、バースト間ギャップ)の時間的フィルタリングおよびマージルールをデータセットに含む。
  • ベースラインにはPCAとシンプルな軌道エンコーダを含み、モデル間での性能比較によりアーキテクチャの強みと限界を特定する。

実験結果

リサーチクエスチョン

  • RQ1自己教師あり動画および軌道表現学習手法は、異なる動物種や行動的文脈においてどれほど一般化するか?
  • RQ2ヒトの行動データセットで事前学習したモデルは、特に微細な局所的行動ダイナミクスを捉えるのにどれほど効果的か?
  • RQ3トランスフォーマー、ポイントクラウド、オートエンコーダなどの表現学習アーキテクチャのうち、どのタイプが実験的条件およびフレームレベルの行動に関する情報を最もよく保持するか?
  • RQ4光遺伝学的刺激や系統の分類といったアノテーションに依存しない下流タスクは、表現の質を評価するための信頼性があり客観的な指標として機能するか?
  • RQ5表現のデータ効率性と時間的感度が、希少または短時間の行動イベントにおける性能にどのように影響するか?

主な発見

  • トランスフォーマー型モデル、特にT-BERTとT-Perceiverが、マウスおよびハエの大多数のタスクグループで最高のパフォーマンスを達成し、マウスの接触行動タスクではF1スコア0.786 ± 0.022を記録した。
  • T-PointNetはマウスの三連組データにおいて優れたパフォーマンスを示した(観察行動のF1 = 0.697 ± 0.006)、これによりポイントクラウドモデリングがマルチエージェントポーズシーケンスに有効であることが示された。
  • PCAやシンプルなベースラインはフレームレベルの行動タスクで著しく低いパフォーマンスを示した(例:マウスの観察行動ではF1 < 0.17)、無教師ベースラインが局所的な時間的ダイナミクスを捉えられていないことを示している。
  • ヒトの行動データセットで事前学習したモデル(例:TVAE)は動物行動への転移性が限定的で、接触行動のF1スコアが0.15未満にとどまり、ドメインシフトの問題が顕著に現れた。
  • ハエの性別(例:メス対オス)を分類するタスクではT-Perceiverがほぼ完璧なパフォーマンス(F1 = 0.990 ± 0.000)を達成し、シーケンスレベルの属性に対する強力な表現学習が可能であることを示した。
  • 希少行動(例:口腔生殖器接触)のタスクでは、すべてのモデルでパフォーマンスが低く抑えられ、データ効率性と局所的な時間的モデリングの向上が今後の課題であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。