[论文解读] MABe22: A Multi-Species Multi-Task Benchmark for Learned Representations of Behavior
MABe22 提供了一个大规模、多物种的基准,用于评估基于小鼠、步甲虫和果蝇的视频与姿态追踪数据所学习到的动物行为表征。该基准在多种下游任务(如分类实验条件和专家标注的行为)上评估了自监督表征学习方法,表明在人类动作数据集上预训练的模型在动物行为上的泛化能力较差,而基于 Transformer 的架构在关键任务上达到了最先进性能。
We introduce MABe22, a large-scale, multi-agent video and trajectory benchmark to assess the quality of learned behavior representations. This dataset is collected from a variety of biology experiments, and includes triplets of interacting mice (4.7 million frames video+pose tracking data, 10 million frames pose only), symbiotic beetle-ant interactions (10 million frames video data), and groups of interacting flies (4.4 million frames of pose tracking data). Accompanying these data, we introduce a panel of real-life downstream analysis tasks to assess the quality of learned representations by evaluating how well they preserve information about the experimental conditions (e.g. strain, time of day, optogenetic stimulation) and animal behavior. We test multiple state-of-the-art self-supervised video and trajectory representation learning methods to demonstrate the use of our benchmark, revealing that methods developed using human action datasets do not fully translate to animal datasets. We hope that our benchmark and dataset encourage a broader exploration of behavior representation learning methods across species and settings.
研究动机与目标
- 为评估多Agent动物行为的表征学习缺乏标准化、大规模基准的问题提供解决方案。
- 提供基于真实生物实验的非标注型下游评估任务,以客观评估表征质量。
- 评估最先进自监督视频与轨迹表征学习方法在不同物种和实验条件下的泛化能力。
- 推动开发更具鲁棒性、数据效率更高的行为表征模型,以捕捉局部时间动态和实验调制。
- 通过提供可自动分析基因操作、光遗传学或昼夜节律干预下行为变化的表征,支持生物学研究。
提出的方法
- 该基准收集了三种物种的高分辨率视频和 2D 姿态追踪数据:小鼠(三联体)、共生的步甲虫-蚂蚁对,以及果蝇(群体),实验条件多样。
- 引入了一套 50 多项下游分类任务,包括实验变量(品系、一天中时间、光遗传刺激)和帧级专家标注行为(如追逐、聚集、嗅探)。
- 通过对比学习、掩码自编码器和 Transformer(如 T-Perceiver、T-GPT、T-PointNet)等自监督方法,对视频片段或轨迹序列学习表征。
- 评估使用任务特定指标:连续变量使用均方误差(MSE),二分类或多分类行为标签使用 F1 分数,结果在五个随机种子上取平均。
- 数据集包含行为片段的时序过滤与合并规则(如最小持续时间、片段间间隔),以确保行为事件检测的一致性。
- 基线方法包括 PCA 和简单轨迹编码器,通过跨模型比较识别架构的优势与局限。
实验结果
研究问题
- RQ1自监督视频与轨迹表征学习方法在不同动物物种和行为情境下的泛化能力如何?
- RQ2在人类动作数据集上预训练的模型在动物行为数据上的表现如何,特别是在捕捉细微、局部行为动态方面?
- RQ3哪些表征学习架构(如 Transformer、点云、自编码器)最能保留关于实验条件和帧级行为的信息?
- RQ4非标注型下游任务(如分类光遗传刺激或品系)能否作为表征质量的可靠、客观指标?
- RQ5表征的数据效率和时间敏感性如何影响对罕见或短时长行为事件的性能?
主要发现
- 基于 Transformer 的模型,尤其是 T-BERT 和 T-Perceiver,在大多数小鼠和果蝇任务组中表现最佳,其中 T-BERT 在小鼠接触行为上的 F1 分数达到 0.786 ± 0.022。
- T-PointNet 在小鼠三联体数据上表现优异(观看行为的 F1 = 0.697 ± 0.006),表明点云建模在多Agent姿态序列中有效。
- PCA 和简单基线在帧级行为任务中表现差(如小鼠“观看”行为的 F1 < 0.17),表明无监督基线无法捕捉局部时间动态。
- 在人类动作数据集(如 TVAE)上预训练的模型在动物行为上迁移能力有限,接触行为的 F1 分数低于 0.15,凸显领域偏移问题。
- 对果蝇类型(如雄性与雌性)的分类任务中,T-Perceiver 达到近乎完美的性能(F1 = 0.990 ± 0.000),表明其在序列级属性学习方面具有强大表征能力。
- 所有模型在罕见行为(如口生殖器接触)上的表现仍然较低,表明需要改进数据效率和局部时间建模能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。