[论文解读] Evaluation of deep lift pose models for 3D rodent pose estimation based on geometrically triangulated data
本文提出了一种使用多相机设置中通过几何三角测量获得的2D关键点数据训练的深度提升模型,实现鲁棒的3D啮齿动物姿态估计方法。结果表明,时序卷积网络在将单视角2D姿态提升为3D时优于线性残差网络,在最优2.7秒时序窗口下达到0.45±0.003的测试损失,实现了复杂行为实验中可靠的3D姿态推断。
The assessment of laboratory animal behavior is of central interest in modern neuroscience research. Behavior is typically studied in terms of pose changes, which are ideally captured in three dimensions. This requires triangulation over a multi-camera system which view the animal from different angles. However, this is challenging in realistic laboratory setups due to occlusions and other technical constrains. Here we propose the usage of lift-pose models that allow for robust 3D pose estimation of freely moving rodents from a single view camera view. To obtain high-quality training data for the pose-lifting, we first perform geometric calibration in a camera setup involving bottom as well as side views of the behaving animal. We then evaluate the performance of two previously proposed model architectures under given inference perspectives and conclude that reliable 3D pose inference can be obtained using temporal convolutions. With this work we would like to contribute to a more robust and diverse behavior tracking of freely moving rodents for a wide range of experiments and setups in the neuroscience community.
研究动机与目标
- 在多相机三角测量因遮挡和技术限制而受阻的复杂实验室环境中,实现对自由活动啮齿动物的鲁棒3D姿态估计。
- 开发一种可靠的几何标定程序,利用正交俯视和侧视相机生成高质量的3D训练数据,基于2D关键点检测结果。
- 评估两种深度提升姿态模型——线性残差网络与空洞时序卷积网络——在从单视角输入进行啮齿动物姿态提升任务中的性能。
- 确定在啮齿动物行为研究中实现准确3D姿态重建的最优推理视角和时序窗口设置。
提出的方法
- 使用一个俯视相机和四个侧视相机组成的多相机系统,以50 Hz的采样率记录60分钟自由活动小鼠的行为。
- 采用基于ResNet的DeepLabCut模型对2D关键点进行检测,该模型在1,000张标注图像上进行训练,并通过数据增强提升泛化能力。
- 通过检查棋盘靶标进行几何标定,建立投影矩阵,利用侧视图投影的深度多项式拟合实现3D坐标的三角测量。
- 将三角测量得到的3D数据用于训练两种深度提升姿态模型:线性残差网络与空洞时序卷积残差网络。
- 在模型评估中,数据在10组随机划分的训练/测试集(80%/20%)中进行洗牌,训练过程持续150个周期,采用早停法和衰减学习率策略。
- 对时序卷积模型在不同时间窗口大小(15至243个时间步)下进行评估,以确定3D姿态预测的最优上下文长度。
实验结果
研究问题
- RQ1在存在遮挡和相机可视范围有限的情况下,几何标定的多相机系统是否能够生成可靠用于自由活动啮齿动物的3D姿态数据?
- RQ2在啮齿动物行为研究中,对于从单视角2D检测进行3D姿态提升任务,线性残差网络与时序卷积网络中哪一种模型表现更优?
- RQ3时序卷积模型在最小化3D姿态估计误差方面,最优的时间窗口大小是多少?
- RQ4视图视角(如俯视、侧视、旋转视角)如何影响深度提升模型在3D姿态估计中的性能?
- RQ5模型能否在不同身体部位投影中实现泛化,尤其是在对称或模糊视角下?
主要发现
- 时序卷积模型在(x,y)→z预测任务中达到0.45±0.003的测试损失,显著优于线性残差模型的1.47±0.031测试损失。
- 时序卷积模型的最优时间窗口大小为135个时间步(2.7秒),在所有设置中均实现最低测试损失。
- 在x轴旋转45°的(x,z)→y预测方向上,两种模型均取得最低测试损失,表明在对角视角下性能更优。
- 两种模型对俯视图的(x,y)→z预测估计最准确,表明俯视2D数据为深度估计提供了强有力的先验信息。
- 时序卷积模型在所有视角下均表现出更优的泛化能力和鲁棒性,其测试损失方差低于线性模型。
- 最优时间窗口(2.7秒)超过了姿态自相关性的500毫秒衰减时间,表明更长范围的时间依赖关系可提升3D姿态预测的准确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。