QUICK REVIEW
[论文解读] Large Area 3D Human Pose Detection Via Stereo Reconstruction in Panoramic Cameras
Christoph Heindl, Thomas Pönitz|arXiv (Cornell University)|Jul 1, 2019
Human Pose and Action Recognition参考文献 42被引用 5
一句话总结
本文提出一种基于双全景鱼眼相机的大范围3D人体姿态估计系统,利用直线视图变换技术,使标准2D深度学习姿态估计算法无需微调即可应用。系统在6×6米区域内实现2–3厘米的3D姿态重建精度,支持低硬件与校准开销的鲁棒人体工程学分析。
ABSTRACT
We propose a novel 3D human pose detector using two panoramic cameras. We show that transforming fisheye perspectives to rectilinear views allows a direct application of two-dimensional deep-learning pose estimation methods, without the explicit need for a costly re-training step to compensate for fisheye image distortions. By utilizing panoramic cameras, our method is capable of accurately estimating human poses over a large field of view. This renders our method suitable for ergonomic analyses and other pose based assessments.
研究动机与目标
- 解决使用广角鱼眼镜头在大视场范围内实现精确3D人体姿态估计的挑战。
- 克服标准2D姿态估计算法因非针孔相机模型导致的鱼眼镜头畸变不兼容问题。
- 实现在无需为鱼眼畸变重新训练深度学习模型的前提下,实现大规模3D姿态检测。
- 在存在遮挡与复杂相机配置的实际环境中,验证方法的鲁棒性与精度。
- 通过最少的相机硬件,支持在广阔工作空间中进行人体工程学与生物力学评估。
提出的方法
- 利用校准的投影模型将原始鱼眼图像转换为直线视图,将畸变图像点映射至无畸变坐标。
- 在校正后的视图上应用预训练的2D卷积神经网络(基于COCO)进行关节点检测,避免为鱼眼畸变重新训练模型。
- 通过两台处于一般位置的相机的立体约束,利用三角测量法重建3D关节位置。
- 采用迭代校准方法估计内参与外参,最小化场景中各点的重投影误差。
- 将鱼眼视场划分为同心环区域(中心、外圈、边缘),以分析空间误差分布并验证几何精度。
- 通过迭代优化提升姿态估计精度,结合3D关节一致性与已知肢体长度约束。
实验结果
研究问题
- RQ1从鱼眼图像生成直线视图是否能够实现标准2D深度学习姿态估计算法的直接应用,而无需重新训练?
- RQ2在6×6米的大范围内,使用双鱼眼相机进行3D姿态重建可达到何种精度?
- RQ3图像畸变与镜头边缘效应如何影响3D姿态估计精度?是否可实现定量缓解?
- RQ4在遮挡与动态运动条件下,两台一般位置的鱼眼相机是否能实现鲁棒的立体重建?
- RQ5与传统多相机系统相比,所提方法在硬件与校准复杂度方面降低了多少?
主要发现
- 系统在6×6米区域内实现2–3厘米的3D姿态重建精度,1.5米目标长度的测量误差分别为:中心区域1.49±0.01米,外圈区域1.52±0.018米,边缘区域1.56±0.035米。
- 从鱼眼图像生成直线视图可直接应用预训练的2D姿态估计算法,无需重新训练,显著降低开发成本。
- 3D肢体长度统计在15分钟视频(10,800帧)内保持稳定,微小波动源于立体设置的不精确性与2D检测噪声。
- 面部特征因可见性限制,其重建频率低于身体其他大部件,重建频率因肢体而异(见图9)。
- 性能计时显示,2D检测占主导计算时间,分辨率为640×640时耗时1.80±0.05秒,而直线视图生成与3D重建均在100毫秒以内。
- 系统在存在障碍物与遮挡的复杂大空间环境中,具备实现人体工程学分析的可行性,能保持一致的3D姿态估计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。