[论文解读] ArtiBoost: Boosting Articulated 3D Hand-Object Pose Estimation via Online Exploration and Synthesis
ArtiBoost 提出了一种在线数据增强框架,通过在组合式手-物体构型与视角(CCV)空间中动态探索并合成多样的手-物体配置,从而提升3D手-物体姿态估计性能。通过迭代采样难以区分的三元组并根据模型损失反馈重新加权,ArtiBoost 增强了训练数据的多样性与模型的泛化能力,在 HO3D 和 DexYCB 基准上即使使用简单的基线网络也实现了最先进性能。
Estimating the articulated 3D hand-object pose from a single RGB image is a highly ambiguous and challenging problem, requiring large-scale datasets that contain diverse hand poses, object types, and camera viewpoints. Most real-world datasets lack these diversities. In contrast, data synthesis can easily ensure those diversities separately. However, constructing both valid and diverse hand-object interactions and efficiently learning from the vast synthetic data is still challenging. To address the above issues, we propose ArtiBoost, a lightweight online data enhancement method. ArtiBoost can cover diverse hand-object poses and camera viewpoints through sampling in a Composited hand-object Configuration and Viewpoint space (CCV-space) and can adaptively enrich the current hard-discernable items by loss-feedback and sample re-weighting. ArtiBoost alternatively performs data exploration and synthesis within a learning pipeline, and those synthetic data are blended into real-world source data for training. We apply ArtiBoost on a simple learning baseline network and witness the performance boost on several hand-object benchmarks. Our models and code are available at https://github.com/lixiny/ArtiBoost.
研究动机与目标
- 为解决真实世界数据集中在可动 3D 手-物体姿态估计(HOPE)任务中因姿态、物体和视角变化不足而导致的多样性有限问题。
- 克服离线数据合成效率低下的问题,通过自适应的在线数据增强,聚焦于难以区分的样本。
- 开发一种与模型无关的方法,通过数据探索与模型学习之间的持续交互,提升 HOPE 性能。
- 证明在结构化 CCV 空间中合成多样且物理上合理的手-物体交互,可显著提升姿态估计精度。
提出的方法
- 该方法引入一个三维离散空间,称为 CCV 空间,由物体类型、手部姿态和相机视角参数化,以系统化表示手-物体交互。
- 基于拟合的抓握合成方法通过强制 MANO 手部顶点与物体表面保持接触约束,在 CCV 空间中生成有效且逼真的手-物体构型。
- ArtiBoost 在探索(从 CCV 空间采样三元组)与合成(从采样视角渲染图像)之间交替进行,将合成数据与真实数据混合用于训练批次。
- 利用 HOPE 模型的损失反馈对采样概率进行重新加权,优先选择后续轮次中难以区分的构型。
- 该框架与模型无关,可与任何基于 CNN 的姿态估计架构集成,包括分类式与回归式模型。
- 由于渲染器不可微,采用基于查表的探索策略,实现在 CCV 空间中高效且可扩展的采样。
实验结果
研究问题
- RQ1在结构化 CCV 空间中进行在线、损失引导的数据探索,能否提升 3D 手-物体姿态估计模型的泛化能力?
- RQ2在 CCV 空间中合成多样且物理上合理的手-物体交互,是否能优于传统离线合成方法?
- RQ3轻量级、与模型无关的数据增强框架是否能在不修改网络架构的前提下超越最先进方法?
- RQ4当结合在线合成数据增强时,减少对真实世界标注数据的依赖,在多大程度上能提升模型性能?
主要发现
- 使用 ArtiBoost 在 CCV 空间中生成的合成数据进行训练的模型,优于使用 YCBAfford 提供的传统合成数据训练的相同模型,证明了 CCV 空间在多样性和有效性方面的优势。
- ArtiBoost 中的在线重加权策略相比离线采样方案,实现了更快的收敛速度与更高的性能,该结果在 DexYCB 基准上得到验证。
- 仅使用原始 HO3D 训练数据的 10% 加上 100% 的 ArtiBoost 合成数据,性能已优于单独使用 100% 真实数据的训练结果。
- 当迁移至相机空间 HOPE 框架(Hasson et al.)时,ArtiBoost 显著提升了所有指标,包括相机空间与腕部相对坐标系下的 MPJPE。
- 即使采用简单的分类式与回归式基线模型,ArtiBoost 仍使 HO3D(v1-v3)与 DexYCB 基准上的性能超越此前最先进结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。