Skip to main content
QUICK REVIEW

[论文解读] Hand-Object Interaction Image Generation

Hezhen Hu, Weilun Wang|arXiv (Cornell University)|Nov 28, 2022
Multimodal Machine Learning Applications被引用 5
一句话总结

本文提出了手-物体交互图像生成(HOIG)这一新任务,该任务基于手部和物体的身份、姿态及交互状态进行图像合成。所提出的HOGAN框架利用模型感知的手-物体表示构建统一的表面空间,显式建模自遮挡与相互遮挡,并通过拆分-合并策略生成图像,在HO3Dv3和DexYCB数据集上均实现了最先进的保真度与结构准确性。

ABSTRACT

In this work, we are dedicated to a new task, i.e., hand-object interaction image generation, which aims to conditionally generate the hand-object image under the given hand, object and their interaction status. This task is challenging and research-worthy in many potential application scenarios, such as AR/VR games and online shopping, etc. To address this problem, we propose a novel HOGAN framework, which utilizes the expressive model-aware hand-object representation and leverages its inherent topology to build the unified surface space. In this space, we explicitly consider the complex self- and mutual occlusion during interaction. During final image synthesis, we consider different characteristics of hand and object and generate the target image in a split-and-combine manner. For evaluation, we build a comprehensive protocol to access both the fidelity and structure preservation of the generated image. Extensive experiments on two large-scale datasets, i.e., HO3Dv3 and DexYCB, demonstrate the effectiveness and superiority of our framework both quantitatively and qualitatively. The project page is available at https://play-with-hoi-generation.github.io/.

研究动机与目标

  • 建立并研究手-物体交互图像生成(HOIG)这一新任务,该任务基于手部、物体及其交互状态进行图像合成。
  • 解决在图像合成过程中,交互手部与物体之间复杂的自遮挡与相互遮挡问题。
  • 保持生成的手-物体图像在外观保真度与结构准确性(如姿态与形状)方面的完整性。
  • 开发一种统一的表示与合成流程,以考虑手部与物体在外观特征上的显著差异。
  • 通过定量指标与用户研究对所提方法进行全面评估。

提出的方法

  • HOGAN使用模型感知的手-物体网格表示构建统一的表面空间,以编码拓扑关系与空间关系。
  • 通过可见性图与拓扑感知变换,显式建模手部的自遮挡以及手部与物体之间的相互遮挡。
  • 框架计算源姿态与目标姿态之间的光流场,以指导图像合成,同时保持身份与结构一致性。
  • 图像合成采用拆分-合并方式:基于其独特的外观特征分别生成手部与物体,随后进行融合。
  • 该方法采用基于条件GAN的生成器,结合对抗性损失与感知损失组件,以实现高保真度结果。
  • 全面的评估协议包括FID、LPIPS、AUC、PA-MPJPE、ADD-0.1D与用户研究,用于评估保真度与结构保持能力。

实验结果

研究问题

  • RQ1条件图像生成框架能否在给定姿态下有效合成逼真的手-物体交互图像,同时保持源图像的外观特征?
  • RQ2在图像合成过程中,如何显式建模交互手部与物体之间复杂的自遮挡与相互遮挡?
  • RQ3基于手部与物体在视觉与结构属性上的差异,将二者分离生成的策略会产生何种影响?
  • RQ4所提方法在真实世界数据集上,于图像保真度与结构准确性方面,相较于基线方法的优越程度如何?
  • RQ5生成的图像能否有效用于数据增强,以提升下游手-物体姿态估计模型的性能?

主要发现

  • HOGAN在HO3Dv3与DexYCB两个数据集上均达到最先进性能,在FID、LPIPS、AUC、PA-MPJPE与ADD-0.1D指标上超越基线方法。
  • 在HO3Dv3数据集上,经合成数据微调后,HOGAN的AUC达到78.0,ADD-0.1D达到76.8,显著优于基线方法。
  • 框架成功保留了物体的纹理细节,如在物体上编辑文字(如姓名)后仍能生成外观逼真的图像。
  • 当应用于真实手部图像时,HOGAN保持了源手部身份,并准确生成目标姿态,如定性结果所示。
  • 由HOGAN生成的合成数据显著提升了最先进HOPE模型的性能,证明其在数据增强方面的有效性。
  • 用户研究表明,HOGAN生成的图像在真实感与结构准确性方面均优于基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。