[论文解读] Hand-Object Interaction Image Generation
本文提出了手-物体交互图像生成(HOIG)这一新任务,该任务基于手部和物体的身份、姿态及交互状态进行图像合成。所提出的HOGAN框架利用模型感知的手-物体表示构建统一的表面空间,显式建模自遮挡与相互遮挡,并通过拆分-合并策略生成图像,在HO3Dv3和DexYCB数据集上均实现了最先进的保真度与结构准确性。
In this work, we are dedicated to a new task, i.e., hand-object interaction image generation, which aims to conditionally generate the hand-object image under the given hand, object and their interaction status. This task is challenging and research-worthy in many potential application scenarios, such as AR/VR games and online shopping, etc. To address this problem, we propose a novel HOGAN framework, which utilizes the expressive model-aware hand-object representation and leverages its inherent topology to build the unified surface space. In this space, we explicitly consider the complex self- and mutual occlusion during interaction. During final image synthesis, we consider different characteristics of hand and object and generate the target image in a split-and-combine manner. For evaluation, we build a comprehensive protocol to access both the fidelity and structure preservation of the generated image. Extensive experiments on two large-scale datasets, i.e., HO3Dv3 and DexYCB, demonstrate the effectiveness and superiority of our framework both quantitatively and qualitatively. The project page is available at https://play-with-hoi-generation.github.io/.
研究动机与目标
- 建立并研究手-物体交互图像生成(HOIG)这一新任务,该任务基于手部、物体及其交互状态进行图像合成。
- 解决在图像合成过程中,交互手部与物体之间复杂的自遮挡与相互遮挡问题。
- 保持生成的手-物体图像在外观保真度与结构准确性(如姿态与形状)方面的完整性。
- 开发一种统一的表示与合成流程,以考虑手部与物体在外观特征上的显著差异。
- 通过定量指标与用户研究对所提方法进行全面评估。
提出的方法
- HOGAN使用模型感知的手-物体网格表示构建统一的表面空间,以编码拓扑关系与空间关系。
- 通过可见性图与拓扑感知变换,显式建模手部的自遮挡以及手部与物体之间的相互遮挡。
- 框架计算源姿态与目标姿态之间的光流场,以指导图像合成,同时保持身份与结构一致性。
- 图像合成采用拆分-合并方式:基于其独特的外观特征分别生成手部与物体,随后进行融合。
- 该方法采用基于条件GAN的生成器,结合对抗性损失与感知损失组件,以实现高保真度结果。
- 全面的评估协议包括FID、LPIPS、AUC、PA-MPJPE、ADD-0.1D与用户研究,用于评估保真度与结构保持能力。
实验结果
研究问题
- RQ1条件图像生成框架能否在给定姿态下有效合成逼真的手-物体交互图像,同时保持源图像的外观特征?
- RQ2在图像合成过程中,如何显式建模交互手部与物体之间复杂的自遮挡与相互遮挡?
- RQ3基于手部与物体在视觉与结构属性上的差异,将二者分离生成的策略会产生何种影响?
- RQ4所提方法在真实世界数据集上,于图像保真度与结构准确性方面,相较于基线方法的优越程度如何?
- RQ5生成的图像能否有效用于数据增强,以提升下游手-物体姿态估计模型的性能?
主要发现
- HOGAN在HO3Dv3与DexYCB两个数据集上均达到最先进性能,在FID、LPIPS、AUC、PA-MPJPE与ADD-0.1D指标上超越基线方法。
- 在HO3Dv3数据集上,经合成数据微调后,HOGAN的AUC达到78.0,ADD-0.1D达到76.8,显著优于基线方法。
- 框架成功保留了物体的纹理细节,如在物体上编辑文字(如姓名)后仍能生成外观逼真的图像。
- 当应用于真实手部图像时,HOGAN保持了源手部身份,并准确生成目标姿态,如定性结果所示。
- 由HOGAN生成的合成数据显著提升了最先进HOPE模型的性能,证明其在数据增强方面的有效性。
- 用户研究表明,HOGAN生成的图像在真实感与结构准确性方面均优于基线方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。