[论文解读] Detailed 2D-3D Joint Representation for Human-Object Interaction
该论文提出了一种新颖的2D-3D联合表征学习框架DJ-RN,用于人体-物体交互(HOI)检测,通过单视角重建和透视投影技术,利用详细的3D人体形状(面部和手部)以及估计的3D物体位置。通过在2D与3D特征之间引入跨模态一致性任务进行融合,该方法在HICO-DET和一个新的模糊性基准Ambiguous-HOI上均取得了当前最优性能,mAP分别为21.34和10.37。
Human-Object Interaction (HOI) detection lies at the core of action understanding. Besides 2D information such as human/object appearance and locations, 3D pose is also usually utilized in HOI learning since its view-independence. However, rough 3D body joints just carry sparse body information and are not sufficient to understand complex interactions. Thus, we need detailed 3D body shape to go further. Meanwhile, the interacted object in 3D is also not fully studied in HOI learning. In light of these, we propose a detailed 2D-3D joint representation learning method. First, we utilize the single-view human body capture method to obtain detailed 3D body, face and hand shapes. Next, we estimate the 3D object location and size with reference to the 2D human-object spatial configuration and object category priors. Finally, a joint learning framework and cross-modal consistency tasks are proposed to learn the joint HOI representation. To better evaluate the 2D ambiguity processing capacity of models, we propose a new benchmark named Ambiguous-HOI consisting of hard ambiguous images. Extensive experiments in large-scale HOI benchmark and Ambiguous-HOI show impressive effectiveness of our method. Code and data are available at https://github.com/DirtyHarryLYL/DJ-RN.
研究动机与目标
- 解决基于2D的HOI检测所面临的局限性,即由于2D姿态和外观线索稀疏而导致的视角模糊问题。
- 通过引入详细的3D人体形状(面部和手部)以克服粗粒度3D关节表征的不足,实现更丰富的几何与语义理解。
- 通过利用2D空间配置和类别先验,估计交互物体的位置与尺寸,构建其3D表征。
- 设计一种联合2D-3D学习框架,通过强制跨模态一致性来提升消歧能力和鲁棒性。
- 提出一个新的基准Ambiguous-HOI,以严格评估模型在2D视角模糊场景下解决HOI检测歧义的能力。
提出的方法
- 利用单视角人体捕获技术(如SMPLify-X)重建包含面部与手部几何结构的详细3D人体形状。
- 通过2D人体-物体空间关系和物体类别先验,估计3D物体的位置与尺寸,并在归一化3D空间中以中空球体形式表示。
- 通过在共享3D空间中放置3D人体与物体表征,构建3D HOI空间配置体积。
- 设计双流网络(DJ-RN),包含2D-RN与3D-RN,分别从RGB图像和3D体积中提取模态特异性特征。
- 通过三项任务强制实现跨模态一致性:由3D空间特征引导的2D特征对齐、2D与3D特征之间的语义对齐,以及对身体部位的联合注意力学习。
- 采用多任务学习策略,损失函数包括:$γ_{att}$用于注意力一致性,$γ_{tri}$用于三元组对比学习,$γ_{sem}$用于语义一致性。
实验结果
研究问题
- RQ1与粗粒度3D关节表征相比,详细的3D人体表征(面部与手部)是否能显著提升HOI检测性能?
- RQ2仅从单视角2D线索与类别先验出发,3D物体估计在多大程度上能增强HOI理解?
- RQ3通过跨模态一致性实现的联合2D-3D表征学习,在视角模糊图像中能多大程度上提升消歧能力?
- RQ4像Ambiguous-HOI这样的新基准能否有效评估并区分模型对2D歧义的鲁棒性?
- RQ5所提出的联合学习框架是否比独立的2D或3D模型在罕见及长尾HOI类别上具有更好的泛化能力?
主要发现
- DJ-RN在HICO-DET Default Full数据集上达到21.34 mAP,相比之前SOTA方法提升1.94 mAP。
- 在所提出的Ambiguous-HOI基准上,DJ-RN达到10.37 mAP,领先于次优方法(Julia et al.)0.65 mAP。
- 仅3D-RN组件在HICO-DET上达到12.41 mAP,且在罕见类别上表现更强(18.53 mAP),优于非罕见类别(22.18 mAP),表明其对数据依赖性更低。
- 消融实验表明,移除手部与面部细节分别导致性能下降0.51和0.32 mAP,证实其在手部相关动作中的关键作用。
- 联合学习框架在全部一致性损失($\mathcal{L}_{att}$, $\mathcal{L}_{tri}$, $\mathcal{L}_{sem}$)下达到21.34 mAP;若任一损失被移除,性能下降0.5–0.6 mAP。
- 可视化结果表明,2D与3D注意力图对齐良好,并聚焦于语义相关的身体部位(如‘cut’动作聚焦于手部,‘talk’动作聚焦于面部),验证了一致性学习的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。