[论文解读] Improving Human-Object Interaction Detection via Phrase Learning and Label Composition
本文提出 PhraseHOI,一种多任务框架,通过联合训练 HOI 分支和一种新颖的关系短语学习分支,利用语言先验知识提升人类-物体交互(HOI)检测性能。通过结合 word2vec 嵌入和基于语义邻居的标签组合方法,PhraseHOI 解决了 HOI 中的长尾分布问题,在 HICO-DET 上实现了最先进性能,Full 和 NonRare 分支的平均精度(AP)分别达到 29.29% 和 31.46%。
Human-Object Interaction (HOI) detection is a fundamental task in high-level human-centric scene understanding. We propose PhraseHOI, containing a HOI branch and a novel phrase branch, to leverage language prior and improve relation expression. Specifically, the phrase branch is supervised by semantic embeddings, whose ground truths are automatically converted from the original HOI annotations without extra human efforts. Meanwhile, a novel label composition method is proposed to deal with the long-tailed problem in HOI, which composites novel phrase labels by semantic neighbors. Further, to optimize the phrase branch, a loss composed of a distilling loss and a balanced triplet loss is proposed. Extensive experiments are conducted to prove the effectiveness of the proposed PhraseHOI, which achieves significant improvement over the baseline and surpasses previous state-of-the-art methods on Full and NonRare on the challenging HICO-DET benchmark.
研究动机与目标
- 通过引入新颖的关系短语学习任务,利用语言先验知识提升人类-物体交互检测性能。
- 通过在标签空间中利用语义邻居组合新标签,缓解 HOI 数据集中长尾分布问题。
- 通过多任务架构联合优化 HOI 检测与短语学习,提升特征判别能力与泛化性能。
- 证明来自语言嵌入的知识蒸馏可提升 HOI 性能,且无需额外标注数据。
提出的方法
- 提出一种关系短语学习任务,自动生成描述人类-物体交互的自然语言短语,其真实标签由现有 HOI 标注自动推导得出。
- 设计一种多任务网络 PhraseHOI,采用共享的 Transformer 主干网络,并行包含两个分支:一个用于 HOI 检测,另一个用于短语嵌入预测。
- 使用查表法(LUT)将学习到的短语嵌入解码为自然语言短语。
- 引入蒸馏损失,将预测的短语嵌入与预训练的 word2vec 嵌入对齐,以保留全局语义结构。
- 应用平衡三元组损失,增强语义相似但不同的短语之间的局部判别能力。
- 提出一种标签组合方法,通过将动词或对象替换为其语义邻居,生成新的 HOI 标签,有效扩展稀有类别在标签空间中的分布。
实验结果
研究问题
- RQ1能否通过多任务学习,利用从现有 HOI 标注中衍生出的关系短语学习,提升 HOI 检测性能?
- RQ2如何有效将预训练词嵌入中的语言先验知识蒸馏到 HOI 检测流程中?
- RQ3基于语义邻居的标签组合能否缓解 HOI 数据集中的长尾分布问题?
- RQ4HOI 与短语学习的联合优化是否能带来更好的泛化能力与零样本推理能力?
主要发现
- PhraseHOI 在 HICO-DET 基准的 Full 分支上达到 29.29% 的平均精度(AP),NonRare 分支上达到 31.46%,创下新的最先进水平。
- 消融实验表明,同时使用蒸馏损失与三元组损失的短语分支,在 Full 分支上带来 1.19% 的 AP 提升,在 Rare 分支上提升 3.39%,验证了损失设计的有效性。
- 拼接嵌入方法优于语言模型编码的嵌入,分别取得 29.29% AP 与 22.64% AP,归因于嵌入空间中更强的判别能力。
- 将 word2vec 嵌入替换为随机嵌入后,性能下降至 21.90% AP,证实语言先验知识(而不仅仅是连续编码)是性能提升的关键。
- 标签组合方法显著提升了稀有类别性能,在三元组损失中使用 m=0.50 时,Rare 分支的 AP 提升 3.39%。
- 短语分支实现了来自语言空间的知识蒸馏,即使在推理阶段不使用该分支,也能提升 HOI 分支的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。