[論文レビュー] Human-Object Interaction Detection via Disentangled Transformer
本稿では、分離型エンコーダーとデコーダーを用いて三つ組み予測を人物-物体ペア検出とインタラクション分類に分離することで、人物-物体-インタラクション(HOI)検出の新規フレームワークである分離型トランスフォーマー(DisTR)を提案する。ベースデコーダーによる統合表現と、注意に基づく統合を用いた粗-細の段階的最適化戦略を採用することで、V-COCOおよびHICO-DETで最先端の性能を達成し、FLOPsとパラメータ数の面でも効率的である。
Human-Object Interaction Detection tackles the problem of joint localization and classification of human object interactions. Existing HOI transformers either adopt a single decoder for triplet prediction, or utilize two parallel decoders to detect individual objects and interactions separately, and compose triplets by a matching process. In contrast, we decouple the triplet prediction into human-object pair detection and interaction classification. Our main motivation is that detecting the human-object instances and classifying interactions accurately needs to learn representations that focus on different regions. To this end, we present Disentangled Transformer, where both encoder and decoder are disentangled to facilitate learning of two sub-tasks. To associate the predictions of disentangled decoders, we first generate a unified representation for HOI triplets with a base decoder, and then utilize it as input feature of each disentangled decoder. Extensive experiments show that our method outperforms prior work on two public HOI benchmarks by a sizeable margin. Code will be available.
研究の動機と目的
- 既存のHOIトランスフォーマーが人物-物体インスタンスとインタラクションの間の共同モデリングに欠けることや、誤分類エラーを引き起こす問題を解決すること。
- 人物-物体ペアとインタラクションのための分離表現を学習することで、HOI検出の精度と解釈可能性を向上させること。
- 物体ペアとインタラクション動詞の予測を分離することで、特にレアなHOIカテゴリにおいてもより良い一般化性能を実現すること。
- 統一された関連付けメカニズムを設計し、ベースデコーダーを介して予測を段階的に最適化するとともに、分離型デコーダー間の情報伝達を促進すること。
提案手法
- エンコーダーとデコーダーが二つのスレッドに分割された分離型トランスフォーマーのアーキテクチャを導入する。一つは人物-物体ペア検出のためのインスタンススレッド、もう一つは動詞分類のためのインタラクションスレッドである。
- ベースデコーダーが最初にすべてのHOI三つ組みの統合表現を生成し、その後、粗-細の段階的最適化により分離型デコーダーを改善する。
- インスタンスデコーダーとインタラクションデコーダー間での情報交換を可能にするため、注意に基づく統合ブロックを導入し、タスク間理解を強化する。
- インスタンスデコーダーを再定義し、個々の物体ではなく直接的にインタラクションを伴う人物-物体ペアを予測することで、誤分類エラーを低減する。
- クロスアテンションを用いたクエリベースのセット予測メカニズムを採用し、各デコーダーが異なる空間領域に注目する。アテンション可視化により、この戦略の有効性が裏付けられている。
- 学習可能なクエリと二部マッチング損失を用いて、エンドツーエンドで学習することで、予測と真値三つ組みの整合性を保証する。
実験結果
リサーチクエスチョン
- RQ1HOI三つ組み予測を人物-物体ペア検出とインタラクション分類に分離することで、検出精度の向上と誤分類エラーの低減が図れるか?
- RQ2エンコーダーとデコーダーの両方を分離させることで、HOI検出における異なるサブタスクのためのより優れた表現学習が達成できるか?
- RQ3統合されたベースデコーダーを用いた粗-細の関連付け戦略により、予測された人物-物体ペアとインタラクション動詞の整合性が向上するか?
- RQ4注意に基づく統合ブロックは、タスク固有の注目を損なわず、分離型デコーダー間の情報伝達を効果的に可能にするか?
- RQ5より優れた分離と表現学習のおかげで、提案手法は、特にレアなHOIカテゴリにおいても一般化性能が向上するか?
主な発見
- V-COCOテストセットにおける新しい最先端のmAPは66.2(シナリオ#1)を達成し、QPIC(58.8)やHOTR(55.2)といった先行手法を大きく上回った。
- HICO-DETベンチマークでは、mAPが47.8を記録し、QPIC(44.0)やHOTR(45.1)といった既存の最先端手法を上回った。
- アブレーションスタディの結果、統合表現を学習可能なクエリ(クエリ分解)に置き換えると、V-COCOで1.3%、HICO-DETで0.66%のmAP低下が生じ、粗-細の関連付け戦略の有効性が裏付けられた。
- クロスアテンションマップの可視化により、インスタンスデコーダーが物体の端縁に注目している一方で、インタラクションデコーダーはインタラクション領域に注目していることが確認され、分離型表現学習の妥当性が検証された。
- モデルは効率的な計算を維持しており、ResNet-50上ではQPICと比較してわずか7%のFLOPs増加にとどまり、精度と効率の良好なトレードオフを実現した。
- 分離型エンコーダーとデコーダーの設計により、タスク固有の注目が可能となり、解釈性が向上するとともに、長尾分布のHOIカテゴリでも性能が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。