Skip to main content
QUICK REVIEW

[論文レビュー] 2rd Place Solutions in the HC-STVG track of Person in Context Challenge 2021

Yi-Yu, XinyingWang|arXiv (Cornell University)|Jun 14, 2021
Human Pose and Action Recognition参考文献 7被引用数 6
ひとこと要約

本論文は、2021年Person in Context ChallengeのHC-STVGトラックで2位となったソリューションを提示しており、vIoUが0.30025に達した。この手法はYOLOv5とFastReIDを組み合わせて人物検出と再識別を実行し、自然言語処理(NLP)を用いて外見的特徴(性別、服の色、種別)を抽出し、空間的・時間的局所化のためのクロスモーダル変換器とマルチタスク学習を採用している。これには性別分類ブランチと補助的なチューブトリミング損失が含まれる。

ABSTRACT

In this technical report, we present our solution to localize a spatio-temporal person in an untrimmed video based on a sentence. We achieve the second vIOU(0.30025) in the HC-STVG track of the 3rd Person in Context(PIC) Challenge. Our solution contains three parts: 1) human attributes information is extracted from the sentence, it is helpful to filter out tube proposals in the testing phase and supervise our classifier to learn appearance information in the training phase. 2) we detect humans with YoloV5 and track humans based on the DeepSort framework but replace the original ReID network with FastReID. 3) a visual transformer is used to extract cross-modal representations for localizing a spatio-temporal tube of the target person.

研究の動機と目的

  • 自然言語記述から得られる詳細な人物の外見的特徴を活用することで、未編集動画における空間的・時間的動画グランドイングの精度を向上させること。
  • チューブ文マッチングにおけるクラス不均衡と過学習を、ファーカル損失と言語エンコーダーの固定によって是正すること。
  • 外見的キューを用いた監視による視覚的特徴学習を向上させることを目的に、性別分類ブランチを導入すること。
  • 分類、回帰、トリミングを統合するマルチタスククロスモーダル変換器を用いて、高い局所化精度を達成すること。

提案手法

  • 正規表現一致、キーワード抽出、文法解析を含むNLP技術を用いて、テキスト記述から人物の外見的特徴(性別、服の色、種別)を抽出する。
  • PySceneDetectを用いてシーン境界で動画をクリップに分割し、YOLOv5による検出とDeepSortによるトラッキングによりチューブ候補を生成する。この際、元のReIDネットワークの代わりにFastReIDを採用する。
  • 視覚と言語のための別々のモodalエンコーダーと、チューブ候補と文クエリをアライメントするためのクロスアテンション機構を備えたクロスモーダル変換器を適用する。
  • 視覚エンコーダー出力に性別分類ブランチを導入し、外見的特徴に基づく表現学習を監視する。
  • ファーカル損失(グローバルマッチング)、交差エントロピー損失(性別およびフレーム分類)、IoU損失(フレーム回帰)を組み合わせたマルチタスク損失を用い、チューブトリミングを補助タスクとして設定する。
  • テスト段階では、チューブトラックにガウススムージングを適用し、低品質または重複する候補をフィルタリングする。

実験結果

リサーチクエスチョン

  • RQ1自然言語から抽出した人物の外見的特徴は、未編集動画における空間的・時間的グランドイングの精度をどのように向上させるか?
  • RQ2FastReIDをReIDバックボーンに置き換えることで、HC-STVG設定におけるチューブトラッキング性能はどの程度向上するか?
  • RQ3性別およびフレームレベル分類を含むマルチタスク学習フレームワークは、標準的な分類のみのモデルと比較して、局所化精度を向上させるか?
  • RQ4ファーカル損失と言語エンコーダーの固定は、チューブ文マッチングにおけるクラス不均衡と過学習をどの程度緩和するか?
  • RQ5推論段階で使用されないにもかかわらず、補助的なチューブトリミングブランチを含めることで、最終的なvIoUにどのような影響を与えるか?

主な発見

  • アブレーションスタディの結果、ファーカル損失、言語エンコーダーの固定、性別分類損失を組み合わせることで、vIoUがベースラインの0.2775から0.30025に向上し、2位を達成した。
  • 性別分類ブランチの追加により、モデル性能が顕著に向上した。これは、ベースラインモデルが外見的キューを十分に活用していないことを示している。
  • ファーカル損失は、ポジティブとネガティブなチューブ文ペair間の深刻なクラス不均衡を効果的に緩和した。
  • 訓練中に言語エンコーダーを固定することで、性能に悪影響を及げることなく、過学習を低減し汎化性能を向上させた。
  • 推論段階で使用されないにもかかわらず、補助タスクとして訓練されたチューブトリミングブランチは、グローバル分類精度を向上させた。
  • 最終モデルはvIoUが0.30025に達し、HC-STVGベンチマークにおいて優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。