Skip to main content
QUICK REVIEW

[論文レビュー] SeqTR: A Simple yet Universal Network for Visual Grounding

Chaoyang Zhu, Yiyi Zhou|arXiv (Cornell University)|Mar 30, 2022
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

本稿では、視覚的グランドイングのためのシンプルで汎用的なTransformerベースのネットワーク、SeqTRを提案する。この手法は、離散座標トークンを用いてバウンディングボックスおよびマスク予測を順序的な点の予測問題に再定式化する。フレーズロケーション、参照表現理解、セグメンテーションを、同一の交差エントロピー損失関数と共有アーキテクチャで統合することで、タスク固有のヘッドや複雑な損失関数を一切用いずに、5つのベンチマークで最先端または競争力のある性能を達成した。

ABSTRACT

In this paper, we propose a simple yet universal network termed SeqTR for visual grounding tasks, e.g., phrase localization, referring expression comprehension (REC) and segmentation (RES). The canonical paradigms for visual grounding often require substantial expertise in designing network architectures and loss functions, making them hard to generalize across tasks. To simplify and unify the modeling, we cast visual grounding as a point prediction problem conditioned on image and text inputs, where either the bounding box or binary mask is represented as a sequence of discrete coordinate tokens. Under this paradigm, visual grounding tasks are unified in our SeqTR network without task-specific branches or heads, e.g., the convolutional mask decoder for RES, which greatly reduces the complexity of multi-task modeling. In addition, SeqTR also shares the same optimization objective for all tasks with a simple cross-entropy loss, further reducing the complexity of deploying hand-crafted loss functions. Experiments on five benchmark datasets demonstrate that the proposed SeqTR outperforms (or is on par with) the existing state-of-the-arts, proving that a simple yet universal approach for visual grounding is indeed feasible. Source code is available at https://github.com/sean-zhuh/SeqTR.

研究の動機と目的

  • タスク固有のアーキテクチャや損失関数を排除することで、視覚的グランドイングのモデリングを簡素化すること。
  • フレーズロケーション、参照表現理解、セグメンテーションを、1つの共有ネットワーク構造で統合すること。
  • 共通の最適化目的関数を用いることで、視覚言語アライメントにおけるマルチタスク学習の複雑さを軽減すること。
  • 最小限のアーキテクチャ的および損失関数の設計を要するエンドツーエンド学習を可能にすること。
  • シンプルで汎用的なアプローチが、視覚的グランドイングにおいて最先端の性能を達成または上回ることを示すこと。

提案手法

  • バウンディングボックスおよびマスク予測を、画像およびテキスト入力から順に座標トークンを自己回帰的に予測する系列予測問題に再定式化する。
  • 標準的なTransformerエンコーダ・デコーダアーキテクチャを用い、画像およびテキスト入力を入力として、座標トークンを逐次予測する。
  • マスクを、時計回りの輪郭サンプリングにより表現することで、ピクセルレベルのセグメンテーションをN個の点の系列に変換する。
  • すべてのタスクにわたって1つの交差エントロピー損失関数を用いることで、タスク固有の損失関数の必要性を排除する。
  • 訓練中に点のシャッフルを適用することで、系列順序に依存しない一般化性能と耐性を向上させる。
  • アーキテクチャの変更なしにマルチタスク学習を可能にし、RECとRESの共同最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1タスク固有のブランンチを一切用いずに、1つのシンプルなアーキテクチャで視覚的グランドイングタスクを統合できるか?
  • RQ2複雑なタスク固有の損失関数に代えて、汎用的な交差エントロピー損失関数が視覚的グランドイングに適しているか?
  • RQ3座標トークン生成による順序的な点の予測が、バウンディングボックスおよびマスクの両方において空間的正確性を保持できるか?
  • RQ4アーキテクチャの特化なしに、1つのモデルがロケーションとセグメンテーションの両方のベンチマークで優れた性能を達成できるか?
  • RQ5点のサンプリング戦略および系列シャッフルが、モデルの一般化性能および性能に与える影響は何か?

主な発見

  • SeqTRは、RefCOCO、RefCOCO+、RefCOCOg、ReferItGame、Flickr30K Entitiesの5つのベンチマークデータセットで、最先端または競争力のある性能を達成した。
  • RefCOCOでは、RECの正確度が80.38%、RESのmIoUが78.03%に達し、mIoUにおいて先行手法を上回りながらも、高いロケーション正確度を維持した。
  • 均一なサンプリングと18点を用いることで、95.57%の上界mIoUを達成し、マスク再構築の高精度を示した。
  • マルチタスク学習は単一タスク学習と比較してわずかに性能を低下させる傾向を示しており、系列ベースの枠組みにおいてRECとRESの予測が独立している可能性を示唆している。
  • 訓練中の点のシャッフルにより収束性と耐性が向上し、RefCOCOおよびRefCOCO+では0.2のシャッフル比が最適な結果をもたらした。
  • SeqTRは、顕著に少ない事前学習コストで、大規模なBERTスタイルのモデルを上回る性能を示し、効率性と有効性を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。