Skip to main content
QUICK REVIEW

[論文レビュー] AVisT: A Benchmark for Visual Object Tracking in Adverse Visibility

Mubashir Noman, Wafa Al Ghallabi|arXiv (Cornell University)|Aug 14, 2022
Video Surveillance and Tracking Methods被引用数 10
ひとこと要約

AVisTは、濃い霧、激しい雨、 camouflage、低照度、小型のターゲットなど5つの属性に分類された18の多様なシナリオにわたる120の挑戦的なシーケンスを含む、悪質な視認性条件下における視覚的オブジェクト追跡のための新しいベンチマークを導入する。ImageNet-22kで事前学習された最新のトランスフォーマーを用いても、最高のトラッカーはわずか56.0%のAUCにとどまり、ベンチマークの難易度の高さと、堅牢で汎用性のある追跡ソリューションの必要性を示している。

ABSTRACT

One of the key factors behind the recent success in visual tracking is the availability of dedicated benchmarks. While being greatly benefiting to the tracking research, existing benchmarks do not pose the same difficulty as before with recent trackers achieving higher performance mainly due to (i) the introduction of more sophisticated transformers-based methods and (ii) the lack of diverse scenarios with adverse visibility such as, severe weather conditions, camouflage and imaging effects. We introduce AVisT, a dedicated benchmark for visual tracking in diverse scenarios with adverse visibility. AVisT comprises 120 challenging sequences with 80k annotated frames, spanning 18 diverse scenarios broadly grouped into five attributes with 42 object categories. The key contribution of AVisT is diverse and challenging scenarios covering severe weather conditions such as, dense fog, heavy rain and sandstorm; obstruction effects including, fire, sun glare and splashing water; adverse imaging effects such as, low-light; target effects including, small targets and distractor objects along with camouflage. We further benchmark 17 popular and recent trackers on AVisT with detailed analysis of their tracking performance across attributes, demonstrating a big room for improvement in performance. We believe that AVisT can greatly benefit the tracking community by complementing the existing benchmarks, in developing new creative tracking solutions in order to continue pushing the boundaries of the state-of-the-art. Our dataset along with the complete tracking performance evaluation is available at: https://github.com/visionml/pytracking

研究の動機と目的

  • 濃い霧、激しい雨、低照度など、現実世界の悪質な視認性条件下における視覚的追跡の包括的でないベンチマークの欠如に対処する。
  • 深刻な天候、遮蔽、camouflage、画像化効果に起因する現実的な追跡失敗を捉える、多様で挑戦的なデータセットを提供する。
  • 複数の属性にわたるSOTAトラッカーの評価を通じて、性能格差を特定し、今後の研究を導く。
  • 現在のベンチマークをはるかに超える現実世界の複雑さを強調することで、視覚的追跡における堅牢性の新たな基準を確立する。

提案手法

  • 18の異なる悪質な視認性シナリオにわたる42のオブジェクトカテゴリをカバーする、8万フレームにわたる高解像度ビデオシーケンスを80kのアノテーション付きフレームでキュレートする。
  • シナリオを5つの属性にグループ化する:天候条件(例:霧、雨、砂嵐)、遮蔽効果(例:火炎、日差し)、画像化効果(例:低照度)、ターゲット効果(例:小型のターゲット、干渉要因)、camouflage。
  • 高精度な人間によるアノテーションによる真値バウンディングボックスを用い、すべてのシーケンスで信頼性の高い評価を保証する。
  • 標準的な指標を用いて、17の最近のトラッカー(シアンプスネットワーク、特徴的分類器、トランスフォーマーに基づくモデルを含む)を全データセット上でベンチマーク化する。
  • AUC(曲線下積分)と正規化精度を用いて性能を評価し、各属性ごとに分析することで、故障モードを同定する。
  • バックボーンモデルをImageNet-1kおよびImageNet-22kで事前学習し、事前学習スケールが悪質な条件下での堅牢性に与える影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1既存のデータセットではカバーされていない現実世界の悪質な視認性条件下(例:濃い霧、激しい雨、低照度)を強調するベンチマークにおいて、最新の視覚的追跡アルゴリズムはどの程度の性能を示すか?
  • RQ2ImageNet-22kで事前学習した場合、ImageNet-1kと比較して、多様な悪質な視認性属性にわたる追跡の堅牢性はどの程度向上するか?
  • RQ3特定の属性(例:天候、camouflage、低照度)が現在の追跡モデルにとって最大の挑戦となるのはどの程度か?
  • RQ4異なる追跡パラダイム(シアンプス、特徴的分類器、トランスフォーマー)において、悪質な視認性条件下で一貫した性能格差が生じるか?
  • RQ5属性ごとの分析により、特定の視認性劣化に起因する、現在の追跡アーキテクチャにおける体系的な弱みが明らかになるか?

主な発見

  • AVisTで最高のパフォーマンスを示したトラッカー、MixFormerL-22kは、AUCが56.0%にとどまり、LaSOT(70.1%)やTrackingNet(83.9%)といった既存のベンチマークと比較して顕著に低い。これはAVisTの高い難易度を裏付けている。
  • ImageNet-22kで事前学習されたトランスフォーマーに基づくモデル(例:MixFormerL-22k)は、ImageNet-1kで事前学習されたモデルを上回るが、特に天候条件や画像化効果において顕著な向上が見られる。ただし、属性ごとに向上幅は異なる。
  • すべての属性で他のすべてのトラッカーを上回るトラッカーは存在しない。例えば、ToMP-101はバックボーンが小さいにもかかわらず、画像化効果においてMixFormerL-22kと同等の性能を示している。
  • シアンプストラッカー(例:SiamRPN++)はAUCスコアが約38–39にとどまる一方、特徴的分類器(例:KeepTrack)は約49.4に達する。これはアーキテクチャ選択が堅牢性に顕著な影響を与えることを示している。
  • ImageNet-22kでの事前学習による性能向上は、属性ごとに一貫しない。天候条件や画像化効果では顕著な向上が見られるが、遮蔽効果では最小限の向上にとどまる。
  • 属性別分析により、現在のトラッカーがcamouflage、小型のターゲット、複雑な天候条件において最も困難に直面していることが明らかになった。これは、一般化能力と堅牢性における深刻なギャップを露呈している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。