[論文レビュー] Visual Transformer for Task-aware Active Learning
本論文は、ラベルありとラベルなしのサンプル間の非局所的依存関係をモデル化するため、アクティブラーニングに視覚変換器(VT)を統合した、新しいタスクに適応した共同学習フレームワークを提案する。ラベルあり対ラベルなしの識別器とタスク固有の損失を用いて、学習者とサンプラーを同時に訓練することで、画像分類およびオブジェクト検出のベンチマークにおいて、先行手法と顕著な差をつけて最先端の性能を達成した。
Pool-based sampling in active learning (AL) represents a key framework for an-notating informative data when dealing with deep learning models. In this paper, we present a novel pipeline for pool-based Active Learning. Unlike most previous works, our method exploits accessible unlabelled examples during training to estimate their co-relation with the labelled examples. Another contribution of this paper is to adapt Visual Transformer as a sampler in the AL pipeline. Visual Transformer models non-local visual concept dependency between labelled and unlabelled examples, which is crucial to identifying the influencing unlabelled examples. Also, compared to existing methods where the learner and the sampler are trained in a multi-stage manner, we propose to train them in a task-aware jointly manner which enables transforming the latent space into two separate tasks: one that classifies the labelled examples; the other that distinguishes the labelling direction. We evaluated our work on four different challenging benchmarks of classification and detection tasks viz. CIFAR10, CIFAR100,FashionMNIST, RaFD, and Pascal VOC 2007. Our extensive empirical and qualitative evaluations demonstrate the superiority of our method compared to the existing methods. Code available: https://github.com/razvancaramalau/Visual-Transformer-for-Task-aware-Active-Learning
研究の動機と目的
- 初期学習段階においてラベルなしデータを活用することで、アクティブラーニングにおけるコールドスタート問題を解決すること。
- プールベースのアクティブラーニングにおけるサンプル選択を改善するため、ラベルありとラベルなしのサンプル間の非局所的視覚的依存関係をモデル化すること。
- 下流タスクの性能と情報量の多いサンプル選択の両方を同時に最適化する共同学習フレームワークを開発すること。
- 視覚変換器を初めてアクティブラーニングに適応させ、局所的特徴を超えた長距離の視覚的コンセプトモデリングを可能にすること。
- 分類およびオブジェクト検出タスクの両方において、実データおよび合成データを含む多様なベンチマークへの一般化を示すこと。
提案手法
- バッチ内のラベルありおよびラベルなしのサンプル間の非局所的相互作用をモデル化するため、畳み込み特徴抽出器と最終分類器の間に視覚変換器(VT)モジュールを統合する。
- 下流タスクの損失(分類の場合は交差エントロピー、検出の場合はSSD損失)と、ラベルあり対ラベルなしの識別器損失の両方を最小化する共同学習の目的関数を用いる。
- ラベルありおよびラベルなしのサンプルの各特徴表現を、VTの入力として独立したトークンとして扱い、バッチ全体にわたるクロスサンプル注意を可能にする。
- VTで処理された特徴空間における不確実性推定を用いて、視覚的に特徴的で情報量の多いラベルなしサンプルの選択を支援する。
- オブジェクト検出タスクへの適応のため、VTのボトルネックをSSDの信頼度ヘッドに配置し、タスク固有の目的関数としてSSD損失を用いる。
- 拡張された実データ(RaFD)および合成データ(StarGAN生成)の顔の感情表現データを用いた、合成データのサブサンプリングへの拡張を実施。
実験結果
リサーチクエスチョン
- RQ1視覚変換器は、ラベルありとラベルなしのサンプル間の非局所的視覚的依存関係を効果的にモデル化でき、アクティブラーニングの性能向上に寄与するか?
- RQ2共通の目的関数を用いて学習者とサンプラーを共同で訓練することで、段階的訓練に比べ、より優れたサンプル選択とモデルの一般化性能が得られるか?
- RQ3本手法は、画像分類およびオブジェクト検出タスクの両方において、多様なベンチマークでどのように性能を発揮するか?
- RQ4本手法は合成データのサブサンプリングにも一般化可能であり、このような環境でも既存のアプローチを上回る性能を示すか?
- RQ5バッチサイズやVTの深さといったアーキテクチャの選択が、フレームワークのスケーラビリティおよび性能に与える影響は何か?
主な発見
- 本手法であるTJLS(視覚変換器を用いたタスクに適応した共同学習)は、CIFAR10、CIFAR100、FashionMNIST、RaFD、Pascal VOC 2007で最先端の性能を達成した。
- Pascal VOC 2007オブジェクト検出タスクでは、7回の選択段階を経て76%を超えるmAPを達成し、Learning Loss や CDAL といった先行SOTA手法を上回った。
- StarGANで生成された合成顔の感情表現データからのサブサンプリングにおいて、既存のベースラインを顕著に上回り、合成データ拡張への強い一般化能力を示した。
- VTベースのサンプラーを備えた共同学習フレームワークは、データが限られる状況でも、ベースライン手法と比較して初期段階での性能飽和を著しく軽減した。
- 本手法は、データが限られる状況でも一貫した向上を示し、コールドスタート問題に対しても頑健であることが確認された。
- TJLSは、VTを含まないJLS(TJLS without VT)よりもすべてのベンチマークで優れた性能を示し、視覚変換器による非局所的依存関係のモデル化の有効性を裏付けた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。