Skip to main content
QUICK REVIEW

[論文レビュー] Scalable domain adaptation of convolutional neural networks

Adrian Popescu, Etienne Gadeski|arXiv (Cornell University)|Dec 7, 2015
Advanced Image and Video Retrieval Techniques参考文献 18被引用数 3
ひとこと要約

本稿では、手動ラベリングを伴わずに、Flickrから収集したノイズの多いWeb画像を用いて、畳み込みニューラルネットワーク(CNN)のスケーラブルで完全自動のドメイン適応手法を提案する。弱い教師ありリランク手法を適用し、これらの画像から再びCNNを訓練することで、オックスフォード5kやINRIA Holidaysといった観光関連のデータセットにおいて、SOTA(最先端)のリtrieval性能を達成した。これは、汎用的なImageNetモデルや手動ラベルを必要とする先行のCNN手法を上回る結果である。

ABSTRACT

Convolutional neural networks (CNNs) tend to become a standard approach to solve a wide array of computer vision problems. Besides important theoretical and practical advances in their design, their success is built on the existence of manually labeled visual resources, such as ImageNet. The creation of such datasets is cumbersome and here we focus on alternatives to manual labeling. We hypothesize that new resources are of uttermost importance in domains which are not or weakly covered by ImageNet, such as tourism photographs. We first collect noisy Flickr images for tourist points of interest and apply automatic or weakly-supervised reranking techniques to reduce noise. Then, we learn domain adapted models with a standard CNN architecture and compare them to a generic model obtained from ImageNet. Experimental validation is conducted with publicly available datasets, including Oxford5k, INRIA Holidays and Div150Cred. Results show that low-cost domain adaptation improves results compared to the use of generic models but also compared to strong non-CNN baselines such as triangulation embedding.

研究の動機と目的

  • 観光分野のようにImageNetのカバレッジが限られているドメインにおけるドメイン特化型の視覚的リソースの不足に対処すること。
  • ドメイン特化型のCNNを訓練するための、手動によるデータセット作成の代替手段として、スケーラブルで低コストな手法を開発すること。
  • 手動アノテーションなしで、ノイズの多いWebソースからの画像に効果的にCNNを訓練できるかどうかを調査すること。
  • 自動的に適応されたCNNの性能を、汎用モデルおよび強力な非CNNベースラインと比較し、リtrievalタスクにおける性能を評価すること。
  • データ品質、多様性、特徴工学的処理がドメイン適応CNNの性能に与える影響を評価すること。

提案手法

  • キーワードベースのクエリを用いて、観光スポット(POI)のための大量かつノイズの多いFlickr画像を自動収集する。
  • ノイズを低減し、トレーニングセットの画像品質を向上させるために、弱い教師ありリランク技術を適用する。
  • リランク処理を施したドメイン特化型の画像コレクション上で、標準的なCNNアーキテクチャを再び訓練する。
  • PCAを用いた次元削減により、CNN特徴量を圧縮し、精度の大幅な損失なしにスケーラビリティを向上させる。
  • 特徴量のロバスト性とリtrieval性能を向上させるために、空間的検索とデータ拡張を適用する。
  • 上位順位の結果を用いたクエリ拡張を実装し、リtrievalクエリを最適化し、mAPを向上させる。

実験結果

リサーチクエスチョン

  • RQ1ノイズの多いWeb画像を大量に用いて、特にリソースが限られたドメイン(例:観光)において、手動ラベルなしでCNNを効果的に訓練できるか。
  • RQ2ドメイン適応CNNの性能は、汎用的なImageNet事前学習モデルや非CNNベースラインと比べてどうか。
  • RQ3微調整時に、トレーニングセットのノイズに対して、データの多様性がどの程度補うことができるか。
  • RQ4特徴量の圧縮やチューニング技術(例:PCA、空間的検索)が、リtrieval性能とスケーラビリティに与える影響は何か。
  • RQ5弱い教師ありリランク処理は、ノイズの多いオリジナルコレクションと比較して、モデル性能を向上させるか。

主な発見

  • PCA圧縮特徴量(256次元)を用いることで、オックスフォード5kで69.2%、INRIA Holidaysで78.5%のmAPを達成し、先行のCNNベース手法を上回った。
  • ノイズの多いデータであっても、リランク処理を施したFlickr画像から再びCNNを訓練することで、汎用的なImageNetモデルに比べて優れた結果が得られた。
  • 256次元のPCA圧縮で最も高い性能が達成され、特徴量圧縮が精度を大きく損なわせずにスケーラビリティを向上させることを示した。
  • 空間的検索とデータ拡張による特徴量チューニングにより、オックスフォード5kおよびHolidaysでmAPが10%以上向上し、前処理の有効性が確認された。
  • クエリ拡張により、オックスフォード5kではmAPが81.5%まで向上したが、HolidaysおよびDiv150Credでは効果が認められず、ドメイン依存の有効性が示された。
  • 結果から、データの多様性がノイズを補うことができることを示唆しており、新規ドメインにおける効果的なCNN訓練には手動アノテーションが必ずしも必須ではない可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。