Skip to main content
QUICK REVIEW

[論文レビュー] Museum Exhibit Identification Challenge for Domain Adaptation and Beyond

Piotr Koniusz, Yusuf Tas|arXiv (Cornell University)|Feb 4, 2018
Generative Adversarial Networks and Image Synthesis被引用数 6
ひとこと要約

本稿では、ドメイン適応、エゴセントリック認識、少数-shot学習の課題を提示する、博物館展示物同定のための新規ベンチマークデータセットOpen MICを紹介する。866体の展示物のアイデンティティを含み、制御されたソース(スマートフォンで撮影)とリアルな環境下のターゲット(ウェアラブルカメラで撮影)の設定で収集されたデータセットであり、Honサブセットで77.3%の最新精度を達成したRiemann計量に基づくSo-HoTモデル(Bregman発散を用いて)が提案されている。

ABSTRACT

In this paper, we approach an open problem of artwork identification and propose a new dataset dubbed Open Museum Identification Challenge (Open MIC). It contains photos of exhibits captured in 10 distinct exhibition spaces of several museums which showcase paintings, timepieces, sculptures, glassware, relics, science exhibits, natural history pieces, ceramics, pottery, tools and indigenous crafts. The goal of Open MIC is to stimulate research in domain adaptation, egocentric recognition and few-shot learning by providing a testbed complementary to the famous Office dataset which reaches 90% accuracy. To form our dataset, we captured a number of images per art piece with a mobile phone and wearable cameras to form the source and target data splits, respectively. To achieve robust baselines, we build on a recent approach that aligns per-class scatter matrices of the source and target CNN streams [15]. Moreover, we exploit the positive definite nature of such representations by using end-to-end Bregman divergences and the Riemannian metric. We present baselines such as training/evaluation per exhibition and training/evaluation on the combined set covering 866 exhibit identities. As each exhibition poses distinct challenges e.g., quality of lighting, motion blur, occlusions, clutter, viewpoint and scale variations, rotations, glares, transparency, non-planarity, clipping, we break down results w.r.t. these factors.

研究の動機と目的

  • 視覚認識分野におけるドメイン適応の分野において、文化的遺産や博物館環境を想定した現実的でリアルな環境下のベンチマークが不足しているという問題に対処すること。
  • 顕著なドメインシフトと多様な視覚的課題を伴うデータセットを提供することで、ドメイン適応、エゴセントリック認識、少数-shot学習分野の研究を促進すること。
  • Officeデータセットは約90%の精度に到達し、性能の飽和状態に達しているため、それとは補完的なテストベッドを提供すること。
  • 照明の変化、運動ブラー、隠蔽、視点の変化といった現実の状況要因を考慮した評価を可能にすること。
  • 博物館環境における人間の注意を反映する、新たなサリエンシーに基づく評価指標を導入すること。

提案手法

  • データセットは、制御されたソース画像(スマートフォンで撮影、中央に配置、隠蔽なし)と、自然な博物館体験におけるボランティアによるウェアラブルカメラで撮影されたリアルな環境下のターゲット画像を用いて構築された。
  • 各クラスの散乱行列とBregman発散を用いて、正定値共分散行列をモデル化するRiemann計量に基づくアプローチを採用し、ドメイン整合性を強化した。
  • 非ユークリッド幾何学を用いてSo-HoT(2次以上の転送)モデルを拡張し、ドメインシフトにわたる一般化性能を向上させた。
  • Riemann距離の行列微分を介して勾配を逆伝播させるエンドツーエンド学習を採用し、射影行列を用いて不変性を維持した。
  • 複数の評価プロトコルをサポート:展示会場ごとの訓練・評価、展示会場間での訓練、およびシーン固有の課題に対する要因別アブレーション。
  • 新たなサリエンシーに基づく評価指標を導入し、ボランティアが展示物の認識の中心性を順位付けし、モデルは上位k件の予測精度で評価された。

実験結果

リサーチクエスチョン

  • RQ1照明、視点、隠蔽、運動によるドメインシフトが、博物館環境の現実的状況下で、最先端のドメイン適応モデルの性能にどのように影響を与えるか?
  • RQ2Riemann幾何学とBregman発散を博物館展示物の視覚特徴に適用することで、ドメイン適応におけるロバスト性が向上するか?
  • RQ3この新規のリアルな環境下のベンチマークにおいて、教師ありドメイン適応手法と教師なし手法の性能はどのように比較されるか?
  • RQ4グレア、透明性、非平面性といったシーン固有の要因が、認識精度をどの程度低下させるか?
  • RQ5すべての10の博物館展示会場のデータを統合して学習した場合、モデルの一般化性能はどの程度向上するか?

主な発見

  • 提案されたRiemann計量に基づくSo-HoTモデルは、Honサブセットで77.3%の精度を達成し、DHN(64.6%)やJAN(65.2%)といった教師なし手法を顕著に上回った。
  • Clkサブセットでは61.2%の精度を達成し、雑多さや視点の変化といった困難な状況下でも強力な性能を示した。
  • 教師なしドメイン適応手法(RTN, JAN, DHN)は、最も困難なサブセットで67%未満のスコアを記録し、このような複雑な視覚ドメインではターゲットデータのラベル情報の必要性が示された。
  • サリエンシーに基づく評価により、ドメイン適応を用いて訓練されたモデルが、博物館環境における人間の注意を予測する面で、ベースライン手法を顕著に上回ることが明らかになった。
  • データセットの分析から、最新のモデルですら非平面的・透明的・反射的な展示物に対して困難を抱えていることが判明し、幾何的および光度的不変性の向上が求められていることが示された。
  • Office-Homeデータセットにおける性能はOpen MICより低かったため、Open MICは既存のベンチマークよりもより困難で現実的なドメインシフトを提示していると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。