Skip to main content
QUICK REVIEW

[論文レビュー] PASS: An ImageNet replacement for self-supervised pretraining without humans

Yuki Asano, Christian Rupprecht|arXiv (Cornell University)|Sep 27, 2021
Medical Imaging and Analysis被引用数 10
ひとこと要約

PASSは、CC-BYライセンスと完全なクレジット表記を備えた、人間を含まない画像のみから構成される128万枚の自己教師あり事前学習データセットであり、画像認識モデルの事前学習においてImageNetに代わる選択肢を提供する。人間のプライバシーおよび同意に関する倫理的・法的懸念を解消し、人間を含まないデータで学習させることで、人間の姿勢推定などの下流タスクにおいてImageNetと同等の性能を達成している。

ABSTRACT

Computer vision has long relied on ImageNet and other large datasets of images sampled from the Internet for pretraining models. However, these datasets have ethical and technical shortcomings, such as containing personal information taken without consent, unclear license usage, biases, and, in some cases, even problematic image content. On the other hand, state-of-the-art pretraining is nowadays obtained with unsupervised methods, meaning that labelled datasets such as ImageNet may not be necessary, or perhaps not even optimal, for model pretraining. We thus propose an unlabelled dataset PASS: Pictures without humAns for Self-Supervision. PASS only contains images with CC-BY license and complete attribution metadata, addressing the copyright issue. Most importantly, it contains no images of people at all, and also avoids other types of images that are problematic for data protection or ethics. We show that PASS can be used for pretraining with methods such as MoCo-v2, SwAV and DINO. In the transfer learning setting, it yields similar downstream performances to ImageNet pretraining even on tasks that involve humans, such as human pose estimation. PASS does not make existing datasets obsolete, as for instance it is insufficient for benchmarking. However, it shows that model pretraining is often possible while using safer data, and it also provides the basis for a more robust evaluation of pretraining methods.

研究の動機と目的

  • 大規模な視覚データセットにおける人間のプライバシーおよび同意に関する倫理的・法的懸念を解決すること。
  • 検索エンジンを介した画像収集に起因する人間の表現に関するバイアスを排除すること。
  • 人間中心のコンテンツを避けることにより、自己教師あり学習に適したスケーラブルでラベルなしのデータセットを構築すること。
  • 自然画像分布における自己教師あり学習手法の評価のためのより安全で堅牢なベンチマークを提供すること。
  • 人間の画像を含まない事前学習が、人間を含むタスクにおいても実現可能で効果的であることを示すこと。

提案手法

  • PASSは、検索エンジンに依存しない方法でFlickrからランダムに画像を抽出することで構築され、選択バイアスを回避する。
  • 自動検出と手動検証を用いて、人間、人体部位、ナンバープレート、署名、手書き文字を含むすべての画像を除外する。
  • すべての画像はCC-BYライセンスであり、完全なメタデータを備え、法的適合性とクレジット表記を保証する。
  • データセットは、MoCo-v2、SwAV、DINOを含む最先端の自己教師あり学習手法を用いて事前学習に使用される。
  • 最終データセットに人間関連のコンテンツが含まれないことを保証するための検証パイプラインが整備されている。
  • データセットはバージョニングされ、ZenodoおよびGitHubにホスティングされ、コードとメタデータのダウンロードが可能である。

実験結果

リサーチクエスチョン

  • RQ1人間を一切含まない大規模なラベルなし画像データセットが、自己教師あり事前学習においてImageNetに代わって効果的に機能するか。
  • RQ2人間の画像を排除することで、モデルの事前学習における倫理的・法的リスクはどの程度低減されるか。
  • RQ3PASSで事前学習したモデルの性能は、ImageNetで事前学習したモデルと比較して、多様な下流タスクでどの程度の差があるか。
  • RQ4検索エンジンやラベルなしで収集されたデータセットは、ラベル付きでキュレートされたデータセットよりも自己教師あり学習においてより優れた一般化性能を示すか。
  • RQ5人間のコンテンツが欠落していることで、特に人間を含むタスクにおける学習特徴の質に悪影響を与えるか。

主な発見

  • PASSで事前学習したモデルは、人間の姿勢推定などの人間を含むタスクにおいても、ImageNetで事前学習したモデルと同等の転移学習性能を達成している。
  • MoCo-v2、SwAV、DINOを用いてPASSで事前学習したモデルは、下流ベンチマークにおいてImageNetで事前学習したモデルと同等の精度を達成している。
  • データセットには128万枚の画像が含まれており、すべてCC-BYライセンスで、完全なクレジット表記メタデータを備え、法的および倫理的適合性を確保している。
  • 自動検出と手動検証による検証を通じて、最終データセットに人間関連のコンテンツが一切存在しないことが確認されている。
  • GitHubおよびZenodoを介してデータセットが公開されており、画像のダウンロードおよびメタデータへのアクセスが可能なコードが提供されている。
  • データセットはバージョニングされており、後続で人間を含むと判明した画像が発覚した場合に、その削除を含めたアップデートが実施される予定である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。