Skip to main content
QUICK REVIEW

[論文レビュー] Leveraging Random Label Memorization for Unsupervised Pre-Training

Vinaychandran Pondenkandath, Michele Alberti|arXiv (Cornell University)|Nov 5, 2018
Human Pose and Action Recognition参考文献 18被引用数 5
ひとこと要約

本稿では、大規模なラベルなしデータセットから有用な表現を学ぶために、深層ニューラルネットワークにおけるランダムラベル記憶に着目した、新しい教師なし事前学習手法を提案する。UCF101 や Kinetics などのデータセットでランダムにラベルが割り当てられた動画データに対して 3D-CNN を事前学習することで、一般化された記憶インfra構築が可能となり、複数のベンチマークで下流のアクション認識精度が 1.5% から 5% 向上する。

ABSTRACT

We present a novel approach to leverage large unlabeled datasets by pre-training state-of-the-art deep neural networks on randomly-labeled datasets. Specifically, we train the neural networks to memorize arbitrary labels for all the samples in a dataset and use these pre-trained networks as a starting point for regular supervised learning. Our assumption is that the "memorization infrastructure" learned by the network during the random-label training proves to be beneficial for the conventional supervised learning as well. We test the effectiveness of our pre-training on several video action recognition datasets (HMDB51, UCF101, Kinetics) by comparing the results of the same network with and without the random label pre-training. Our approach yields an improvement - ranging from 1.5% on UCF-101 to 5% on Kinetics - in classification accuracy, which calls for further research in this direction.

研究の動機と目的

  • ビデオアクション認識におけるラベル付きデータの高コストと不足問題を、大規模なラベルなしデータセットを活用することで解決する。
  • ランダムラベルを記憶することで、下流の教師あり学習に役立つ表現が得られるかどうかを調査する。
  • 事前学習と微調整の間で特徴分布の不一致を避ける、再構成ベースの教師なし事前学習の代替手法を検討する。
  • ランダムラベル事前学習が一般化性能を向上させるとともに、教師あり微調整の収束を加速することを実証する。
  • 記憶容量が、その後の学習タスクに有益な再利用可能なインfraを形成することを実証的裏付けで示す。

提案手法

  • ランダムにラベルが割り当てられた大規模なラベルなし動画データセット(例:UCF101、Sports-1M)に対して、3D-CNN(C3D)を事前学習することで、任意のラベル割り当ての記憶を強制する。
  • 得られた事前学習済みモデルを、正しいラベルを用いて同じデータセットで微調整の出発点として利用し、事前学習段階では教師なしで学習を実行する。
  • 補完的なデータセット間で事前学習を実施(例:UCF101 のランダムラベルで事前学習し、HMDB51 の性能向上を検証)することで、転送可能性を検証する。
  • 事前学習の規模の影響を評価するため、Sports-1M データセットの 40% のみを用いて、ランダムラベルで Kinetics で事前学習する。
  • 初期事前学習後の、その後の記憶プロセスの速度を測定し、再利用可能な記憶インfraの存在を検証する。
  • ランダム初期化と同一データでの教師あり事前学習とを比較することで、ランダムラベル事前学習の利点を明確に分離する。

実験結果

リサーチクエスチョン

  • RQ1ランダムにラベルが割り当てられたデータで深層ニューラルネットワークを事前学習することで、下流のビデオアクション認識タスクの性能が向上するか?
  • RQ2ランダムラベル学習中に、その後の教師あり学習に有益な一般化された記憶インフラがネットワークに構築されるか?
  • RQ3事前学習に使用するラベルなしデータセットのサイズが、性能向上にどのように影響するか?
  • RQ4性能向上は、学習された特徴によるものか、それとも初期化の質の向上による高速収束によるものか?
  • RQ5どのネットワークの深さやレイヤー種別で、記憶インフラが最も効果的に形成されるか?

主な発見

  • ランダム初期化と比較して、UCF101 では分類精度が 1.7% 向上、HMDB51 では 0.8% 向上した。
  • Kinetics データセットでは、Sports-1M の 40% のサブセットをランダムラベルで事前学習した場合、40.2% の精度を達成し、事前学習なしのベースライン(35.0%)と比較して相対誤差を 8% 減少させた。
  • ランダムラベル事前学習による性能向上は顕著であり、ベースラインと比較して Kinetics で最大 5% の向上を達成したが、全 Sports-1M データで教師あり事前学習を実施した際の 69.8% の精度には及ばない。
  • 初期ランダムラベル事前学習後に実施する記憶タスクの収束が、最初のタスクと比べて顕著に速くなることから、再利用可能な記憶インフラが形成されていることが示された。
  • 複数のデータセットにわたり一貫した向上が得られたことから、学習されたインフラが異なるビデオアクション認識タスクに一般化していることが示唆された。
  • ラベルが入力データと相関のない場合でも、任意のラベルの記憶が、下流の分類に有益な特徴学習を誘発することが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。