Skip to main content
QUICK REVIEW

[論文レビュー] Contextual Dropout: An Efficient Sample-Dependent Dropout Module

Xinjie Fan, Shujian Zhang|arXiv (Cornell University)|Mar 6, 2021
Data Stream Mining Techniques参考文献 51被引用数 11
ひとこと要約

本稿では、入力に応じたドロップアウト率を学習する軽量でパラメータ共有構造を採用する、サンプル依存のドロップアウトモジュールであるコンテキストドロップアウトを提案する。これにより、最小限の計算コストで深層ニューラルネットワークにおける不確実性推定と精度が向上する。画像分類および視覚的質問応答タスクにおいて、標準的および変分ドロップアウトを凌駕し、特にノイズが多い条件下でも優れた性能を示す。

ABSTRACT

Dropout has been demonstrated as a simple and effective module to not only regularize the training process of deep neural networks, but also provide the uncertainty estimation for prediction. However, the quality of uncertainty estimation is highly dependent on the dropout probabilities. Most current models use the same dropout distributions across all data samples due to its simplicity. Despite the potential gains in the flexibility of modeling uncertainty, sample-dependent dropout, on the other hand, is less explored as it often encounters scalability issues or involves non-trivial model changes. In this paper, we propose contextual dropout with an efficient structural design as a simple and scalable sample-dependent dropout module, which can be applied to a wide range of models at the expense of only slightly increased memory and computational cost. We learn the dropout probabilities with a variational objective, compatible with both Bernoulli dropout and Gaussian dropout. We apply the contextual dropout module to various models with applications to image classification and visual question answering and demonstrate the scalability of the method with large-scale datasets, such as ImageNet and VQA 2.0. Our experimental results show that the proposed method outperforms baseline methods in terms of both accuracy and quality of uncertainty estimation.

研究の動機と目的

  • 固定された、データに依存しないドロップアウト確率の制限が、不確実性推定の品質を制限するという問題に対処すること。
  • モデルの複雑さや推論コストの著しい増加を伴わずに、柔軟でサンプル固有のドロップアウト率を可能にすること。
  • さまざまなニューラルネットワーク層やドロップアウトタイプ(ベルヌーイおよびガウス型)と互換性がある、スケーラブルで汎用的なドロップアウトモジュールの開発。
  • 実世界の大規模応用、たとえばImageNetやVQA 2.0のような環境において、予測精度と不確実性のキャリブレーションを両方向上させること。

提案手法

  • 入力の共変量を関数としてドロップアウト率をパrameter化するコンテキストドロップアウトモジュールを提案し、共有エンコーダ・デコーダ構造を用いる。
  • 入力に依存するドロップアウト分布を学習するための変分推論の目的関数を採用し、エンド・ツー・エンドの学習を可能にする。
  • メインネットワークのパラメータを再利用してドロップアウト率を生成することで、追加のメモリや計算コストを最小限に抑える。
  • 全結合層、畳み込み層、自己注意層にこのモジュールを適用し、広範な互換性を確保する。
  • 統一されたパrameterizationフレームワークにより、ベルヌーイ型およびガウス型ドロップアウトの両方をサポートする。
  • 後方期待値を近似するためにモンテカルロサンプリングを用いてモデルを学習し、計算効率を維持する。

実験結果

リサーチクエスチョン

  • RQ1固定された、データに依存しないドロップアウトと比較して、サンプル依存のドロップアウトは不確実性推定とモデル精度を向上させることができるか?
  • RQ2著しい計算コストやメモリコストを伴わず、入力固有のドロップアウト率を学習することは可能か?
  • RQ3ImageNet や VQA 2.0 といった大規模データセットにおいて、標準的およびノイズのある条件下で、コンテキストドロップアウトはどの程度の性能を示すか?
  • RQ4提案されたモジュールは、さまざまなニューラルネットワークアーキテクチャや層タイプに一般化可能か?
  • RQ5コンテキストドロップアウトは、性能向上を伴って事前学習モデルのファインチューニングに使用可能か?

主な発見

  • ImageNetデータセットにおいて、ファインチューニングされた事前学習モデルの精度が向上し、トランスファーラーニングにおける有用性が実証された。
  • 元のVQA 2.0データセットでは、コンテキストドロップアウトは67.42%の精度と71.65のPAvPUを達成し、すべてのベースラインを上回った。
  • ガウスノイズ(σ=5)を追加したノイズのあるVQAデータでは、コンテキストドロップアウトは63.73%の精度と68.57のPAvPUを維持し、標準ドロップアウト手法を著しく上回った。
  • 不確実性推定において一貫した改善が見られ、誤った出力に対してはより慎重な予測がなされ、正しい出力に対してはより自信を持つ予測が得られた。
  • コンテキストドロップアウトの計算およびメモリオーバーヘッドは最小限であり、大規模なモデルやデータセットへのスケーラビリティを実現した。
  • 可視化結果から、特に曖昧または複雑な質問タイプにおいて、コンテキストドロップアウトは人間のアノテーションパターンとよりよく一致することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。