Skip to main content
QUICK REVIEW

[論文レビュー] Distributed Deep Transfer Learning by Basic Probability Assignment

Arash Shahriari|arXiv (Cornell University)|Oct 20, 2017
Domain Adaptation and Few-Shot Learning参考文献 12被引用数 3
ひとこと要約

本稿では、証拠理論からの基本確率割り当て(BPA)を用いて、個々の畳み込みフィルタを個別に微調整するとともに、それらを共同で誤差逆伝播させる分散型ディープ転移学習フレームワークを提案する。BPAを用いてクラス不均衡を緩和し最適化の複雑さを低減することで、特に不均衡およびクロスドメイン設定において、標準的な転移学習よりも一貫した性能向上を達成した。

ABSTRACT

Transfer learning is a popular practice in deep neural networks, but fine-tuning of large number of parameters is a hard task due to the complex wiring of neurons between splitting layers and imbalance distributions of data in pretrained and transferred domains. The reconstruction of the original wiring for the target domain is a heavy burden due to the size of interconnections across neurons. We propose a distributed scheme that tunes the convolutional filters individually while backpropagates them jointly by means of basic probability assignment. Some of the most recent advances in evidence theory show that in a vast variety of the imbalanced regimes, optimizing of some proper objective functions derived from contingency matrices prevents biases towards high-prior class distributions. Therefore, the original filters get gradually transferred based on individual contributions to overall performance of the target domain. This largely reduces the expected complexity of transfer learning whilst highly improves precision. Our experiments on standard benchmarks and scenarios confirm the consistent improvement of our distributed deep transfer learning strategy.

研究の動機と目的

  • 複雑な層間接続とパラメータの結合性による、大規模なディープニューラルネットワークの微調整における高い計算複雑性に対処する。
  • ソースドメインとターゲットドメイン間のクラス不均衡が原因で生じる転移学習の性能低下を緩和する。
  • 転移学習の非凸最適化問題を、分散的かつ個別のフィルタ微調整に分解しつつ、共同誤差逆伝播を維持する。
  • 証拠理論を基本確率割り当て(BPA)を介して組み込むことで、不均衡なデータ分布をより効果的に扱い、一般化性能と精度を向上させる。
  • MNIST、SVHN、CIFARデータセットを含む多様で現実的かつ多様なベンチマークにおいて、一貫した性能向上を示す。

提案手法

  • 非凸最適化の複雑さを低減するために、畳み込みフィルタを個別に微調整する。
  • 誤分類コストを混同行列から統合したコストセンシティブなスキームを用いて、すべてのフィルタを共同で誤差逆伝播する。
  • 証拠理論からの基本確率割り当て(BPA)を用い、ターゲットドメインにおける各フィルタのパフォーマンスに基づいて、確率的重みをフィルタの寄与度に割り当てる。
  • 分類結果から連関行列(混同行列)を構築し、BPAをガイドする。これにより、不均衡なクラス間でのパフォーマンスを正則化する。
  • 混同行列を用いて、精度、再現率、拒否率を導出し、バイアスの強い高事前確率クラスに偏らないインformedな確率割り当てを可能にする。
  • 極めて不均衡な状況では、BPAの計算に訓練集合と検証集合を組み合わせる。これにより、データ分布のシフトをよりよく捉える。

実験結果

リサーチクエスチョン

  • RQ1個々の畳み込みフィルタの分散的微調整は、ディープネットワークにおける転移学習の計算負荷を軽減できるか?
  • RQ2証拠理論からの基本確率割り当て(BPA)は、不均衡な転移学習状況での性能をどのように向上させるか?
  • RQ3個別に微調整されたフィルタを共同で誤差逆伝播することで、精度および一般化性能において、標準的なエンドツーエンド微調整を上回ることができるか?
  • RQ4混同行列とBPAを用いることで、クラス分布が著しく異なるドメイン間での転移に与えるモデル性能への影響は何か?
  • RQ5訓練集合のみではなく、訓練集合と検証集合を組み合わせてBPAを計算することで、極めて不均衡な転移タスクにおいて、訓練集合のみでの計算よりも一般化性能が向上するか?

主な発見

  • 分散型誤差逆伝播戦略は、特にMNISTからSVHNやCIFAR-100への転移のような不均衡データセットにおいて、標準的な誤差逆伝播を顕著に上回る。
  • MNIST → SVHNの転移タスクでは、分散型手法がテスト誤差を標準手法の29.57%から5.18%にまで低減し、不均衡下でも優れた一般化性能を示した。
  • CIFAR-10 → CIFAR-100の転移においては、分散型手法が68.44%(標準)から54.32%にテスト誤差を低減し、ドメインシフトの影響にもかかわらず性能が向上した。
  • CIFAR-100 → SVHNへの転移では、分散型手法が標準手法の12.18%から7.25%に誤差を低減し、データ分布の不一致に対してもより効果的に対処できた。
  • 訓練集合と検証集合を組み合わせてBPAを計算することで、訓練集合のみでの計算よりも性能が向上した。特に、ソースクラスが少ない場合やターゲットクラス数が多い場合に顕著であった。
  • CIFAR-10からMNISTへの転移において、ベースラインモデルと同等の性能を達成した。これは、類似しないタスク間でも、知識の効果的な転送が可能であることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。