Skip to main content
QUICK REVIEW

[論文レビュー] Hard Mixtures of Experts for Large Scale Weakly Supervised Vision

Sam Gross, Marc’Aurelio Ranzato|arXiv (Cornell University)|Apr 20, 2017
Advanced Neural Network Applications参考文献 10被引用数 7
ひとこと要約

本稿では、大規模な弱教師あり画像認識のためのハード混合専門家(MoE)アーキテクチャを提案する。各画像は、事前学習済みの畳み込みニューラルネットワーク(CNN)の特徴空間におけるクラスタリングに基づいて、1つの専門家にルーティングされる。専門家を独立して学習させ、デコーダーを共有することで、YFCC100Mのようなデータセット上で大規模モデルの効率的スケーリングが可能となり、タグ予測の精度向上と、細分化分類タスクにおける改善された転移性能が達成された。

ABSTRACT

Training convolutional networks (CNN's) that fit on a single GPU with minibatch stochastic gradient descent has become effective in practice. However, there is still no effective method for training large CNN's that do not fit in the memory of a few GPU cards, or for parallelizing CNN training. In this work we show that a simple hard mixture of experts model can be efficiently trained to good effect on large scale hashtag (multilabel) prediction tasks. Mixture of experts models are not new (Jacobs et. al. 1991, Collobert et. al. 2003), but in the past, researchers have had to devise sophisticated methods to deal with data fragmentation. We show empirically that modern weakly supervised data sets are large enough to support naive partitioning schemes where each data point is assigned to a single expert. Because the experts are independent, training them in parallel is easy, and evaluation is cheap for the size of the model. Furthermore, we show that we can use a single decoding layer for all the experts, allowing a unified feature embedding space. We demonstrate that it is feasible (and in fact relatively painless) to train far larger models than could be practically trained with standard CNN architectures, and that the extra capacity can be well used on current datasets.

研究の動機と目的

  • GPUメモリ制限を超える大規模な弱教師ありデータセット上で大規模な畳み込みネットワークを学習する課題に対処すること。
  • 単純でエンドツーエンドではないMoEアーキテクチャが、複雑なルーティング最適化を伴わずにモデル容量を効果的に拡張できるかを検討すること。
  • MoEモデルにおける共有デコーダーが、下流タスクのための転送可能な特徴を保持できるかを評価すること。
  • ビリオンスケールのデータセット上で標準CNNが示す不足学習は、MoEによるアーキテクチャスケーリングによって緩和可能であるかを示すこと。

提案手法

  • 画像はまず事前学習済みのResNet-18で符号化され、直前層の特徴がK-meansを用いてクラスタリングされ、専門家への割り当てが定義される。
  • 各画像は最も近いクラスタ中心にルーティングされ、ハードルーティング機構により1つの専門家に割り当てられる。
  • 専門家は割り当てられたデータサブセット上で独立して学習され、並列学習が効率的に行える。
  • すべての専門家に共通するデコーダーが使用され、特徴空間を統一することで、最終特徴層からの転移学習が可能になる。
  • クラスタリング後にゲーティングネットワークは固定され、エンドツーエンドのファインチューニングは行われない。
  • モデル評価には、タグ予測のためのq@10と、CUBやオックスフォードフラワーズのような下流データセットにおける線形プローブ精度が用いられる。

実験結果

リサーチクエスチョン

  • RQ1単純でエンドツーエンドではないハード混合専門家モデルは、大規模な弱教師ありデータセット上でモデル容量を効果的に拡張できるか?
  • RQ2クラスタリングベースのゲーティングにより画像を1つの専門家にルーティングすることにより、大規模データセット上で標準CNNよりも優れた性能が得られるか?
  • RQ3専門家間でデコーダーを共有することで、下流タスクのための意味的で転送可能な特徴を保持できるか?
  • RQ4クラスタごとのタグ分布のスパarsityとモデルの予測精度の間に相関関係があるか?

主な発見

  • ハードMoEモデルは、標準CNNと比較してYFCC100Mにおけるタグ予測精度に顕著な向上を示し、大規模データでの不足学習の軽減を実証した。
  • クラスタ間で分布がよりスパースなタグは、より正確に予測される傾向にあり、クラスタ構造が意味的スパarsityと整合している可能性を示唆した。
  • 共有デコーダーを備えたMoEバージョンは、CUBやオックスフォードフラワーズのような細分化データセットで改善された転移性能を示し、高品質な特徴学習が可能であることを示した。
  • ゲーティングネットワークにエンドツーエンド学習を実施しなかったにもかかわらず、モデルはわずか2倍の計算コストで効率的な並列学習と評価が可能であり、性能に優れた。
  • YFCC100Mで学習したモデルは、ImageNetへの転移においても競争力のある性能を示した。これは、弱教師ありデータが大規模スケールで強力な特徴を生成可能であることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。