Skip to main content
QUICK REVIEW

[論文レビュー] Fully-adaptive Feature Sharing in Multi-Task Networks with Applications in Person Attribute Classification

Yongxi Lu, Abhishek Kumar|arXiv (Cornell University)|Nov 16, 2016
Video Surveillance and Tracking Methods参考文献 43被引用数 9
ひとこと要約

本論文は、訓練中に段階的に薄いネットワークを拡張することで、コン act な深層ニューラルネットワークアーキテクチャを自動的に設計する、完全に適応的で動的なマルチタスク学習フレームワークを提案する。類似したタスクをグループ化し、複雑さを最小化するための新規基準を用いる。この手法は、人間の属性分類において最先端の精度を達成しており、CelebAで顔属性分類の90%の精度を達成し、VGG-16と比較してモデルが90倍小さく、3倍速い。同時に、高効率かつコンパクトに顔属性と衣類属性を同時に予測可能である。

ABSTRACT

Multi-task learning aims to improve generalization performance of multiple prediction tasks by appropriately sharing relevant information across them. In the context of deep neural networks, this idea is often realized by hand-designed network architectures with layers that are shared across tasks and branches that encode task-specific features. However, the space of possible multi-task deep architectures is combinatorially large and often the final architecture is arrived at by manual exploration of this space subject to designer's bias, which can be both error-prone and tedious. In this work, we propose a principled approach for designing compact multi-task deep learning architectures. Our approach starts with a thin network and dynamically widens it in a greedy manner during training using a novel criterion that promotes grouping of similar tasks together. Our Extensive evaluation on person attributes classification tasks involving facial and clothing attributes suggests that the models produced by the proposed method are fast, compact and can closely match or exceed the state-of-the-art accuracy from strong baselines by much more expensive models.

研究の動機と目的

  • 組み合わせ的に巨大なアーキテクチャ空間における手動による偏りのある探索を排除し、マルチタスク深層ニューラルネットワークアーキテクチャの自動設計を実現すること。
  • 各ネットワーク層において、どのタスクが特徴を共有すべきかを動的に決定することで、タスク関連の特徴共有を可能にすること。
  • 最小限のメモリ使用量で低遅延なモデルを生成し、最先端の精度を維持または上回ること。
  • タスクの類似度とモデルの複雑さのバランスをとる、原理的でグリーディーなトップダウンのネットワーク拡張戦略を構築すること。

提案手法

  • 本手法は薄いネットワークから出発し、タスクの類似度を高め、モデルの複雑さをペナルティ化する新規の分岐基準を用いて、訓練中に動的にネットワークを広げていく。
  • グリーディーなレイヤーワイズ分岐メカニズムにより、各レイヤーで、あるタスクがどのタスクと特徴を共有すべきかを、タスクの類似度と複雑さコストに基づいて決定する。
  • VGG-16などの広い事前学習済みネットワークから薄いネットワークに知識を転送するための新規な同時直交マッチング追求(SOMP)ベースの初期化手法を導入し、収束を加速させ、精度を向上させる。
  • 性能向上と冗長性の低減が示された場合にのみ、新しい分岐を追加することで段階的にネットワークを成長させる、マルチラウンド分岐手順を採用する。
  • 分岐意思決定プロセスにおける複雑さペナルティにより、関連のないタスク間での特徴共有を抑制することで、負の転送を回避する。
  • 共有ボトムレイヤーと動的に作成されたタスク固有の分岐を持つアーキテクチャをエンドツーエンドで訓練し、排他的でない属性を同時に予測可能にする。

実験結果

リサーチクエスチョン

  • RQ1手動による設計やタスク関係に関する事前仮定なしに、完全に適応的で動的なアーキテクチャ探索手順が、最適なマルチタスクネットワーク構造を自動で学習できるか?
  • RQ2類似度と複雑さに基づく、レイヤー単位での動的タスクグループ化は、マルチタスク人物属性分類におけるモデルの精度とコンパクトネスにどのように影響するか?
  • RQ3事前学習済み広いネットワークからのSOMPベース初期化が、薄いマルチタスクモデルにおける収束性と性能にどの程度向上効果をもたらすか?
  • RQ41つのコンパクトなマルチタスクモデルが、顔属性と衣類属性を多様に同時に予測でき、大きなベースラインモデルと同等またはそれ以上の性能を達成できるか?
  • RQ5タスクグループ化はモデル精度にどのような影響を及ぼし、類似したタスクをグループ化することで、さまざまな属性カテゴリにおいて一貫して性能が向上するか?

主な発見

  • 提案手法は、CelebAデータセットにおける顔属性分類で90%の精度を達成し、はるかに大きなVGG-16モデルが達成した最先端の結果と同等の性能を示したが、モデルは90倍小さく、3倍速い。
  • DeepFashionデータセットでは、単一のコンパクトなマルチタスクモデルを用いて、顔属性と衣類属性の両方を同時に予測可能でありながら、高い精度を維持した。
  • SOMP初期化手法は、収束の速さと最終的な精度の両面で顕著な向上を示しており、ランダム初期化と比較して、より速く良好な訓練プロセスを達成した。
  • アブレーションスタディにより、類似したタスクをグループ化することで、大多数の属性で精度が向上することが確認された。特に、過剰に広いブランチに属するタスクを再グループ化した際に、最も大きな向上が得られた。
  • コンパクトなBranch-32-2.0モデルとVGG-16ベースラインとの精度差は、主にモデル容量の小ささに起因しており、事前学習重みの非最適な使用によるものではないことが、事前学習使用に関するアブレーションで示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。