Skip to main content
QUICK REVIEW

[論文レビュー] Auxiliary Task Update Decomposition: The Good, The Bad and The Neutral

Lucio M. Dery, Yann Dauphin|arXiv (Cornell University)|Aug 25, 2021
Domain Adaptation and Few-Shot Learning参考文献 47被引用数 5
ひとこと要約

本稿では、主タスクの損失に対する影響に基づいて補助タスク勾配を3つの成分—有益、有害、無関係—に分解するモデルに依存しないフレームワークATTITTUDを提案する。効率的な特異値分解(SVD)と自動微分を用いてこれらの成分を再重み付けすることで、データが少ない状況下でも一般化性能が向上し、視覚および自然言語分類タスクにおいて一貫してベースラインを上回る。

ABSTRACT

While deep learning has been very beneficial in data-rich settings, tasks with smaller training set often resort to pre-training or multitask learning to leverage data from other tasks. In this case, careful consideration is needed to select tasks and model parameterizations such that updates from the auxiliary tasks actually help the primary task. We seek to alleviate this burden by formulating a model-agnostic framework that performs fine-grained manipulation of the auxiliary task gradients. We propose to decompose auxiliary updates into directions which help, damage or leave the primary task loss unchanged. This allows weighting the update directions differently depending on their impact on the problem of interest. We present a novel and efficient algorithm for that purpose and show its advantage in practice. Our method leverages efficient automatic differentiation procedures and randomized singular value decomposition for scalability. We show that our framework is generic and encompasses some prior work as particular cases. Our approach consistently outperforms strong and widely used baselines when leveraging out-of-distribution data for Text and Image classification tasks.

研究の動機と目的

  • 主タスクのデータが限られている状況において、有益な補助タスクを選択する課題に対処すること。
  • 補助タスクが主タスクの性能を低下させる可能性のある負の干渉を回避すること。
  • 主タスクへの影響に基づいて補助勾配を微調整する、スケーラブルでモデルに依存しない手法を開発すること。
  • 対称的なタスク最適化を必要とせずに、柔軟かつ適応的な勾配成分の再重み付けを可能にすること。
  • PCGrad や古典的なマルチタスク学習を統合する統一フレームワークを提供すること。

提案手法

  • 主タスクの例ごとの勾配部分空間に対して直交する3つの成分に補助タスク勾配を分解する:正の(有益)、負の(有害)、中立の(影響なし)。
  • 主タスクの期待損失のテイラー展開を用いて、各補助勾配方向が主タスクに与える影響を定義する。
  • オンラインで確率的な方法で、主タスクの例ごとの勾配が張るk次元部分空間を、ランダム化された特異値分解(SVD)を用いて効率的に推定する。
  • 大規模な深層ネットワーク向けに、ジャコビアン・ベクトル積を効率的に計算するために自動微分(特にR演算子)を活用する。
  • 学習可能または固定のスカラー(例:η_aux = (1.0, 0.0, 0.0))を用いて、3つの成分を再重み付ける。
  • 大規模なビジョンおよびNLPタスクをサポートするため、ステochasticな学習パイプラインにフレームワークを統合する。

実験結果

リサーチクエスチョン

  • RQ1補助タスク勾配を、主タスク損失を向上・低下・変化させない成分に分解できるか?
  • RQ2深層ニューラルネットワークに対して、スケーラブルに主タスク勾配部分空間を効率的に推定できるか?
  • RQ3勾配成分の細分化された再重み付けは、リソースが限られた主タスクでの一般化性能を向上させるか?
  • RQ4提案されたフレームワークは、PCGrad や標準的なマルチタスク学習といった既存の非対称マルチタスク学習手法を統合または上回るか?
  • RQ5部分空間次元k やSVD推定のサンプルサイズといったハイパーパrameterが、低データおよび高データの両状況下での性能に与える影響は?

主な発見

  • 提案されたATTITTUDフレームワークは、MultiCifar100で平均76.1%の精度を達成し、次に良いベースライン(PCGrad)の75.6%を上回った。
  • Cat-vs-Dog Cifar10タスクでは、ATTITTUDが67.1%(±1.31)の精度を達成し、PCGrad(64.2%)とマルチタスク学習(65.3%)を上回った。
  • ChexPert-5k医療画像ベンチマークでは、ATTITTUDがAUCをpretrained ResNetの81.4%から83.3%まで向上させ、優れた転移性能を示した。
  • 勾配部分空間のランダム化SVDベースを用いることで、平均62.2%の精度が得られ、標準的(51.42%)、ランダム(58.72%)、unit_avg_grad(59.13%)のベースラインを大きく上回った。
  • 最良の設定(η_aux = (1.0, 0.0, 0.0))は、内部成分を除去し、過学習を軽減して一般化性能を向上させた。
  • 部分空間推定のためのサンプルサイズを大きくすると分散が減少するが、精度の向上は次第に鈍り、計算コストと忠実度のトレードオフが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。