Skip to main content
QUICK REVIEW

[論文レビュー] Scalarization for Multi-Task and Multi-Domain Learning at Scale

Amélie Royer, Tijmen Blankevoort|arXiv (Cornell University)|Oct 13, 2023
Domain Adaptation and Few-Shot LearningComputer Science被引用数 3
ひとこと要約

この論文は、タスク損失の重み付き平均を最小化することでマルチタスクおよびマルチドメインモデルを訓練するスカラライゼーション—複雑なマルチタスク最適化(MTO)手法の代替手段として、単純でありながら効果的である—を調査する。多様なアーキテクチャとデータセットを対象とした大規模な実験を通じて、最適なスカラライゼーション重みが、特に不均衡な設定において顕著に性能を向上させることを示し、スケールに応じた重みの効率的探索を可能にするパopULATIONベースのトレーニングを提案。その結果、最小限の計算コスト増でSOTA性能を達成した。

ABSTRACT

Training a single model on multiple input domains and/or output tasks allows for compressing information from multiple sources into a unified backbone hence improves model efficiency. It also enables potential positive knowledge transfer across tasks/domains, leading to improved accuracy and data-efficient training. However, optimizing such networks is a challenge, in particular due to discrepancies between the different tasks or domains: Despite several hypotheses and solutions proposed over the years, recent work has shown that uniform scalarization training, i.e., simply minimizing the average of the task losses, yields on-par performance with more costly SotA optimization methods. This raises the issue of how well we understand the training dynamics of multi-task and multi-domain networks. In this work, we first devise a large-scale unified analysis of multi-domain and multi-task learning to better understand the dynamics of scalarization across varied task/domain combinations and model sizes. Following these insights, we then propose to leverage population-based training to efficiently search for the optimal scalarization weights when dealing with a large number of tasks or domains.

研究の動機と目的

  • 多様なモデル容量とデータ分布を想定したマルチタスクおよびマルチドメイン学習におけるスカラライゼーションのトレーニングダイナミクスを理解すること。
  • 不均衡なタスク/ドメイン設定におけるスカラライゼーション重みが勾配の衝突とモデル性能に与える影響を調査すること。
  • 多数のタスクやドメインに対してハイパーパramータ探索をスケーラブルに行う課題に対処すること。
  • 単純なスカラライゼーションが、計算コストを削減しつつも、複雑なMTO手法を同等または上回る性能を達成できるかどうかを評価すること。

提案手法

  • 複数のビジョンベンチマーク、モデルアーキテクチャ(ViT-S/4からフルワイドViTまで)およびタスク/ドメインの組み合わせを対象とした、スカラライゼーションの包括的で大規模な実験的分析を実施。
  • 高次元のハイパーパramータ空間を効率的に探索するため、パopULATIONベースのトレーニング(PBT)を用いてスカラライゼーション重みを体系的に変化させる。
  • 損失に基づく(例:不確実性、IMTL-L)および勾配に基づく(例:CAGrad、PCGrad)最新のMTO手法とスカラライゼーションを比較。
  • 勾配の衝突が層ごとおよび学習率ごとにどのように変化するかを分析し、タスク干渉の役割を評価。
  • 多数のタスクを含む設定においてPBTを用いて最適なスカラライゼーション重みを探索し、コストを削減しながらも性能を維持。
  • 統計的妥当性を確保するため、複数の指標と標準偏差を用いて結果を報告。
Figure 1: Table (a) summarizes the experimental setups used throughout the paper. Figure (b) reports profiling results for popular multi-task optimization (MTO) methods in a small-scale (ResNet18, batch size 16) and large-scale (ResNet50, size 128) setting, for 224px inputs: In practice, we find tha
Figure 1: Table (a) summarizes the experimental setups used throughout the paper. Figure (b) reports profiling results for popular multi-task optimization (MTO) methods in a small-scale (ResNet18, batch size 16) and large-scale (ResNet50, size 128) setting, for 224px inputs: In practice, we find tha

実験結果

リサーチクエスチョン

  • RQ1モデル容量が、スカラライゼーションによるマルチタスクおよびマルチドメイン学習のパフォーマンス向上にどのように影響するか?
  • RQ2不均衡なマルチタスクおよびマルチドメイン設定において、最適なスカラライゼーション重みがどれほどパフォーマンスを向上させるか?
  • RQ3勾配の衝突は層や学習率に応じてどのように変化するか?また、それらはタスク干渉と相関しているか?
  • RQ4パopULATIONベースのトレーニングは、大規模なマルチタスクおよびマルチドメイン学習における最適なスカラライゼーション重みを効率的に特定できるか?
  • RQ5均一なスカラライゼーション(等価重み)は、複雑なMTO手法と同等の性能を示すか?それとも重みチューニングが不可欠か?

主な発見

  • より大きなモデル容量では、マルチタスクおよびマルチドメイン学習の恩恵が顕著に増幅され、モデルサイズが大きくなるほどパフォーマンス向上が著しく顕著になる。
  • 不均衡な設定における高性能なマルチタスクおよびマルチドメイン学習には、最適なスカラライゼーション重みが不可欠であるが、同じアーキテクチャファミリー内では重みの相対的な順位は一貫している。
  • タスクやドメイン間の勾配の衝突は、トレーニング中に自然かつ持続的に発生する現象であり、モデル容量やスカラライゼーション重みの選択にほとんど影響されない。
  • パopULATIONベースのトレーニング(PBT)は、最適なスカラライゼーション重みの効率的かつ効果的な探索を可能にし、複雑なMTO手法と同等のパフォーマンスを達成しながら計算コストを削減できる。
  • 学習された重みを用いたスカラライゼーションは、均一なスカラライゼーションを上回り、CAGrad や PCGrad などの最先端のMTO手法をすべてのベンチマークおよびモデルサイズで同等または上回る性能を示す。
  • スカラライゼーションのパフォーマンスは重みチューニングに極めて敏感であり、特に不均衡な設定では、重みのわずかな変更ですら顕著なパフォーマンスの変動を引き起こす。
Figure 2: Performance of scalarization for MDL/MTL relative to SD under different model capacities; Each column corresponds to a different task/domain pair ( $T=2$ ). The first row of each plot contains a heatmap of the best performing scalarization weights $p^{\ast}$ wrt. to the average test accura
Figure 2: Performance of scalarization for MDL/MTL relative to SD under different model capacities; Each column corresponds to a different task/domain pair ( $T=2$ ). The first row of each plot contains a heatmap of the best performing scalarization weights $p^{\ast}$ wrt. to the average test accura

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。