Skip to main content
QUICK REVIEW

[論文レビュー] Revisiting Scalarization in Multi-Task Learning: A Theoretical Perspective

Yuzheng Hu, Ruicheng Xian|arXiv (Cornell University)|Aug 27, 2023
Machine Learning and Data Classification被引用数 5
ひとこと要約

本論文は、多タスク学習における線形スカラライゼーションの理論的分析を提供し、実行可能な領域におけるマルチサーフェス構造のため、特にバランスの取れたトレードオフを完全に探索できないという根本的な限界を明らかにしている。著者らは、完全な探索が可能となる必要十分条件を確立し、特化型多タスク最適化手法(SMTO)がスカラライゼーションでは到達できない解を発見できることを示しており、実世界のデータを用いた実験でも裏付けられている。

ABSTRACT

Linear scalarization, i.e., combining all loss functions by a weighted sum, has been the default choice in the literature of multi-task learning (MTL) since its inception. In recent years, there is a surge of interest in developing Specialized Multi-Task Optimizers (SMTOs) that treat MTL as a multi-objective optimization problem. However, it remains open whether there is a fundamental advantage of SMTOs over scalarization. In fact, heated debates exist in the community comparing these two types of algorithms, mostly from an empirical perspective. To approach the above question, in this paper, we revisit scalarization from a theoretical perspective. We focus on linear MTL models and study whether scalarization is capable of fully exploring the Pareto front. Our findings reveal that, in contrast to recent works that claimed empirical advantages of scalarization, scalarization is inherently incapable of full exploration, especially for those Pareto optimal solutions that strike the balanced trade-offs between multiple tasks. More concretely, when the model is under-parametrized, we reveal a multi-surface structure of the feasible region and identify necessary and sufficient conditions for full exploration. This leads to the conclusion that scalarization is in general incapable of tracing out the Pareto front. Our theoretical results partially answer the open questions in Xin et al. (2021), and provide a more intuitive explanation on why scalarization fails beyond non-convexity. We additionally perform experiments on a real-world dataset using both scalarization and state-of-the-art SMTOs. The experimental results not only corroborate our theoretical findings, but also unveil the potential of SMTOs in finding balanced solutions, which cannot be achieved by scalarization.

研究の動機と目的

  • 線形スカラライゼーションが多タスク学習において理論的にパレートフロントを完全に探索できるかを調査すること。
  • 矛盾するタスク間のバランスの取れたトレードオフを捉えることにおけるスカラライゼーションの根本的限界を特定すること。
  • 非凸設定下でスカラライゼーションがパレートフロント全体を探索可能となるために必要な必要十分条件を提供すること。
  • スカラライゼーションと特化型多タスク最適化手法(SMTO)の理論的・実験的性能を比較すること。
  • スカラライゼーションの固有の限界を部分的に克服するためのランダム化ベースの手法を提案し、実証すること。

提案手法

  • 線形多タスクモデルにおける実行可能領域の理論的分析により、スカラライゼーションを制限するマルチサーフェス構造を同定する。
  • 任意のパレート最適解に到達可能なスカラライゼーションのための必要十分条件を、勾配の不一致とタスク固有の損失幾何学に基づいて導出する。
  • 特異値分解(SVD)を用いて、トレーニングを伴わずにスカラライズド目的関数の最適解を計算し、重み空間全体の効率的評価を可能にする。
  • SARCOSロボット制御データセット上での最先端SMTO(MGDAとMGDA-UB)の実装と比較。
  • ランダム化スカラライゼーション戦略:独立に最適化された2つのモデルをランダムな重みで凸結合することで、達成可能な領域を拡大する。
  • 100,000個のサンプル重みベクトルと300回のランダム初期化を用いた実験的評価により、解のカバレッジと耐性を評価する。

実験結果

リサーチクエスチョン

  • RQ1線形モデルにおける多タスク学習において、線形スカラライゼーションはパレートフロントを完全に探索できるか?
  • RQ2スカラライゼーションが任意のパレート最適解に到達できるための必要十分条件は何か?
  • RQ3最適ハイパーパrameterを用いても、なぜスカラライゼーションはバランスの取れたトレードオフ解を発見できないのか?
  • RQ4MGDA や MGDA-UB などの SMTO は、いかなるスカラライゼーションでも到達できない解を達成するのか?
  • RQ5スカラライズドモデルのランダム化により、完全な探索能力を回復できるか?

主な発見

  • 実行可能領域に存在するマルチサーフェス構造のため、スカラライゼーションは根本的にパレートフロントを完全に探索できない。特に勾配の不一致が存在する場合には顕著である。
  • 完全な探索が可能となる必要十分条件は一般には満たされておらず、特に線形モデルであってもバランスの取れたトレードオフ解では成立しない。
  • SARCOSデータセット上での実験により、MGDA および MGDA-UB はスカラライゼーションが到達できないパレートフロントの内部に位置する解を一貫して発見している。
  • 2つの独立に最適化されたモデルをランダムに結合するランダム化線形スカラライゼーションは、パレートフロントのギャップを効果的に埋めることができ、理論的分析の妥当性を裏付けた。
  • SMTOはスカラライゼーションを上回り、バランスの取れた解を発見する点で根本的な優位性を示しており、これは経験的ハイパーパramータチューニングの範囲を超える。
  • スカラライゼーションの失敗は非凸性に起因するのではなく、実行可能領域の幾何的構造的限界に起因する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。