Skip to main content
QUICK REVIEW

[論文レビュー] Improving Multi-Task Generalization via Regularizing Spurious Correlation

Ziniu Hu, Zhe Zhao|arXiv (Cornell University)|May 19, 2022
Domain Adaptation and Few-Shot Learning被引用数 13
ひとこと要約

本稿では、共有表現を因果モジュールと非因果的要因に分離し、不変リスク正則化を用いて誤った相関関係を抑制することで、マルチタスク学習の一般化性能を向上させる、マルチタスク因果表現学習(MT-CRL)というフレームワークを提案する。分布シフトにわたって一貫して有用な特徴を優先する、タスク固有のルーティング重みを学習することで、5つのベンチマークで平均5.5%の性能向上を達成した。

ABSTRACT

Multi-Task Learning (MTL) is a powerful learning paradigm to improve generalization performance via knowledge sharing. However, existing studies find that MTL could sometimes hurt generalization, especially when two tasks are less correlated. One possible reason that hurts generalization is spurious correlation, i.e., some knowledge is spurious and not causally related to task labels, but the model could mistakenly utilize them and thus fail when such correlation changes. In MTL setup, there exist several unique challenges of spurious correlation. First, the risk of having non-causal knowledge is higher, as the shared MTL model needs to encode all knowledge from different tasks, and causal knowledge for one task could be potentially spurious to the other. Second, the confounder between task labels brings in a different type of spurious correlation to MTL. We theoretically prove that MTL is more prone to taking non-causal knowledge from other tasks than single-task learning, and thus generalize worse. To solve this problem, we propose Multi-Task Causal Representation Learning framework, aiming to represent multi-task knowledge via disentangled neural modules, and learn which module is causally related to each task via MTL-specific invariant regularization. Experiments show that it could enhance MTL model's performance by 5.5% on average over Multi-MNIST, MovieLens, Taskonomy, CityScape, and NYUv2, via alleviating spurious correlation problem.

研究の動機と目的

  • タスク間の相関が弱い場合に、特に誤った相関関係によって引き起こされる一般化の失敗を解消すること。
  • マルチタスク学習(MTL)が、ラベル同士の交絡要因と共有表現エンコーディングの影響により、非因果的知識を他のタスクから学習しやすいことの特定。
  • マルチタスク表現における因果的知識と非因果的知識を分離することで、分布シフト下でも耐性のあるモデルを構築するフレームワークの開発。
  • ルーティング重みが環境に依存せず安定するよう保証するため、MTL特有の不変性正則化を定式化・適用すること。
  • マルチタスク学習における誤った相関関係は、特徴-ラベルの交絡要因だけでなく、タスク-ラベルの交絡要因にも起因することを示し、それらに特化した緩和戦略の必要性を明らかにすること。

提案手法

  • 因果的知識と非因果的知識を分離するため、分離されたニューラルモジュールを用いたMixture-of-Experts(MoE)アーキテクチャを用いてMTLモデルを構築する。
  • 関連するモジュールの使用を促進するために、タスクからモジュールへのルーティング重みにL1正則化を適用する。
  • 特定のモジュールが全タスクで優位に機能しないように防ぐために、バランス正則化を導入する。
  • 因果的に関連のないモジュール間で共有される特徴を最小限に抑えるために、相関除去損失を用いて表現の分離を強制する。
  • 異なるデータ分布におけるルーティング重みの勾配の分散をペナルティ化することで、不変性正則化を実装し、因果的関連のあるモジュールの一貫した使用を促進する。
  • すべての正則化項を一度に最適化し、データセット間で同一のハイパーパrameterセットを用いてエンドツーエンドでモデルを学習することで、公平な比較と一般化の確保を図る。

実験結果

リサーチクエスチョン

  • RQ1なぜマルチタスク学習は、訓練損失が低いにもかかわらず、単一タスク学習よりも一般化性能が悪くなることがあるのか?
  • RQ2MTLにおけるラベル同士の交絡要因が、一般化性能を損なう誤った相関関係をどのように導入するのか?
  • RQ3分離された表現学習と不変性正則化を組み合わせることで、マルチタスクモデルにおける誤った相関関係を緩和できるか?
  • RQ4ルーティング重みに対する不変リスク正則化は、MTLにおける分布シフトに対する耐性をどの程度向上させられるか?
  • RQ5提案されたMT-CRLフレームワークは、タスク相関やデータ分布が異なる多様なMTLベンチマークにおいても有効に機能するか?

主な発見

  • MT-CRLは、Multi-MNIST、MovieLens、Taskonomy、CityScape、NYUv2の5つのベンチマークで、平均5.5%の性能向上を達成した。
  • 本手法は、ベースラインのvanilla MTLを著しく上回り、Multi-MNISTでは6.9%の絶対的向上(正解率0.915 vs. 0.846)を達成した。
  • 実験結果から、スパarsity正則化、バランス正則化、相関除去、不変性正則化の各成分が、それぞれの欠如状態と比較して性能向上に寄与していることが示された。
  • 感度分析により、MT-CRLはハイパーパramータの選択に対して頑健であることが確認され、最適でない設定下でも性能がわずかに低下するにとどまった。
  • 不変性正則化により、誤った相関に依存するモジュールが効果的に抑制され、分布シフトにわたって安定したルーティング重みが得られた。
  • 特に標準的なMTLが失敗する低相関MTL設定において、非因果的知識の伝達リスクを効果的に緩和できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。