[論文レビュー] Task Selection Policies for Multitask Learning
本稿では、マルチタスク学習(MTL)における限られた訓練予算をタスク間で動的に割り当てることでモデル性能を向上させる、反事後推定に基づくタスク選択方針を提案する。オフポリシー評価を用いてタスクの最適なサンプリング分布を学習することで、GLUEベンチマークにおいてタスク固有のファインチューニングに近い性能を達成し、均等配分およびデータサイズに比例する方針を上回る性能を発揮する。
One of the questions that arises when designing models that learn to solve multiple tasks simultaneously is how much of the available training budget should be devoted to each individual task. We refer to any formalized approach to addressing this problem (learned or otherwise) as a task selection policy. In this work we provide an empirical evaluation of the performance of some common task selection policies in a synthetic bandit-style setting, as well as on the GLUE benchmark for natural language understanding. We connect task selection policy learning to existing work on automated curriculum learning and off-policy evaluation, and suggest a method based on counterfactual estimation that leads to improved model performance in our experimental settings.
研究の動機と目的
- マルチタスク学習の文脈において、複数のNLPタスクに限られた訓練予算をどのように割り当てるかという課題に対処すること。
- 単一タスクのファインチューニングと比較してMTLで性能低下が生じるのをタスク選択方針が緩和できるかどうかを調査すること。
- オフポリシー評価の文脈において、タスク選択と自動カリキュラム学習の関連性を探索すること。
- 反事後推定を用いて最適なタスクサンプリング方針を学習し、MTLの一般化性能を向上させる手法を開発・評価すること。
- 学習済み方針が、データサイズが異なる多様なNLPタスクにおいて、タスク固有のファインチューニング性能に近づけるかどうかを実証すること。
提案手法
- 各タスクを学習確率に従ってサンプリングする確率的方針学習問題としてタスク選択を定式化する。
- 反事後推定(Bottouら、2012)を用いて、再訓練なしに方針の期待性能を評価し、オフポリシー学習を可能にする。
- 方針最適化を促進するため、個々の例におけるモデル性能に基づく代替的サンプルレベル報酬信号を定義する。
- 低利便性タスクに過剰適合を防ぐために、エントロピー項を含む正則化された目的関数を最適化する。
- バンディットスタイルの設定で、初期の4回のロールアウト(ハイパーパramータチューニングを含む)を用いて方針を学習する。
- 学習済み方針を用いてBERTをGLUEベンチマークでファインチューニングし、均等配分およびデータサイズに比例する方針と性能を比較する。
実験結果
リサーチクエスチョン
- RQ1学習済みタスク選択方針は、均等配分やデータサイズに比例するサンプリングといったヒューリスティック方針を上回る性能を示せるか?
- RQ2反事後推定に基づく方針は、合成的および現実世界のNLPベンチマークにおいて、ランダム方針やカリキュラムベース方針と比較してどの程度優れているか?
- RQ3完全な再訓練なしに、反事後推定によるオフポリシー評価を用いてMTLにおけるタスクサンプリング戦略を最適化できるか、その限界は何か?
- RQ4学習済み方針は、特にデータ量が少ないタスクを効果的にバランスさせるか、すなわち反カリキュラム行動を示しているか?
- RQ5本手法は、GLUEのような現実世界のベンチマークに一般化可能であり、タスク固有のファインチューニング性能に近い性能を維持できるか?
主な発見
- 反事後推定に基づく方針($\pi^{\textsc{c}}$)は、GLUE開発セットで87.0のスコアを達成し、均等配分およびデータサイズに比例する方針を上回り、タスク固有のファインチューニング性能に近づいた。
- GLUEテストセットでは、$\pi^{\textsc{c}}$を用いたMTLモデルが77.9のスコアを達成し、タスク固有のファインチューニングされたBERTの78.3に非常に近い性能を示した。
- 学習済み方針は、データ量が少ないタスク(例:CoLA、RTE、MRPC)に対して高いサンプリング確率を割り当てており、効果的な反カリキュラム行動を示している。
- STS-BとSST-2の訓練セットサイズに10倍の差があるにもかかわらず、サンプリング確率はそれぞれ0.102と0.094とほぼ同等であり、方針がデータサイズを超えたタスクの難易度を捉えていることが示された。
- RTEでは、ベースラインの66.4から74.5に性能が向上した一方で、QNLIとSST-2でも競争力のある結果が得られた。
- 本手法は、有効な方針を学習するためにたった4回の訓練ラン(ハイパーパramータチューニングを含む)で実現可能であり、方針最適化におけるサンプル効率が優れていることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。