Skip to main content
QUICK REVIEW

[論文レビュー] Optimizing Data Usage via Differentiable Rewards

Xinyi Wang, Hieu Pham|arXiv (Cornell University)|Nov 22, 2019
Domain Adaptation and Few-Shot Learning参考文献 60被引用数 4
ひとこと要約

本稿では、学習済みモデルの勾配と開発セットの勾配の整合性に基づいて、動的に訓練データの重みを割り当てる学習可能なスコアラーを訓練する強化学習フレームワーク、Differentiable Data Selection (DDS) を提案する。この手法により、ヒューリスティックな設計や高コストな複数回の訓練を必要とせず、効率的かつエンドツーエンドでデータ使用を最適化できる。画像分類および多言語ニューラル機械翻訳のタスクにおいて、強力なベースラインを常に上回る性能向上を達成する。

ABSTRACT

To acquire a new skill, humans learn better and faster if a tutor, based on their current knowledge level, informs them of how much attention they should pay to particular content or practice problems. Similarly, a machine learning model could potentially be trained better with a scorer that "adapts" to its current learning state and estimates the importance of each training data instance. Training such an adaptive scorer efficiently is a challenging problem; in order to precisely quantify the effect of a data instance at a given time during the training, it is typically necessary to first complete the entire training process. To efficiently optimize data usage, we propose a reinforcement learning approach called Differentiable Data Selection (DDS). In DDS, we formulate a scorer network as a learnable function of the training data, which can be efficiently updated along with the main model being trained. Specifically, DDS updates the scorer with an intuitive reward signal: it should up-weigh the data that has a similar gradient with a dev set upon which we would finally like to perform well. Without significant computing overhead, DDS delivers strong and consistent improvements over several strong baselines on two very different tasks of machine translation and image classification.

研究の動機と目的

  • 機械学習における最適でないデータ使用の課題に対処すること。具体的には、訓練データの分布とテストデータの分布が異なることが一般化性能の低下を引き起こす要因となること。
  • データ選択、重み付け、カリキュラム学習に依存する手作業で設計されたヒューリスティクスやタスク固有のルールを排除すること。
  • 学習中に適応し、開発セットでの性能を向上させる、一般化可能で効率的なデータ使用最適化手法を開発すること。
  • モデルの学習状態に応じて自動的かつ動的に重み付けを変化させる仕組みを提供し、複数回の訓練走行を必要としないこと。

提案手法

  • 訓練例の重み付けを、スコアラー・ネットワークによってパrameter化された微分可能関数として定式化。このスコアラーは主モデルと共に学習される。
  • 訓練例と開発セットとの間の勾配整合性を報酬信号として用い、スコアラーの最適化を誘導する。
  • スコアラーが開発セットにおけるモデルの損失を直接微分することで最小化する二段階最適化フレームワークを採用する。
  • スコアラー・ネットワークを効率的に勾配伝播できるように、微分可能更新ルールを介して報酬信号を適用する。
  • 具体的な2つの実装例を提示:1つは画像分類(CIFAR-10、ImageNet)用、もう1つは多言語ニューラル機械翻訳用。
  • 最近の勾配ベースのメタラーニングおよび補助タスク学習の進展を活用し、安定的かつ効果的な報酬関数を定義する。

実験結果

リサーチクエスチョン

  • RQ1学習可能なスコアラー・ネットワークをエンドツーエンドで訓練し、開発セットの性能向上に寄与するように動的に訓練データの重みを割り当てることは可能か?
  • RQ2手作業で設計されたヒューリスティクスや複数回の訓練走行に依存せずに、データの関連性を反映する報酬信号をどのように設計できるか?
  • RQ3提案された微分可能フレームワークは、画像分類やニューラル機械翻訳といった多様なタスクに一般化可能か?
  • RQ4訓練データと開発データの例との間の勾配整合性は、データの有用性の信頼性があり効果的な代理指標として機能するか?

主な発見

  • DDS は、画像分類および多言語ニューラル機械翻訳の両タスクにおいて、強力なベースラインを一貫してかつ顕著に上回る性能向上を達成する。
  • 画像分類において、Ren ら (2018) のヒューリスティクスベースおよびメタラーニングベースのベースラインを大きく上回る。
  • 多言語NMTでは、関連する言語(例:スロバキア語の学習時にチェコ語に焦点を当てる)のデータを優先的に学習し、学習過程に応じて動的に適応する。
  • データ重み付け戦略は時間経過とともに変化し、モデルは学習段階に応じて異なる言語ペアやデータタイプに注目を移す。
  • 追加の訓練走行や高コストな複数回最適化を一切必要とせず、計算的に効率的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。