Skip to main content
QUICK REVIEW

[論文レビュー] Cynical Selection of Language Model Training Data

Amittai Axelrod|arXiv (Cornell University)|Sep 7, 2017
Topic Modeling参考文献 5被引用数 12
ひとこと要約

この論文では、言語モデルおよび機械翻訳システムの最適な学習データを選択するための、貪欲でエントロピーに基づく手法「cynical selection」を提案する。Moore-Lewisの交差エントロピー差分法の欠点を改善し、文のエントロピー増加分に応じて動的にスコアを付けることで、近似的に最適な語彙カバレッジ、自動停止、および実数値の単位(ビット)を達成し、ベースライン手法と比較してOOVトークンを80%削減する。

ABSTRACT

The Moore-Lewis method of "intelligent selection of language model training data" is very effective, cheap, efficient... and also has structural problems. (1) The method defines relevance by playing language models trained on the in-domain and the out-of-domain (or data pool) corpora against each other. This powerful idea-- which we set out to preserve-- treats the two corpora as the opposing ends of a single spectrum. This lack of nuance does not allow for the two corpora to be very similar. In the extreme case where the come from the same distribution, all of the sentences have a Moore-Lewis score of zero, so there is no resulting ranking. (2) The selected sentences are not guaranteed to be able to model the in-domain data, nor to even cover the in-domain data. They are simply well-liked by the in-domain model; this is necessary, but not sufficient. (3) There is no way to tell what is the optimal number of sentences to select, short of picking various thresholds and building the systems. We present a greedy, lazy, approximate, and generally efficient information-theoretic method of accomplishing the same goal using only vocabulary counts. The method has the following properties: (1) Is responsive to the extent to which two corpora differ. (2) Quickly reaches near-optimal vocabulary coverage. (3) Takes into account what has already been selected. (4) Does not involve defining any kind of domain, nor any kind of classifier. (6) Knows approximately when to stop. This method can be used as an inherently-meaningful measure of similarity, as it measures the bits of information to be gained by adding one text to another.

研究の動機と目的

  • Moore-Lewisの交差エントロピー差分法が、ドメイン内およびドメイン外のコーパスが互いに類似している場合に失敗し、原理的な停止基準を欠いているという問題を解決すること。
  • コーパスの差異に応じて柔軟に対応できるデータ選択手法を開発し、ドメイン定義や分類器に依存せず、実数値の単位(エントロピー変化のビット)で動作させること。
  • 語彙カバレッジを最大化しながらOOVトークンを最小限に抑えることのできる、自動的で効率的かつスケーラブルな訓練データ選択を可能にすること。
  • ハイパーパramータチューニング(例:データサイズのグリッドサーチ)の必要性を排除し、エントロピー増加分に基づいて最適な停止点を自動的に特定すること。

提案手法

  • 各文を学習セットに追加した際の代表的(ドメイン内)コーパスのエントロピー低減を最大化するように、逐次的に文を選び出す。
  • 各文のエントロピー低減の限界的利益(マージナルゲイン)に基づいてスコア付けする貪欲で、サブモジュラルな選択プロセスを採用し、選択されたデータが増えるにつれて利益が逓減することを保証する。
  • エントロピー変化の進行的推定を維持し、次に選ぶ文の期待ゲインが(そしてそのままで)正になる段階で停止する。
  • 重複を処理するため、各単語ごとに1回ずつだけ文を一意に選択し、重複の包含を防ぎつつ語彙の多様性を維持する。
  • 別個の言語モデルを訓練する必要がなく、ドメイン境界を定義する必要もない。代わりに、各候補文を追加する前後の代表コーパスのエントロピーを直接比較する。
  • エントロピー増加分に基づく特徴関数を用いる。これは解釈可能で、単位の一貫性(ビット単位)を保ち、異なるシステム間での比較を可能にする。

実験結果

リサーチクエスチョン

  • RQ1グリッドサーチやハイパーパramータチューニングを必要とせず、自動的にデータ選択を停止するタイミングを特定できるデータ選択手法を設計できるか?
  • RQ2ドメイン内およびドメイン外コーパスの差が小さい場合でも、実際にそれらの差の程度に応じて柔軟に対応できるデータ選択は可能か?
  • RQ3ドメイン固有の分類器やラベル付きデータに依存せず、ほぼ最適な語彙カバレッジを達成し、OOVトークンを最小限に抑えることは可能か?
  • RQ4実数値で解釈可能な単位(例:エントロピーのビット)を持つデータ選択手法を定義でき、異なるシステムやタスク間で比較可能か?
  • RQ5貪欲でエントロピーに基づく選択戦略はサブモジュラル性を満たし、近似的最適性に関する理論的保証を得られるか?

主な発見

  • Cynical selection手法は、Moore-Lewisの交差エントロピー差分法と比較して、OOVトークン率を約80%削減する。
  • この手法は、選択プロセスの初期段階でほぼ最適な語彙カバレッジを達成しており、主に代表コーパス内の各ユニーク語を少なくとも1回以上選択することで実現される。
  • アルゴリズムは、次に選ぶ文の限界的エントロピー増加分が(そしてそのままで)正になる段階を検出することで、最適な停止点を自動的に特定する。
  • この手法は本質的にサブモジュラルであるため、選択された文が増えるにつれて、新たな文を追加する際のインクリメンタルな利益が逓減し、理論的な効率性が保証される。
  • 関連性スコアは実数値の単位(エントロピー変化のビット)で表されるため、異なるモデル、システム、言語ペア間での直接比較が可能である。
  • ドメインの定義、データのラベル付け、補助モデルの学習を必要としないため、広く適用可能で計算的にも効率的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。