Skip to main content
QUICK REVIEW

[論文レビュー] Predicting the Effectiveness of Self-Training: Application to Sentiment Classification

Vincent Van Asch, Walter Daelemans|arXiv (Cornell University)|Jan 13, 2016
Topic Modeling参考文献 21被引用数 15
ひとこと要約

本稿では、自己学習がセンチメント分類のパフォーマンスを向上させるかどうかを予測するために、コーパス類似度測定—特にテスト・トレイン類似度—を用いることを提案する。Jensen-Shannonの差分などの類似度スコアを活用することで、高い精度で自己学習の効果を予測でき、テスト/トレイン類似度そのものが十分であり、しばしば最適な予測に十分であることが示された。

ABSTRACT

The goal of this paper is to investigate the connection between the performance gain that can be obtained by selftraining and the similarity between the corpora used in this approach. Self-training is a semi-supervised technique designed to increase the performance of machine learning algorithms by automatically classifying instances of a task and adding these as additional training material to the same classifier. In the context of language processing tasks, this training material is mostly an (annotated) corpus. Unfortunately self-training does not always lead to a performance increase and whether it will is largely unpredictable. We show that the similarity between corpora can be used to identify those setups for which self-training can be beneficial. We consider this research as a step in the process of developing a classifier that is able to adapt itself to each new test corpus that it is presented with.

研究の動機と目的

  • トレインデータとテストデータの分布が異なる場合に、自己学習がパフォーマンスを向上させる条件を特定すること。
  • コーパス類似度が、自己学習の成功または失敗を信頼性高く予測できるかを調査すること。
  • 利用可能なすべてのラベルなしデータを含めるのではなく、最も類似した1つの未ラベル付きコーパスを選択することが、より優れているかを評価すること。
  • 類似度測定(例:コサイン類似度、KL発散、JS発散)が自己学習の結果を予測するのにどの程度有効かを評価すること。
  • ドメイン適応に最適なデータを選択できる自己適応型分類器の開発を支援すること。

提案手法

  • 2段階の自己学習手順を用いる:まずラベル付きデータで学習し、未ラベル付きデータのラベルを予測した後、ラベル付きデータと疑似ラベル付きデータを組み合わせて再学習する。
  • コサイン距離、Kullback-Leibler発散、Jensen-Shannon発散といった複数の類似度測定を用い、トレイン、テスト、および追加の(未ラベル付き)コーパス間の類似度を定量化する。
  • 類似度特徴に基づいて自己学習パフォーマンスを予測するため、教師ありおよび教師なしの予測モデルを適用する。
  • 予測力の評価のために、テスト/トレイン類似度のみを特徴量として使用するリーブ・ワン・アウト実験を実施する。
  • モデルのパフォーマンスを評価するために、マクロ平均Fスコアおよび『利益』予測(POSクラス)の精度を用いる。
  • 類似度測定を用いてベクトル空間におけるコーパスの関係を可視化し、解釈可能性を高める。

実験結果

リサーチクエスチョン

  • RQ1コーパス類似度は、センチメント分類における自己学習がパフォーマンス向上をもたらすかどうかを予測できるか?
  • RQ2追加の未ラベル付きデータを含む類似度と比較して、テストとトレインコーパス間の類似度はより有用な予測子であるか?
  • RQ3複数の類似度測定を用いることで、テスト/トレイン類似度のみを用いる場合と比較して、自己学習の有効性の予測が向上するか?
  • RQ4コサイン、KL、JS発散といった類似度測定のうち、どの測定が自己学習の利益予測において最も正確か?
  • RQ5テストデータに対して類似度が最も高い未ラベル付きコーパスを自動的に分類器が選択できるか?

主な発見

  • テスト/トレイン類似度のみが非常に有用であり、しばしば自己学習の利益予測に十分で、複数の類似度特徴を用いたモデルを上回る性能を示した。
  • Jensen-Shannon発散は、自己学習成功の予測における精度と特異度の観点で、他の測定と比較して一貫して優れていた。
  • 3つの類似度特徴(テスト/トレイン、テスト/追加、追加/トレイン)を用いることで、真陽性の数(予測された利益ケース)は増加するが、特にKullback-Leibler発散では偽陽性も増加する傾向にある。
  • コサイン距離の場合、追加の特徴を追加すると真陽性よりも偽陽性が多くなるため、マクロ平均Fスコアが低下する。
  • 特定のテスト/トレイン組み合わせに対して事前データがない場合、テストとトレインコーパス間の類似度が自己学習の結果を予測する上で最も信頼できる予測子である。
  • 結果から、ドメイン類似度がドメイン適応において重要な要因であることが示され、標準化された類似度測定があれば、適応手法の客観的評価が著しく向上する可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。