Skip to main content
QUICK REVIEW

[論文レビュー] Data Programming using Semi-Supervision and Subset Selection.

Ayush Maheshwari, Oishik Chatterjee|arXiv (Cornell University)|Aug 22, 2020
Machine Learning and Algorithms参考文献 17被引用数 5
ひとこと要約

本稿では、ラベル関数からの弱い監視信号と未ラベルデータの両方を活用することでモデル性能を向上させる、データプログラミングと半教師あり学習を統合した共同学習フレームワークを提案する。さらに、高品質なラベル付き例を特定するサブセット選択戦略を導入し、合成データおよび実世界のデータセットで最先端の性能を示している。

ABSTRACT

The paradigm of data programming~\cite{bach2019snorkel} has shown a lot of promise in using weak supervision in the form of rules and labelling functions to learn in scenarios where labelled data is not available. Another approach which has shown a lot of promise is that of semi-supervised learning where we augment small amounts of labelled data with a large unlabelled dataset. In this work, we argue that by not using any labelled data, data programming based approaches can yield sub-optimal performance, particularly, in cases when the labelling functions are noisy. The first contribution of this work is to study a framework of joint learning which combines un-supervised consensus from labelling functions with semi-supervised learning and \emph{jointly learns a model} to efficiently use the rules/labelling functions along with semi-supervised loss functions on the feature space. Next, we also study a subset selection approach to \emph{select} the set of examples which can be used as the labelled set. We evaluate our techniques on synthetic data as well as four publicly available datasets and show improvement over state-of-the-art techniques\footnote{Source code of the paper at \url{this https URL}}.

研究の動機と目的

  • ラベル付きデータが一切使用されない状況におけるデータプログラミングの性能劣化を是正すること、特にノイズの多いラベル関数の下で。
  • ラベル関数からの非教師ありコンセンサスと半教師あり学習を統合し、モデルの一般化性能を向上させること。
  • 信頼性の高い例を特定・使用するためのサブセット選択手法を開発し、訓練の質を向上させること。
  • 提案フレームワークの性能を、合成データおよび実世界のデータセット上で評価し、最先端手法を上回ることを検証すること。

提案手法

  • 特徴空間におけるラベル関数のコンセンサスと半教師あり損失関数を統合した共同学習目的関数を定式化する。
  • 未ラベルデータを用いて、弱い監視信号と特徴空間内の構造の両方を活用するモデルを学習する。
  • 高信頼度の例のサブセットを特定するためのサブセット選択メカニズムを適用する。
  • ラベル関数の重みとモデルパラメータを同時に最適化できる、エンドツーエンド微分可能な訓練を用いて共同目的関数を最適化する。
  • モデルの不確実性とラベル関数間の一貫性を活用し、サブセット選択を誘導する。
  • 全未ラベルデータセットからの半教師あり正則化を組み込みつつ、選択されたサブセットで最終モデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1ラベル付きデータが存在しない状況において、データプログラミングと半教師あり学習を統合することでモデル性能が向上するか?
  • RQ2ラベル関数の重みとモデルパラメータを同時に最適化する共同学習は、分離して最適化する場合と比較して性能にどのような影響を与えるか?
  • RQ3サブセット選択がラベル付きデータセットの品質と下流のモデル精度に与える影響は何か?
  • RQ4提案手法は多様なベンチマークデータセットにおいて、最先端技術と比較してどのように性能を発揮するか?
  • RQ5どのような状況下で、共同フレームワークが標準的なデータプログラミングや半教師あり学習単体よりも優れるか?

主な発見

  • 半教師あり学習による未ラベルデータの活用を通じて、標準的なデータプログラミングに比べて、共同学習フレームワークが顕著にモデル性能を向上させた。
  • サブセット選択手法は高品質な例を効果的に特定でき、ラベル付きデータセットのノイズ低減とより良い一般化性能を実現した。
  • 4つの公開データセットおよび合成データに対する実証的評価では、最先端手法を常に上回る改善が得られた。
  • 未ラベルデータとコンセンサスパターンを活用することで、ノイズの多いラベル関数に対してもフレームワークは頑健性を示した。
  • ラベル関数の重みとモデルパラメータを共同で最適化することで、逐次的または独立した学習に比べてより信頼性の高い予測が得られた。
  • 弱い監視と半教師あり学習の組み合わせは、単独で用いる場合よりも優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。