Skip to main content
QUICK REVIEW

[論文レビュー] Passage Ranking with Weak Supervision

Peng Xu, Xiaofei Ma|arXiv (Cornell University)|May 15, 2019
Topic Modeling参考文献 18被引用数 16
ひとこと要約

本論文は、データプログラミングを用いて、人間によるアノテーションラベルなしで、BM25スコアや意味的類似度といった多様な信号を活用して、BERTベースのモデルを訓練する弱い監督フレームワークを提案する。この手法は、3つのベンチマークデータセットにおいて最先端の性能を達成し、人間ラベルが一切使われていないにもかかわらず、2つのデータセットでBM25および従来の完全監督モデルを上回った。

ABSTRACT

In this paper, we propose a extit{weak supervision} framework for neural ranking tasks based on the data programming paradigm \citep{Ratner2016}, which enables us to leverage multiple weak supervision signals from different sources. Empirically, we consider two sources of weak supervision signals, unsupervised ranking functions and semantic feature similarities. We train a BERT-based passage-ranking model (which achieves new state-of-the-art performances on two benchmark datasets with full supervision) in our weak supervision framework. Without using ground-truth training labels, BERT-PR models outperform BM25 baseline by a large margin on all three datasets and even beat the previous state-of-the-art results with full supervision on two of the datasets.

研究の動機と目的

  • 情報検索および読解理解における大規模ラベル付きランク付けデータセットの作成にかかる高コストを軽減すること。
  • 複数のソースからの弱い監督信号(例:BM25、意味的特徴)が、人間による関連性ラベルなしでニューラルランク付けモデルを効果的に訓練できるかどうかを検討すること。
  • パassageランク付けタスクに特化したデータプログラミングベースのフレームワークを開発すること。
  • 弱い監督によるBERTモデルが、完全監督ベースラインを上回る性能を達成できるかどうかを評価すること。

提案手法

  • ランク付けを二値関連性ラベル付与タスクに変換することで、データプログラミングのパラダイム(Ratner et al., 2016)をパassageランク付けに適応する。
  • 弱い監督信号として2種類の信号を採用:非教師付きランクスコア(BM25、TF-IDF)と事前学習モデルからの意味的特徴類似度。
  • ラベル関数を用いてクエリ-パassageペアに対してノイズの多い二値ラベルを生成し、その後で多数決(MV)または幾何平均(GM)を用いてより信頼性の高い偽ラベルに集約する。
  • 集約された偽ラベルに基づき、ペairワイズのヘッジ損失を用いてBERTベースのパassageランク付けモデル(BERT-PR)を訓練する。[CLS]トークンの埋め込みに2層の全結合ネットワークを適用する。
  • 幾何平均によるラベル関数出力の信頼性スコアを用いたノイズに強い学習を実施したが、性能向上は限定的であった。

実験結果

リサーチクエスチョン

  • RQ1複数の異なるソース(例:BM25、意味的特徴)からの弱い監督信号が、人間によるラベルなしでニューラルパassageランク付けモデルを効果的に訓練できるか?
  • RQ2弱い監督によるBERTベースのモデルが、BM25ベースラインを上回り、かつ従来の完全監督で学習された最先端モデルをも凌駆できるか?
  • RQ3単一の信号(例:BM25)に依存するのと比較して、多数の弱い信号を(MV や GM を用いて)集約することはどれほど有効か?
  • RQ4ラベル関数からの信頼性スコアを組み込むことで、弱い監督におけるモデル性能が向上するか?

主な発見

  • 弱い監督によるBERT-PRモデルは、3つのデータセットにおいて平均してトップ1の正確度で20%の相対的改善を達成し、BM25ベースラインを上回った。
  • WikipassageQAおよびInsuranceQA_v2データセットでは、弱い監督モデルが新たな最先端性能を達成し、従来の完全監督モデルを上回った。
  • 弱い信号の幾何平均(GM)集約により、BM25単体で学習した場合と比較してP@1で10%の相対的改善が得られた。
  • 弱い監督で学習したモデルは、WikipassageQA(テスト)でMAP 62.58を達成し、完全監督で学習した従来の最先端モデル(56.08)を上回った。
  • 信頼性スコアを用いたノイズに強い学習は、性能向上が限定的であったため、現在の信頼性推定方法が最適ではない可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。