Skip to main content
QUICK REVIEW

[논문 리뷰] Passage Ranking with Weak Supervision

Peng Xu, Xiaofei Ma|arXiv (Cornell University)|2019. 05. 15.
Topic Modeling참고 문헌 18인용 수 16
한 줄 요약

이 논문은 인간 레이블이 없는 데이터를 사용하여 BERT 기반 모델을 훈련하기 위해 데이터 프로그래밍을 활용한 약한 감독 프레임워크를 제안한다. 다양한 신호, 예를 들어 BM25 점수와 의미 유사도를 활용하여 신경 passage 순서 매기기 모델을 훈련한다. 이 방법은 세 가지 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 인간의 참값 레이블이 전혀 없는 상태에서도 BM25 및 이전의 완전한 감독 모델보다 두 데이터셋에서 뛰어난 성능을 보였다.

ABSTRACT

In this paper, we propose a extit{weak supervision} framework for neural ranking tasks based on the data programming paradigm \citep{Ratner2016}, which enables us to leverage multiple weak supervision signals from different sources. Empirically, we consider two sources of weak supervision signals, unsupervised ranking functions and semantic feature similarities. We train a BERT-based passage-ranking model (which achieves new state-of-the-art performances on two benchmark datasets with full supervision) in our weak supervision framework. Without using ground-truth training labels, BERT-PR models outperform BM25 baseline by a large margin on all three datasets and even beat the previous state-of-the-art results with full supervision on two of the datasets.

연구 동기 및 목표

  • 정보 검색 및 독해 이해 분야에서 대규모 레이블이 부여된 순서 매기기 데이터셋을 구축하는 데 드는 높은 비용을 해결하기 위해.
  • 다양한 출처의 약한 감독 신호(예: BM25, 의미 특징)가 인간이 레이블을 부여한 관련성 레이블 없이도 신경 순서 매기기 모델을 효과적으로 훈련시킬 수 있는지 탐색하기 위해.
  • passage 순서 매기기 작업에 특화된 데이터 프로그래밍 기반 프레임워크를 개발하기 위해.
  • 약한 감독을 통한 BERT 기반 모델이 완전한 감독으로 훈련된 기존 최고 성능 모델을 초월할 수 있는지 평가하기 위해.

제안 방법

  • 정보 검색의 순서 매기기 문제를 이진 관련성 레이블링 문제로 변환함으로써 데이터 프로그래밍의 개념(Ratner et al., 2016)을 passage 순서 매기기 작업에 적용한다.
  • 약한 감독 신호 두 가지 유형을 사용한다: 비지도 순서 매기기 점수(BM25, TF-IDF)와 사전 학습된 모델에서 유도한 의미 특징 유사도.
  • 레이블링 함수를 통해 질의-패스지 쌍에 대해 노이즈가 포함된 이진 레이블을 생성하고, 이를 다수결 투표(MV) 또는 기하 평균(GM)을 통해 집계하여 더 신뢰할 수 있는 가짜 레이블을 생성한다.
  • 집계된 가짜 레이블을 기반으로 쌍별 허지 손실(pairwise hinge loss)을 사용하여 BERT 기반 passage 순서 매기기 모델(BERT-PR)을 훈련하며, [CLS] 토큰 임베딩에 두 층의 피드포워드 네트워크를 적용한다.
  • 기하 평균 출력의 신뢰도 점수를 활용한 노이즈 인식 훈련을 적용하였지만, 성능 향상은 제한적이었다.

실험 결과

연구 질문

  • RQ1다양한 출처에서 온 약한 감독 신호(예: BM25, 의미 특징)가 인간 레이블이 없는 상태에서 신경 passage 순서 매기기 모델을 효과적으로 훈련시킬 수 있는가?
  • RQ2약한 감독을 통한 BERT 기반 모델이 BM25 베이스라인을 초월하고 이전의 완전한 감독으로 훈련된 최고 성능 모델을 뛰어넘을 수 있는가?
  • RQ3단일 신호(예: BM25)만 사용하는 것과 비교해 다수의 약한 신호를 집계하는 방식(MV 또는 GM)이 얼마나 효과적인가?
  • RQ4레이블링 함수에서 유도한 신뢰도 점수를 통합하면 약한 감독 환경에서 모델 성능이 향상되는가?

주요 결과

  • 약한 감독을 통한 BERT-PR 모델은 세 데이터셋 평균으로 상위 1개 정확도에서 BM25 베이스라인보다 평균 20%의 상대적 향상을 달성하였다.
  • WikipassageQA 및 InsuranceQA_v2 데이터셋에서 약한 감독 모델은 이전의 완전한 감독 모델을 뛰어넘는 새로운 최고 성능을 기록하였다.
  • 약한 신호의 기하 평균(GM) 집계 방식은 BM25 단독 훈련 대비 P@1에서 10%의 상대적 향상을 보였다.
  • 약한 감독으로 훈련된 모델은 WikipassageQA(test)에서 MAP 62.58을 기록하여 이전의 완전한 감독 환경에서의 최고 성능인 56.08을 초월하였다.
  • 신뢰도 점수를 활용한 노이즈 인식 훈련은 성능 향상이 미미하여 현재의 신뢰도 추정 방식이 최적은 아님을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.