Skip to main content
QUICK REVIEW

[논문 리뷰] Longformer for MS MARCO Document Re-ranking Task

Ivan Sekulić, Amir Soleimani|arXiv (Cornell University)|2020. 09. 20.
Topic Modeling참고 문헌 10인용 수 5
한 줄 요약

이 논문은 MS MARCO 문서 재순서 정렬 작업에서 장문의 시퀀스를 처리할 수 있도록 최적화된 BERT 유사 트랜스포머 모델인 Longformer를 사용하여 문서를 재순서 정렬하는 방법을 제안한다. 국소적 및 전역적 어텐션 메커니즘을 활용함으로써 Longformer는 최대 4096 토큰을 처리할 수 있으며, 개발 세트에서 MRR@100이 0.329, 테스트 세트에서 0.305를 기록하여 이 장문 문서 순서 정렬 벤치마크에서 이전 방법들을 능가한다.

ABSTRACT

Two step document ranking, where the initial retrieval is done by a classical information retrieval method, followed by neural re-ranking model, is the new standard. The best performance is achieved by using transformer-based models as re-rankers, e.g., BERT. We employ Longformer, a BERT-like model for long documents, on the MS MARCO document re-ranking task. The complete code used for training the model can be found on: https://github.com/isekulic/longformer-marco

연구 동기 및 목표

  • 장문의 문서를 처리할 수 있는 트랜스포머 기반 모델을 활용하여 MS MARCO 데이터셋에서 문서 재순서 정렬 성능을 향상시키는 것.
  • 표준 BERT가 시퀀스 길이 제한으로 인해 어려움을 겪는 장문 문서 재순서 정렬 작업에서, 희소 어텐션을 갖춘 BERT 유사 모델인 Longformer를 평가하는 것.
  • Longformer의 국소적 및 전역적 어텐션 조합이 이중 단계 검색 파이프라인에서 장문 문서에 대한 관련성 점수 산정에 효과적임을 보여주는 것.
  • 세부 조정된 Longformer 모델을 사용하여 MS MARCO 문서 재순서 정렬 작업에서 최신 기술 수준의 성능을 달성하는 것.

제안 방법

  • 쿼리(문장 A)와 문서(문장 B)를 사용자 정의 양방향 입력 형식으로 사용하여 미리 훈련된 Longformer 모델을 MS MARCO 문서 재순서 정렬 데이터셋에 맞추기 위해 미세조정한다.
  • 쿼리와 문서를 [CLS] 및 [SEP] 토큰으로 연결하고, Longformer의 컨텍스트 창 크기에 맞추어 최대 4096 토큰으로 자르기.
  • 관련성 예측을 위해 드롭아웃과 비선형 활성화 함수를 갖는 두 층의 피드포워드 분류기 헤드에 Longformer의 [CLS] 토큰 표현을 입력한다.
  • 배치 크기 128, Adam 옵timizer, 초기 학습률 3×10⁻⁵, 2500 스텝 동안 선형 웜업을 적용하여 총 150만 반복 동안 교차 엔트로피 손실을 사용해 모델을 훈련한다.
  • 학습 중 양성 대 음성 문서 비율을 1:100에서 1:10으로 조정하여 모델의 일반화 능력과 수렴 성능 향상.
  • PyTorch Lightning과 Hugging Face Transformers를 통해 Longformer를 사용하여 학습을 구현한다.

실험 결과

연구 질문

  • RQ1표준 BERT 모델이 시퀀스 길이 제한으로 어려움을 겪는 MS MARCO 문서 재순서 정렬 작업에서 Longformer가 장문 문서를 효과적으로 재순서 정렬할 수 있는가?
  • RQ2국소적 및 전역적 어텐션을 조합한 Longformer의 희소 어텐션 메커니즘이 장문 문서에서 표준 자기어텐션보다 관련성 추정 성능을 어떻게 향상시키는가?
  • RQ3MS MARCO 문서 재순서 정렬 벤치마크에서 이전 신경망 재순서 정렬 모델인 Conformer-Kernel과 DRMM에 비해 Longformer는 어떤 성능 향상을 달성하는가?
  • RQ4원래의 1:100 비율 대비 균형 잡힌 1:10 양성 대 음성 문서 비율로 Longformer를 미세조정하면 순서 정렬 성능 향상이 이루어지는가?

주요 결과

  • Longformer는 공식 MS MARCO 개발 세트에서 MRR@100이 0.329를 기록하여 베이스라인인 Indri Query Likelihood(0.192)와 다른 신경망 모델들을 능가했다.
  • 테스트 세트에서는 MRR@100이 0.305를 기록하여 이전 최고 성능 제출물인 Conformer-Kernel(QTI)의 개발 세트 성능(0.307)을 넘어서는 성과를 보였다.
  • 최대 4096 토큰까지 처리할 수 있는 능력 덕분에 장문 문서의 모델링이 효과적으로 가능했으며, 이는 문서 재순서 정렬 작업에 있어 핵심적인 요소였다.
  • 1:10의 양성 대 음성 비율로 미세조정함으로써 원래의 1:100 비율 대비 학습 안정성과 성능 향상이 이루어졌다.
  • Longformer는 MS MARCO 문서 재순서 정렬 작업에서 강력한 일반화 능력을 보이며, 제출 당시 트랜스포머 기반 재순서 정렬 모델 중 최고 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.