Skip to main content
QUICK REVIEW

[논문 리뷰] VIRT: Improving Representation-based Models for Text Matching through Virtual Interaction

Dan Li, Yang Yang|arXiv (Cornell University)|2021. 12. 08.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 텍스트 매칭 모델의 표현 기반 모델과 상호작용 기반 모델 간의 성능 격차를 해소하기 위해 훈련 중 상호작용 기반 모델의 어텐션 지식을 흡수함으로써 표현 기반 모델의 성능을 향상시키는 가상의 상호작용 메커니즘인 VIRT를 제안한다. 이는 추론 시 비용을 추가하지 않으면서도 깊은 크로스 어텐션 학습을 가능하게 한다. 이 방법은 추론 시 흡수 과정을 제거함으로써 효율성을 유지하면서도 여섯 가지 벤치마크에서 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

With the booming of pre-trained transformers, representation-based models based on Siamese transformer encoders have become mainstream techniques for efficient text matching. However, these models suffer from severe performance degradation due to the lack of interaction between the text pair, compared with interaction-based models. Prior arts attempt to address this through performing extra interaction for Siamese encoded representations, while the interaction during encoding is still ignored. To remedy this, we propose a extit{Virtual} InteRacTion mechanism (VIRT) to transfer interactive knowledge from interaction-based models into Siamese encoders through attention map distillation. As a train-time-only component, VIRT could completely maintain the high efficiency of the Siamese structure and brings no extra computation cost during inference. To fully utilize the learned interactive knowledge, we further design a VIRT-adapted interaction strategy. Experimental results on multiple text matching datasets demonstrate that our method outperforms state-of-the-art representation-based models. What's more, VIRT can be easily integrated into existing representation-based methods to achieve further improvements.

연구 동기 및 목표

  • 텍스트 매칭 분야에서 효율적인 표현 기반 모델과 강력한 상호작용 기반 모델 간의 성능 격차를 해소하기 위해.
  • 표현 기반 모델이 추가적인 추론 비용 없이 크로스 어텐션 상호작용을 학습할 수 있도록 하기 위해.
  • 상호작용 인식 표현을 상호작용 기반 교사 모델에서 사일리언스 인코더로 전달하는 지식 흡수 기반 메커니즘을 설계하기 위해.
  • 흡수된 지식을 더욱 효과적으로 활용하기 위해 경량의 VIRT-적응 상호작용 레이어를 개발하기 위해.

제안 방법

  • 훈련 중 상호작용 기반 교사 모델의 어텐션 맵을 표현 기반 학생 모델의 사일리언스 인코더로 전달하는 지식 흡수 모듈을 도입한다.
  • Eq. 7에 정의된 하이퍼파라미터 α를 사용하여 교사 모델과 학생 모델 간의 어텐션 맵 정렬을 기반으로 한 흡수 손실을 사용한다.
  • 이중 인코더의 효율성을 유지하기 위해 추론 시 흡수 모듈을 제거한다.
  • 사일리언스 인코딩 이후에 표현을 융합하는 VIRT-적응 상호작용 레이어를 설계하여 학습된 상호작용 지식을 활용한다.
  • 작업 특화 손실과 흡수 손실을 하이퍼파라미터 α로 균형을 맞춰 학생 모델을 훈련시킨다.
  • 여러 텍스트 매칭 작업에서 다양한 사전 학습된 BERT 변형 모델(BERT-Tiny부터 BERT-Large까지)에 이 방법을 적용한다.

실험 결과

연구 질문

  • RQ1상호작용 기반 모델에서의 지식 흡수로 표현 기반 텍스트 매칭 모델의 성능 향상이 효과적으로 이루어지는가?
  • RQ2어텐션 맵 흡수를 통한 가상의 상호작용이 전체 상호작용 없이도 사일리언스 인코더가 의미 있는 크로스 어텐션 패턴을 학습할 수 있는가?
  • RQ3기본적인 후기 상호작용 모듈과 비교해 VIRT-적응 상호작용 레이어는 성능 향상에 얼마나 기여하는가?
  • RQ4모델 크기와 텍스트 매칭 벤치마크에 관계없이 성능 향상이 얼마나 견고한가?
  • RQ5VIRT는 기존의 표현 기반 모델을 향상시키기 위한 플러그인으로 사용될 수 있는가?

주요 결과

  • VIRT는 여섯 가지 텍스트 매칭 벤치마크에서 최신 기술 수준의 성능을 달성하며, 기존의 표현 기반 모델을 초월한다.
  • MNLI 데이터셋에서 VIRT-BERT-Large는 79.3의 정확도를 기록하여 기준 모델 대비 +15.4의 성능 향상을 달성한다.
  • BERT-Tiny부터 BERT-Large에 이르기까지 다양한 모델 크기에서 일관된 성능 향상이 나타나며, 성능 향상 폭은 +10.3에서 +15.4 포인트까지 다양하다.
  • 제거 실험 결과에서 흡수 모듈과 VIRT-적응 상호작용 레이어 모두 최적의 성능을 내기 위해 필수적임을 확인하였다.
  • 시각화 결과에서 VIRT-흡수 모델이 상호작용 기반 교사 모델과 유사한 어텐션 패턴을 학습하는 것으로 나타났다. 예를 들어 'peaceful'과 'peace' 간의 정렬이 잘 이루어졌다.
  • 하이퍼파라미터 α에 대해 강건한 성능을 보이며, 최적의 성능는 α=1에서 달성되었고, 넓은 범위의 값에서 안정적인 성능을 유지하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.