Skip to main content
QUICK REVIEW

[논문 리뷰] A Sentence is Worth 128 Pseudo Tokens: A Semantic-Aware Contrastive Learning Framework for Sentence Embeddings

Haochen Tan, Wei Shao|arXiv (Cornell University)|2022. 03. 11.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 문장 길이와 문법 구조와 같은 표면적 특징에 대한 의존도를 줄이기 위해 문장을 고정 길이의 가짜 토큰 공간으로 매핑하는 의미 인식형 대비 학습 프레임워크인 PT-BERT를 제안한다. 학습 가능한 가짜 토큰 임베딩과 주의 메커니즘을 활용해 문장 표현을 정렬함으로써, STS 벤치마크에서 77.74%의 스피어만 상관계수를 달성하며, SimCSE 및 기타 기준 모델보다 정렬, 균일성, 하드 예제 일반화 성능에서 뛰어난 성능을 보였다.

ABSTRACT

Contrastive learning has shown great potential in unsupervised sentence embedding tasks, e.g., SimCSE. However, We find that these existing solutions are heavily affected by superficial features like the length of sentences or syntactic structures. In this paper, we propose a semantics-aware contrastive learning framework for sentence embeddings, termed Pseudo-Token BERT (PT-BERT), which is able to exploit the pseudo-token space (i.e., latent semantic space) representation of a sentence while eliminating the impact of superficial features such as sentence length and syntax. Specifically, we introduce an additional pseudo token embedding layer independent of the BERT encoder to map each sentence into a sequence of pseudo tokens in a fixed length. Leveraging these pseudo sequences, we are able to construct same-length positive and negative pairs based on the attention mechanism to perform contrastive learning. In addition, we utilize both the gradient-updating and momentum-updating encoders to encode instances while dynamically maintaining an additional queue to store the representation of sentence embeddings, enhancing the encoder's learning performance for negative examples. Experiments show that our model outperforms the state-of-the-art baselines on six standard semantic textual similarity (STS) tasks. Furthermore, experiments on alignments and uniformity losses, as well as hard examples with different sentence lengths and syntax, consistently verify the effectiveness of our method.

연구 동기 및 목표

  • 기존 대비 학습 방법이 문장 임베딩 작업에서 문장 길이와 문법과 같은 표면적 특징에 과도하게 의존하는 문제를 해결하기 위해.
  • 문장을 고정 길이의 가짜 토큰 공간으로 투영함으로써 깊이 있는 의미 표현을 포착하는 프레임워크를 개발하기 위해.
  • 모멘텀 및 큐 메커니즘을 통해 양성 쌍 구성과 음성 샘플 채굴을 향상시켜 대비 학습 성능을 향상시키기 위해.
  • 길이 또는 문법적 차이가 큰 하드 예제에 대한 모델의 강건성 평가를 위해.
  • 의미 인식 표현 학습이 임베딩 공간에서 더 나은 정렬과 균일성을 이끌어내는지 확인하기 위해.

제안 방법

  • 각 문장을 고정 길이의 128개의 가짜 토큰 시퀀스로 매핑하기 위해 BERT 인코더와 독립적인 학습 가능한 가짜 토큰 임베딩 레이어를 도입한다.
  • 주의 메커니즘을 사용해 BERT에서 생성된 문장 표현을 가짜 토큰 공간으로 투영함으로써 의미 인식형 표현 학습을 가능하게 한다.
  • 기울기 업데이트가 이루어지는 인코더와 모멘텀 업데이트가 이루어지는 인코더를 두 개 사용하여 지속적인 증강을 통해 양성 쌍을 생성한다.
  • 모멘텀 인코더에서 유도된 음성 임베딩의 동적 큐를 유지하여 대비 학습의 안정성과 다양성을 향상시킨다.
  • 임베딩 공간 최적화를 위해 정렬 손실과 균일성 손실을 모두 활용하며, 양성 쌍 간의 거리를 최소화하고 음성 간의 간격을 최대화한다.
  • 100만 개의 위키백과 문장으로 훈련하고, 길이 및 문법적 다양성이 있는 하드 예제를 포함한 일곱 가지 표준 STS 작업에서 평가한다.

실험 결과

연구 질문

  • RQ1고정 길이의 가짜 토큰 공간은 문장 임베딩 학습에서 문장 길이와 문법적 구조에 대한 모델의 의존도를 줄일 수 있는가?
  • RQ2제안된 의미 인식형 대비 학습 프레임워크는 SimCSE 및 이산 증강 방법과 비교해 표준 STS 벤치마크에서 성능을 어떻게 향상시키는가?
  • RQ3길이 차이가 크거나 문법적 유사성이 낮은 하드 예제에 대해 모델의 일반화 능력은 어느 정도인가?
  • RQ4가짜 토큰의 사용이 기존의 대비 학습 기준 모델 대비 임베딩 공간에서 더 나은 정렬과 균일성을 이끌어내는가?
  • RQ5성능과 모델 복잡도의 균형을 고려할 때, 가짜 토큰 시퀀스와 큐의 최적 크기는 무엇인가?

주요 결과

  • PT-BERT는 표준 STS 벤치마크에서 기존 최고 성능을 갱신하는 77.74%의 스피어만 상관계수를 달성하며, SimCSE 및 기타 기준 모델을 능가한다.
  • SimCSE보다 더 낮은 정렬 및 균일성 손실을 보이며, 대비 학습 목표의 더 나은 최적화를 의미한다.
  • 길이 차이가 5개 이상이고 문법적 유사성이 낮은 하드 예제 서브셋에서, PT-BERT는 SimCSE 대비 스피어만 상관계수를 3.36% 향상시켰다.
  • 제거 실험 결과, 128개의 가짜 토큰이 의미 표현력과 파rameter 효율성의 균형을 고려할 때 최적의 성능을 낸다.
  • 큐 크기 실험 결과, 성능가 4 근처에서 안정화됨을 확인하여 중간 크기의 큐로도 충분한 음성 샘플링이 가능함을 시사한다.
  • 프레임워크는 문장 길이와 문법에 기인한 허수 상관관계를 효과적으로 줄여 더 강건한 의미 표현 학습을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.