Skip to main content
QUICK REVIEW

[논문 리뷰] Chinese Sentences Similarity via Cross-Attention Based Siamese Network

Zhen Wang, Xiangxie Zhang|arXiv (Cornell University)|2021. 04. 18.
Topic Modeling참고 문헌 11인용 수 4
한 줄 요약

이 논문은 교차 어텐션 기반의 시ames 네트워크인 CATsNet을 제안하며, 두 문장 간의 의존 관계를 교차 어텐션 기반으로 모델링하고 Bi-LSTM 레이어를 통해 특징 추출을 향상시켜 중국어 문장 유사도를 향상시킨다. 모델은 LCQMC 데이터셋에서 83.15%의 정확도를 기록하여 이전의 시ames 모델들—자기 어텐션, LSTM, CNN 아키텍처 기반 모델들을 포함—을 능가한다.

ABSTRACT

Measuring sentence similarity is a key research area nowadays as it allows machines to better understand human languages. In this paper, we proposed a Cross-Attention Siamese Network (CATsNet) to carry out the task of learning the semantic meanings of Chinese sentences and comparing the similarity between two sentences. This novel model is capable of catching non-local features. Additionally, we also tried to apply the long short-term memory (LSTM) network in the model to improve its performance. The experiments were conducted on the LCQMC dataset and the results showed that our model could achieve a higher accuracy than previous work.

연구 동기 및 목표

  • 문자 수준의 모호성과 어절 경계의 부재로 인해 복잡한 중국어 문장 간 의미 유사도 측정에 도전하는 문제를 해결하기 위해.
  • 자기 어텐션이나 국소적 특징 추출기로는 달성할 수 없는, 문장 간 의존 관계를 모델링함으로써 문장 표현 학습을 향상시키기 위해.
  • 교차 어텐션을 통한 전반적 맥락 모델링과 Bi-LSTM를 통한 순차적 모델링을 조합하여 중국어 문장 유사도 작업의 성능을 향상시키기 위해.
  • 대규모 중국어 NLP 벤치마크에서 시ames 아키텍처에 교차 어텐션과 Bi-LSTM 구성 요소를 적용한 효과를 검증하기 위해.

제안 방법

  • 모델은 공유 가중치를 가진 시ames 네트워크 구조를 사용하여 두 입력 문장을 동시에 처리함으로써 그들의 의미 표현을 비교할 수 있도록 한다.
  • 교차 어텐션 블록은 두 문장 표현에서 쿼리, 키, 밸류 행렬을 계산하여, 문장 내부가 아닌 문장 간 어텐션을 계산할 수 있도록 한다.
  • 교차 어텐션 메커니즘은 다른 문장의 관련 토큰에 주의를 기울여 맥락 인식 표현을 계산함으로써 상호 문장 간 의존 관계를 포착한다.
  • 트랜스포머 인코더 블록의 피드포워드 네트워크는 순방향 LSTM(Bi-LSTM)로 대체되어 문장 표현 내 순차적 패턴을 더 잘 포착할 수 있도록 한다.
  • 최종 문장 표현은 유사도를 예측하기 위해 분류기로 전달되며, 훈련 데이터의 클래스 불균형 문제를 해결하기 위해 포칼 손실을 사용한다.
  • 모델은 대규모 중국어 질문 매칭 코퍼스인 LCQMC 데이터셋에서 훈련 및 평가되었으며, 훈련 쌍 238,766개와 테스트 쌍 12,500개를 포함한다.

실험 결과

연구 질문

  • RQ1교차 어텐션 메커니즘을 갖춘 시ames 네트워크가 자기 어텐션 또는 전통적인 RNN/CNN 기반 모델보다 중국어 문장 유사도 측정에서 더 나은 성능을 내는가?
  • RQ2트랜스포머 인코더의 피드포워드 네트워크를 Bi-LSTM로 대체하면 유사도 작업을 위한 문장 표현 학습이 향상되는가?
  • RQ3교차 어텐션과 Bi-LSTM의 조합은 상호 문장 간 및 내부 문장 간 의존 관계를 모델링하는 데 얼마나 효과적인가?
  • RQ4포칼 손실의 사용이 불균형한 문장 유사도 데이터셋에서 모델 성능을 향상시키는가?

주요 결과

  • CATsNet는 LCQMC 데이터셋에서 83.15%의 정확도를 기록하여 가장 우수한 베이스라인 모델(시ames 컨볼루션 네트워크)의 77.31%를 크게 앞서나갔다.
  • MLP 헤드를 가진 교차 어텐션 시ames 모델은 81.99%의 정확도를 기록하여, 상호 문장 간 의존 관계를 모델링함으로써 자기 어텐션만을 사용한 경우보다 성능 향상이 이루어졌음을 보여주었다.
  • 자기 어텐션 시ames 모델은 78.61%의 정확도를 기록하여, 어텐션 메커니즘이 RNN 기반 모델인 시ames LSTM(68.63%)과 시ames Bi-LSTM(68.64%)보다 성능이 뛰어나다는 것을 보여주었다.
  • 제거 실험 결과, 교차 어텐션과 Bi-LSTM를 조합할 경우 가장 높은 성능을 기록하여 전반적 맥락 모델링과 순차적 모델링이 상호 보완적임을 확인하였다.
  • 검증 정확도 곡선은 모든 훈련 에포크 동안 CATsNet가 다른 시ames 모델들을 일관되게 능가하는 것으로 나타나, 안정적인 훈련 동역학을 가짐을 시사하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.