[논문 리뷰] Unsupervised Lexical Substitution with Decontextualised Embeddings
이 논문은 목표어의 문맥적 임베딩과 다수의 문맥에서 평균화된 비문맥적 임베딩 간의 코사인 유사도를 사용하여 동의어를 검색하는 비지도적 어휘 치환 방법을 제안한다. 이 방법은 영어 및 이탈리아어에서 강력한 베이스라인을 능가하며, 특히 저빈도어에 대해 뛰어난 성능을 보이며, 미세조정이나 명시적 지도 학습 없이도 형태계통적 편향을 감소시킨다.
We propose a new unsupervised method for lexical substitution using pre-trained language models. Compared to previous approaches that use the generative capability of language models to predict substitutes, our method retrieves substitutes based on the similarity of contextualised and decontextualised word embeddings, i.e. the average contextual representation of a word in multiple contexts. We conduct experiments in English and Italian, and show that our method substantially outperforms strong baselines and establishes a new state-of-the-art without any explicit supervision or fine-tuning. We further show that our method performs particularly well at predicting low-frequency substitutes, and also generates a diverse list of substitute candidates, reducing morphophonetic or morphosyntactic biases induced by article-noun agreement.
연구 동기 및 목표
- 어휘 치환에 있어 생성형 언어 모델 접근법의 한계, 즉 저빈도어에서의 낮은 성능과 문맥으로 인한 형태계통적 편향을 해결하기 위해.
- 미세조정과 명시적 지도 학습 없이도 사전 훈련된 모델을 활용하는 완전한 비지도적 방법을 개발하기 위해.
- 다양한 문맥에서 유도된 평균화된 비문맥적 단어 임베딩을 활용하여 동의어 검색을 향상시키기 위해.
- 영어 및 이탈리아어에서 관사-명사 일치 및 형태음운 제약으로 인한 편향을 줄이기 위해.
- 최소한의 아키텍처 변경으로 영어 및 이탈리아어에서 어휘 치환 분야에서 최신 기준 성능을 입증하기 위해.
제안 방법
- 이 방법은 사전 훈련된 트랜스포머 모델(예: BERT)을 사용하여 목표어의 문맥적 표현을 계산하고, 특정 레이어들에서의 표현을 합쳐 f(x,c)를 형성한다.
- 후보 대체어 y에 대해, 단일 언어 코퍼스의 N개 문장에서의 문맥적 표현을 평균화하여 비문맥적 표현 f(y)를 계산한다.
- 후보 대체어는 f(x,c)와 f(y) 사이의 코사인 유사도로 순위를 매긴다. 공식은 S(y|x,c) = cos(f(y), f(x,c))이다.
- 다의어 문제를 다루기 위해, y를 포함하는 N개 문장을 임베딩 유사도 기반으로 K개의 군집으로 분할하고, 각 군집에 대해 별개의 비문맥적 표현 f^k(y)를 계산한다.
- 하나의 사용자 정의 어휘집 Ṽ에 포함된 모든 단어(저빈도어의 서브워드 분할 포함)에 대해 사전에 f(y)를 계산하여 OOV 단어의 치환을 가능하게 한다.
- 가중치 조합이 아닌 레이어 집계(레이어 합산)를 사용하는 것이었으며, 이는 성능 향상이 없었기 때문이다.
실험 결과
연구 질문
- RQ1임베딩 유사도 기반의 완전한 비지도 방법이 미세조정 없이도 생성형 접근법보다 어휘 치환 성능을 뛰어나게 할 수 있는가?
- RQ2비문맥적 임베딩을 사용하면 마스크된 언어 모델 생성과 비교해 저빈도어 또는 OOV 단어에서 성능 향상이 이루어지는가?
- RQ3이 방법은 영어 및 이탈리아어에서 관사-명사 일치 등으로 유도되는 형태계통적 편향을 어느 정도 감소시키는가?
- RQ4다양한 트랜스포머 레이어에서 성능가 변화하는가? 어떤 레이어가 어휘 치환에 가장 우수한 표현을 제공하는가?
- RQ5단어 표현의 다의어 군집화는 다의어 단어에 대한 동의어 검색 성능을 향상시키는가?
주요 결과
- 제안된 방법은 어떤 미세조정이나 명시적 지도 학습 없이도 영어 및 이탈리아어 어휘 치환 벤치마크에서 새로운 최고 기록을 달성했다.
- SWORDS 데이터셋에서 30,000 어휘집을 사용한 방법은 F1 39.9를 기록했으며, BERT-K(30.4)와 DeBERTa(39.9)를 능가하여 뛰어난 일반화 능력을 입증했다.
- 30,000 어휘집을 사용할 때, 이 방법은 BERT-K 대비 저빈도어(빈도 < 50,000) 대체어를 거의 두 배로 예측했다.
- 10,000 어휘집을 사용할 경우에도 Fc에서 BERT-K(28.1)를 능가하는 32.6을 기록하여 어휘집 크기가 제한된 상황에서도 효과적임을 확인했다.
- 이 방법은 형태계통적 편향을 감소시켰다: 예를 들어 'an increase'와 같은 앞선 관사에 의존하는 것(예: 모음으로 시작하는 단어)을 피하고 더 다양한 의미적 대체어를 생성했다.
- 다의어 군집화를 사용하면 성능이 약간 향상되며, Fc는 K=1일 때 36.0에서 K=8일 때 36.9로 상승하지만, K=8를 초과하면 성능 향상이 정체된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.