Skip to main content
QUICK REVIEW

[논문 리뷰] Contextual Text Denoising with Masked Language Models

Yifu Sun, Haoming Jiang|arXiv (Cornell University)|2019. 10. 30.
Topic Modeling참고 문헌 13인용 수 6
한 줄 요약

이 논문은 재학습 또는 쌍체 훈련 데이터가 필요 없이, 사전 훈련된 마스킹 언어 모델(예: BERT)을 사용하여 노이즈가 있는 텍스트를 보정하는 문맥 기반 텍스트 노이즈 제거 방법을 제안한다. 단어를 마스킹하고 문맥 예측을 활용함으로써, 번역, NLI, 병렬문장 탐지 작업에서 노이즈가 있는 입력에 대한 최종 NLP 성능을 향상시킨다. 스펠 체커와 같은 기존 기준 대비 BLEU 점수와 F1 점수에서 뚜렷한 향상을 이룬다.

ABSTRACT

Recently, with the help of deep learning models, significant advances have been made in different Natural Language Processing (NLP) tasks. Unfortunately, state-of-the-art models are vulnerable to noisy texts. We propose a new contextual text denoising algorithm based on the ready-to-use masked language model. The proposed algorithm does not require retraining of the model and can be integrated into any NLP system without additional training on paired cleaning training data. We evaluate our method under synthetic noise and natural noise and show that the proposed algorithm can use context information to correct noise text and improve the performance of noisy inputs in several downstream tasks.

연구 동기 및 목표

  • 오타나 철자 실수와 같은 노이즈가 있는 입력에 취약한 최신 NLP 모델의 문제를 해결하기 위해.
  • 재학습이나 쌍체 정제 데이터가 필요 없이 사전 훈련된 마스킹 언어 모델의 문맥 정보를 활용하는 노이즈 제거 방법을 개발하기 위해.
  • 기계 번역, 자연어 추론, 병행문장 탐지와 같은 최종 작업에서 합성 및 자연 노이즈에 대한 NLP 시스템의 강건성을 향상시키기 위해.
  • 정제된 텍스트에 적용했을 때 성능이 떨어지지 않는지 확인하여, 이미 올바른 입력에 대해 과도하게 수정하지 않는지 평가하기 위해.

제안 방법

  • 모델은 문장의 각 단어를 왼쪽에서 오른쪽으로 순차적으로 처리하며, 주변 단어의 문맥을 유지하면서 해당 단어를 [MASK] 토큰으로 마스킹한다.
  • 각 마스킹된 단어에 대해, 사전 훈련된 마스킹 언어 모델(예: BERT)을 사용하여 왼쪽 및 오른쪽 문맥을 기반으로 마스킹된 토큰을 예측함으로써 후보 교정 목록을 생성한다.
  • 단어당 마스킹 토큰의 수를 다양화(경험적으로 N=4로 설정)하여 여러 마스킹 문장 변형을 생성함으로써 올바른 단어를 더 잘 포착할 가능성을 높인다.
  • 텍스트 증강을 위해 원본 노이즈가 있는 문장과 각 마스킹 변형을 연결하여 후보 품질과 문맥 인식 능력을 향상시킨다.
  • 원본 노이즈 문장의 단어와의 편집 거리 기반 규칙을 사용하여 후보 목록에서 최종 교정어를 선택하며, 입력 철자와 유사한 후보를 우선시한다.
  • 모델은 마침표, 숫자 등을 건너뛰며 왼쪽에서 오른쪽 순서로 적용되며, 모델 미세조정 없이도 어떤 NLP 시스템과도 호환된다.

실험 결과

연구 질문

  • RQ1사전 훈련된 마스킹 언어 모델이 재학습이나 레이블 데이터 없이도 문맥 정보만으로 효과적으로 노이즈가 있는 텍스트를 복구할 수 있는가?
  • RQ2제안된 노이즈 제거 방법은 룰 기반 철자 검사기와 비교해 노이즈가 있는 입력에서 최종 NLP 작업 성능을 얼마나 향상시키는가?
  • RQ3정제된 텍스트에 노이즈 제거 알고리즘을 적용했을 때 성능이 떨어지는가? 이는 과도한 보정에 대한 강건성을 시사하는가?
  • RQ4이 방법은 다양한 NLP 작업에서 합성 노이즈와 자연 노이즈에 대해 얼마나 성능을 향상시킬 수 있는가?

주요 결과

  • IWSLT 2014 영어-독일어 번역 작업에서, 제안된 방법은 fairseq Transformer 모델에 적용했을 때 인위적 노이즈의 경우 BLEU 점수를 22.27에서 25.80으로, 자연 노이즈의 경우 17.29에서 21.40으로 향상시켰다.
  • Google 번역에 적용했을 때, 인위적 노이즈의 경우 BLEU 점수를 28.11에서 28.96으로, 자연 노이즈의 경우 25.22에서 25.49로 향상시켰다.
  • SNLI NLI 작업에서, 인위적 노이즈의 경우 정확도를 75.0에서 81.0으로, 자연 노이즈의 경우 74.0에서 77.0으로 향상시켰으며, 정제된 입력에서는 원래 수준의 성능(83.0)을 유지했다.
  • MRPC 병행문장 탐지 작업에서, 인위적 노이즈의 경우 F1 점수를 81.9에서 82.7로, 자연 노이즈의 경우 75.2에서 76.4로 향상시켰으며, 원본 모델과 철자 검사기 기준 대비 뛰어난 성능을 보였다.
  • 정제된 입력에 대해 최소한의 성능 저하가 발생했으며, SNLI 정확도가 원본 문장에 적용되었을 때 84.0에서 83.0으로 1.0점 하락하는 데 그쳤다. 이는 과도한 보정에 대한 강건성을 시사한다.
  • 텍스트 증강과 편집 거리 기반 후보 필터링을 통해, 일반 철자 검사기 대비 교정 정확도가 크게 향상되었으며, 일부 노이즈가 있는 입력에서는 오히려 성능이 떨어지는 경향이 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.