Skip to main content
QUICK REVIEW

[논문 리뷰] A Simple Contrastive Learning Objective for Alleviating Neural Text Degeneration

Shaojie Jiang, Ruqing Zhang|arXiv (Cornell University)|2022. 05. 05.
Topic Modeling인용 수 10
한 줄 요약

이 논문은 텍스트 생성 품질을 햖저하기 위해 학습 중에 긍정(정답) 토큰을 부정(반복적) 후보와 명시적으로 대비시키는 대비 토큰(CT) 학습 목표를 제안한다. 이 방법은 교차 엔트로피와 불가능성 목표를 결합하여 언어 모델링 및 개방형 대화 작업에서 퍼즐리티 비용을 최소화하면서도 반복률을 크게 낮추며 최신 기술 성능을 달성한다.

ABSTRACT

The cross-entropy objective has proved to be an all-purpose training objective for autoregressive language models (LMs). However, without considering the penalization of problematic tokens, LMs trained using cross-entropy exhibit text degeneration. To address this, unlikelihood training has been proposed to reduce the probability of unlikely tokens predicted by LMs. But unlikelihood does not consider the relationship between the label tokens and unlikely token candidates, thus showing marginal improvements in degeneration. We propose a new contrastive token learning objective that inherits the advantages of cross-entropy and unlikelihood training and avoids their limitations. The key idea is to teach a LM to generate high probabilities for label tokens and low probabilities of negative candidates. Comprehensive experiments on language modeling and open-domain dialogue generation tasks show that the proposed contrastive token objective yields much less repetitive texts, with a higher generation quality than baseline approaches, achieving the new state-of-the-art performance on text degeneration.

연구 동기 및 목표

  • 자기회귀 언어 모델에서 토큰, 어구 또는 문장의 반복이 발생하는 일반적인 실패 유형인 신경망 텍스트 열화 문제를 해결하기 위해.
  • 교차 엔트로피와 불가능성 학습의 한계를 극복하기 위해, 어휘 내에서 부정(반복적) 토큰과 관련 없는 토큰을 구분하지 못하는 문제를 해결하기 위해.
  • 긍정(정확한) 토큰과 부정(반복적) 후보를 명시적으로 대비시켜 불필요한 반복을 억제할 수 있는 학습 목표를 설계하기 위해.
  • 퍼즐리티를 유지하거나 약간 증가시키면서도 반복을 줄임으로써 생성 품질을 향상시키기 위해.
  • 언어 모델링 및 개방형 대화 생성 작업에서 텍스트 열화 문제에 대해 최신 기술 성능을 달성하기 위해.

제안 방법

  • CT 목표는 진정한(긍정) 토큰의 확률을 최대화하고, 부정 후보 집합의 확률을 최소화하는 대비 손실로 정의된다.
  • 부정 후보들은 시퀀스의 이전 M개의 토큰으로 선택되며, 일반적인 반복 패턴을 나타낸다.
  • 표준 교차 엔트로피 손실과 CT 목표를 결합하여 언어 모델링 능력을 유지하면서도 열화를 줄인다.
  • 자기회귀 생성 과정 중에 두 목표를 모두 사용하여 종단 간(end-to-end)으로 모델을 훈련시킨다.
  • 각 디코딩 단계에서 CT 목표는 진짜 다음 토큰을 M개의 최근 토큰(부정 예시로)과 대비시킨다.
  • 모델은 모든 이전 토큰이 아닌, 맥락적으로 관련 있는 부정 후보에만 집중함으로써 불필요한 토큰을 강화하는 것을 방지하고, 반복 억제를 향상시킨다.

실험 결과

연구 질문

  • RQ1긍정 토큰과 부정 토큰을 명시적으로 대비시키는 대비 학습 목표가 교차 엔트로피나 불가능성 학습보다 텍스트 열화를 더 효과적으로 줄일 수 있는가?
  • RQ2모든 이전 토큰이 아닌 최근 맥락 토큰을 부정 후보로 사용할 경우, 반복 억제 성능이 향상되는가?
  • RQ3CT 목표는 퍼즐리티를 낮게 유지하면서도 자기회귀 텍스트 생성에서 반복률을 크게 낮출 수 있는가?
  • RQ4대화 및 언어 모델링 작업에서 자동 평가 및 인간 평가 지표 측면에서 CT 목표는 기존 방법보다 어떻게 비교되는가?
  • RQ5부정 후보 선택에 대한 시퀀스 길이와 윈도우 크기의 영향은 생성 품질과 반복률에 어떤가?

주요 결과

  • 언어 모델링 작업에서 CT 목표는 그리디 기반으로 9.19의 rep-1 비율, 빔 서치 기반으로 6.89의 rep-1 비율을 기록하여 UL-TS 및 NCE를 포함한 모든 베이스라인보다 유의미하게 낮게 유지했다.
  • 개방형 대화 작업에서 CT는 그리디 기반으로 0.60의 rep-1 비율, 빔 서치 기반으로 0.64의 rep-1 비율을 기록하여 모든 방법 중에서 가장 낮은 반복률과 가장 높은 다양성을 확보했다.
  • 언어 모델링 작업에서 CT는 rep-4 비율을 그리디 기반으로 0.05, 빔 서치 기반으로 0.12로 낮추며, 불가능성 기반 방법을 포함한 모든 베이스라인을 능가했다.
  • 인간 평가 결과, CT가 생성한 응답은 UL-TS 및 기타 베이스라인 대비 반복이 적고 더 논리적인 것으로 평가되었으며, 대화 작업에서 인간 선호도 점수는 0.64를 기록했다.
  • 퍼즐리티가 약간 증가했음에도 불구하고(베이스라인 대비 1.44 포인트 높음), CT는 다각도의 향상 덕분에 가장 뛰어난 종합적 생성 품질을 달성했다.
  • 제거 실험 결과, 모든 이전 토큰이 아닌 M개의 최근 토큰만을 부정 후보로 사용할 경우 성능이 향상되고 노이즈가 감소함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.