Skip to main content
QUICK REVIEW

[논문 리뷰] Don't Take It Literally: An Edit-Invariant Sequence Loss for Text Generation

Guangyi Liu, Zichao Yang|arXiv (Cornell University)|2021. 06. 29.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 신경망 텍스트 생성을 위한 새로운 학습 목표인 편집에 불변인 순서 손실(Edit-Invariant Sequence Loss, EISL)을 제안한다. EISL은 참조 n-그램과 생성된 시퀀스의 모든 n-그램 간의 매칭 손실을 계산하여 참조 시퀀스에 노이즈나 편집이 있을 경우에도 강건하게 작동하도록 한다. EISL은 기계 번역에서 노이즈가 있는 타겟을 사용할 때나 비자율 스타일 전이, 비자율적 생성 등 다양한 작업에서 교차 엔트로피 손실과 강력한 기준 모델을 능가하며, 컨볼루션 연산을 통해 효율적으로 구현 가능하여 기존 손실 함수에 쉽게 통합할 수 있다.

ABSTRACT

Neural text generation models are typically trained by maximizing log-likelihood with the sequence cross entropy (CE) loss, which encourages an exact token-by-token match between a target sequence with a generated sequence. Such training objective is sub-optimal when the target sequence is not perfect, e.g., when the target sequence is corrupted with noises, or when only weak sequence supervision is available. To address the challenge, we propose a novel Edit-Invariant Sequence Loss (EISL), which computes the matching loss of a target n-gram with all n-grams in the generated sequence. EISL is designed to be robust to various noises and edits in the target sequences. Moreover, the EISL computation is essentially an approximate convolution operation with target n-grams as kernels, which is easy to implement and efficient to compute with existing libraries. To demonstrate the effectiveness of EISL, we conduct experiments on a wide range of tasks, including machine translation with noisy target sequences, unsupervised text style transfer with only weak training signals, and non-autoregressive generation with non-predefined generation order. Experimental results show our method significantly outperforms the common CE loss and other strong baselines on all the tasks. EISL has a simple API that can be used as a drop-in replacement of the CE loss: https://github.com/guangyliu/EISL.

연구 동기 및 목표

  • 참조 시퀀스에 노이즈나 완전하지 않은 경우가 있을 때 교차 엔트로피(CE) 손실이 텍스트 생성에서 가지는 한계를 해결하기 위해.
  • 단어 재배열, 반복, 공백 처리 등의 일반적인 텍스트 편집에 대해 불변인 학습 목표를 개발하기 위해.
  • 약한 감독 조건 하에서 더 나은 일반화 성능을 달성하면서도 엔드 투 엔드 미분 가능성과 계산 효율성을 유지하기 위해.
  • 기존 CE 손실의 즉각적인 대체제로서 다양한 텍스트 생성 작업에서 성능 향상을 이끌어내기 위해.

제안 방법

  • EISL는 타겟 시퀀스의 각 n-그램과 생성된 시퀀스의 모든 n-그램 간의 매칭 손실을 계산한다.
  • 손실는 타겟 n-그램을 생성된 시퀀스 위에 적용하는 가속화 가능한 커널로 간주하는 가속 가능한 컨볼루션 연산으로 기술된다.
  • 모든 n-그램 위치의 매칭 점수를 집계함으로써, 순서 변경, 반복, 단어 누락에 대해 강건한 손실을 만든다.
  • n이 전체 시퀀스 길이와 동일할 경우 EISL는 CE 손실로 축소되며, 이는 후행 호환성을 보장한다.
  • 기존 딥 러닝 라이브러리를 활용하여 표준 컨볼루션 연산을 사용해 효율적인 계산을 수행한다.
  • 기존 학습 파이프라인에 아키텍처 변경 없이 쉽게 통합할 수 있도록 설계되었다.

실험 결과

연구 질문

  • RQ1일반적인 텍스트 편집(예: 단어 재배열, 반복, 공백 처리)에 대해 불변이면서도 학습 효율성을 희생시키지 않는 순서 수준의 손실을 설계할 수 있는가?
  • RQ2기계 번역 작업에서 노이즈가 있는 또는 손상된 참조 시퀀스를 사용할 때 EISL는 CE 손실보다 어떻게 성능을 냈는가?
  • RQ3약한 콘텐츠 감독 조건 하에서 EISL는 비자율 텍스트 스타일 전이 작업에서 얼마나 향상된 성능을 낼 수 있는가?
  • RQ4재학습이나 아키텍처 변경 없이도 EISL는 비자율적 텍스트 생성에서 CE 손실을 효과적으로 대체할 수 있는가?
  • RQ5자동 평가 및 인간 평가 지표로 측정했을 때, EISL는 다양한 수준의 노이즈와 편집 유형에 대해 강건한가?

주요 결과

  • 노이즈가 있는 타겟 시퀀스를 사용한 기계 번역에서 EISL는 다양한 노이즈 수준에서 표준 교차 엔트로피 손실보다 유의미하게 높은 BLEU 점수를 달성한다.
  • 비자율 텍스트 스타일 전이 작업에서 EISL는 콘텐츠 유지 및 스타일 전이 품질 측면에서 CE 및 강화 학습 기준 모델보다 더 우수한 성능을 보였다.
  • 비자율적 텍스트 생성 작업에서 EISL는 사전 정의된 생성 순서 없이도 CE보다 더 나은 성능을 내었으며, 이는 그 유연성을 입증한다.
  • 단어 재배열, 반복, 공백 처리 등의 편집 유형에 대해 EISL는 CE보다 손실 값이 훨씬 느리게 증가함으로써 강건함을 입증했다.
  • 모든 평가된 작업에서 EISL는 계산 효율성과 기존 학습 프레임워크와의 호환성을 유지하면서 최신 기술 수준의 성능을 달성했다.
  • 인간 평가 결과, 특히 약한 감독 조건 하에서 EISL로 생성된 출력은 더 유창하고 참조 시퀀스와 의미적으로 더 잘 일치하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.