Skip to main content
QUICK REVIEW

[논문 리뷰] Reducing Hallucinations in Neural Machine Translation with Feature Attribution

Joël Tang, Marina Fomicheva|arXiv (Cornell University)|2022. 11. 17.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 신경 기계 번역에서 환각 현상을 줄이기 위해 특성 기여도를 활용하여 생성된 목표 토큰에 과도하게 의존하고 소스 입력을 忽시하는 모델을 식별하고 처벌하는 새로운 보조 손실 함수를 제안한다. 소스 토큰 기여도의 엔트로피를 최소화함으로써, 저품질 데이터에서의 강건성을 향상시키며, 재학습 없이도 환각 예제에서 13.75 BLEU 포인트 향상을 달성한다.

ABSTRACT

Neural conditional language generation models achieve the state-of-the-art in Neural Machine Translation (NMT) but are highly dependent on the quality of parallel training dataset. When trained on low-quality datasets, these models are prone to various error types, including hallucinations, i.e. outputs that are fluent, but unrelated to the source sentences. These errors are particularly dangerous, because on the surface the translation can be perceived as a correct output, especially if the reader does not understand the source language. We present a case study focusing on model understanding and regularisation to reduce hallucinations in NMT. We first use feature attribution methods to study the behaviour of an NMT model that produces hallucinations. We then leverage these methods to propose a novel loss function that substantially helps reduce hallucinations and does not require retraining the model from scratch.

연구 동기 및 목표

  • 저품질 병렬 데이터로 훈련된 모델에서 환각 현상의 근본 원인을 조사하기.
  • 특성 기여도 방법을 사용해 환각 출력에서의 모델 행동을 분석하여 주의 실패 패턴을 규명하기.
  • 재학습 없이도 모델을 수정할 수 있는 미분 가능하고 사후 처리 가능한 손실 함수를 개발하기.
  • 제안된 손실의 효과를 환각 및 비환각 예제 모두에서 평가하여 고품질 번역의 품질 저하가 발생하지 않도록 보장하기.

제안 방법

  • 모델의 출력에 대한 소스 및 타겟 토큰의 관련성 점수를 계산하기 위해 통합 기울기(Intergrated Gradients)를 활용한 특성 기여도를 적용하여 번역 결정에 기여하는 정도를 정량화한다.
  • 소스 토큰 기여도의 엔트로피를 계산하여 모델이 소스 입력에 얼마나 의존하는지의 지표로 사용한다; 높은 엔트로피는 정렬이 잘 되지 않으며 환각 가능성과 관련이 있다.
  • 소스 토큰 기여도의 엔트로피를 낮추기 위해 새로운 보조 손실을 도입하여 모델이 소스 내용에 더 일관되게 주의를 기울이도록 유도한다.
  • 표준 크로스 엔트로피와 레이블 스무딩과 함께 미세조정 중에 손실을 조합하며, 메인 손실과 크기를 맞추기 위해 가중치 5를 사용한다.
  • 로마니아어-영어 번역에 대해 MLQE-PE 데이터셋을 사용하여 평가하며, 백트랜슬레이션된 출력과 원본 소스 간의 BLEU 점수를 주요 평가 지표로 사용한다.
  • fairseq 라이브러리를 사용하여 강력한 Transformer base 모델을 기반으로 미세조정을 수행하며, 베이스라인 및 제안 모델 간의 하이퍼파라미터를 동일하게 유지한다.

실험 결과

연구 질문

  • RQ1저자원 또는 노이즈가 있는 데이터 조건에서 NMT 모델에서 환각 현상을 유발하는 소스 입력의 패턴은 무엇인가?
  • RQ2특성 기여도 방법은 신경 번역 모델의 환각 경향 행동을 정량적으로 식별할 수 있는가?
  • RQ3소스 토큰 기여도 점수의 엔트로피는 환각 발생 여부를 신뢰할 수 있는 지표인가?
  • RQ4기여도 엔트로피 기반의 미분 가능하고 사후 처리 가능한 손실이 재학습 없이도 환각 현상을 효과적으로 줄일 수 있는가?
  • RQ5제안된 방법은 비환각 예제에서 번역 품질을 유지하여 전체 성능에 부정적인 영향을 주지 않는가?

주요 결과

  • 제안된 보조 손실은 환각 현상을 크게 줄였으며, 환각 서브셋에서 13.75 BLEU 포인트 향상(10.71에서 24.46 BLEU로)을 달성했다.
  • 전체 테스트 세트에서 9.35 BLEU 포인트 향상(28.90에서 38.25 BLEU로)을 기록하여 광범위한 효과성을 입증했다.
  • 소스 토큰 기여도 점수의 높은 엔트로피는 항상 환각 출력과 관련이 있었으며, 이는 진단 신호로서의 신뢰성을 입증했다.
  • 비환각 예제에서도 높은 성능을 유지하였으며, 9.61 BLEU 포인트 향상(35.29에서 44.90으로)을 기록하여 정상 번역의 품질 저하가 없음을 보였다.
  • qualitative 예시를 통해 탈락형, 진동형, 혼합형 등 다양한 환각 유형을 효과적으로 완화했으며, 이는 메서드의 일반화 능력을 보여준다.
  • OOV 토큰이 존재하더라도 미세조정된 모델은 소스 문장의 핵심 의미를 유지하였으며, 강건성 측면에서 베이스라인을 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.