[논문 리뷰] Detecting Hallucinated Content in Conditional Neural Sequence Generation
이 논문은 신경 시퀀스 생성에서 입력에 의해 지지되지 않는 생성된 내용을 식별하기 위해 토큰 수준의 환각 탐지 작업을 도입한다. 합성 환각과 미세조정된 사전학습된 언어 모델을 사용하는 방법을 제안하며, 기계 번역 및 개괄 요약 작업에서 뛰어난 성능을 달성하고, 환각 인식 손실 잘라내기와 노이즈 있는 데이터 필터링을 통해 저자원 기계 번역의 향상을 보여준다.
Neural sequence models can generate highly fluent sentences, but recent studies have also shown that they are also prone to hallucinate additional content not supported by the input. These variety of fluent but wrong outputs are particularly problematic, as it will not be possible for users to tell they are being presented incorrect content. To detect these errors, we propose a task to predict whether each token in the output sequence is hallucinated (not contained in the input) and collect new manually annotated evaluation sets for this task. We also introduce a method for learning to detect hallucinations using pretrained language models fine tuned on synthetic data that includes automatically inserted hallucinations Experiments on machine translation (MT) and abstractive summarization demonstrate that our proposed approach consistently outperforms strong baselines on all benchmark datasets. We further demonstrate how to use the token-level hallucination labels to define a fine-grained loss over the target sequence in low-resource MT and achieve significant improvements over strong baseline methods. We also apply our method to word-level quality estimation for MT and show its effectiveness in both supervised and unsupervised settings. Codes and data available at https://github.com/violet-zct/fairseq-detect-hallucination.
연구 동기 및 목표
- 입력에 기반하지 않은 사실적으로 잘못된 유창한 출력을 생성하는 신경 시퀀스 생성에서의 환각 콘텐츠 문제를 해결하기 위해.
- 기준 출력이 필요 없이 작업에 종속되지 않고 런타임에 적용 가능한 환각 탐지 방법을 개발하기 위해.
- 기계 번역 및 개괄 요약 작업에서 환각 탐지에 사용할 수 있는 고품질의 인간 레이블 데이터셋을 구축하기 위해.
- 환각 레이블을 사용해 잘못된 토큰에 대한 손실를 잘라내거나 필터링함으로써 저자원 환경에서의 향상된 학습을 가능하게 하기 위해.
- 신경 기계 번역에서 환각 탐지의 유용성을 단어 수준의 품질 평가 및 자기학습에 적용하기 위해.
제안 방법
- 생성된 시퀀스의 각 토큰이 입력에 의해 지지되지 않는 환각인지 여부를 예측하는 새로운 작업을 제안한다.
- 역번역 및 기타 데이터 증강 기법을 사용하여 참조 출력에 엄밀히 관련되지 않은 구간을 삽입함으로써 합성 환각 데이터를 생성한다.
- 합성 환각 데이터에 대해 사전학습된 언어 모델(예: BERT)을 미세조정하여 토큰 수준의 환각을 탐지할 수 있도록 학습한다.
- 학습된 탐지기를 추론 시점에 적용하여 런타임에서 신뢰성 평가를 가능하게 한다.
- 저자원 기계 번역에서 토큰 수준의 환각 레이블을 사용해 세밀한 손실 잘라내기 기법을 정의하며, 환각 토큰에 대한 기울기 전파를 생략한다.
- 감독 및 비감독 설정 모두에서 단어 수준의 품질 평가에 이 방법을 적용하여, 다양한 설정에서의 효과성을 입증한다.
실험 결과
연구 질문
- RQ1기준 출력이나 인간 레이블 기반 기준이 없는 조건에서, 참조 출력 없이 토큰 수준에서 환각 콘텐츠를 탐지할 수 있는가?
- RQ2합성 환각 데이터로 학습된 모델이 제로샷 또는 피셔샷 설정에서 실제 환각을 탐지하는 데 얼마나 효과적인가?
- RQ3토큰 수준의 환각 탐지가 노이즈 있는 학습 데이터를 필터링하거나 자기학습을 향상시켜 저자원 신경 기계 번역을 향상시킬 수 있는가?
- RQ4환각 인식 손실 잘라내기 방법이 기존 학습 방식과 비교해 환각을 줄이고 BLEU 점수를 향상시키는 데 얼마나 효과적인가?
- RQ5환각 탐지 모델이 감독 및 비감독 기계 번역 설정 모두에서 단어 수준의 품질 평가에 효과적으로 적용될 수 있는가?
주요 결과
- 제안된 방법은 인간 레이블 기반 학습 데이터가 전혀 없는 벤치마크 데이터셋에서 평균 F1 점수 약 0.6을 달성하여 새로운 작업의 강력한 베이스라인을 확립한다.
- 저자원 기계 번역 환경에서, 환각 인식 손실 잘라내기 방법이 강력한 베이스라인을 초월하며, 네팔리-영어 및僧伽라-영어 분야에서 WMT2019 공동 과제에서 최고 성능을 기록한다.
- Ne-En 및 Si-En 테스트 세트에서 각각 BLEU 점수 7.4와 8.11을 기록하여 WMT19 공동 과제의 최고 제출 성과를 뛰어넘는다.
- 1,000만 개의 노이즈 있는 학습 데이터에서, 기준 모델이 실패(bleu 0.14)하는 상황에서도 본 방법은 합리적인 성능(BLEU 5.18)을 유지하며 극단적 노이즈에 대한 강건성을 입증한다.
- 감독 및 비감독 설정 모두에서 단어 수준의 품질 평가 향상에 기여하여, 번역 외 응용 분야로의 일반화 가능성도 입증한다.
- 자기학습에서 환각 레이블을 활용하면, 교사 모델이 노이즈 있는 출력을 생성하더라도 환각 비율을 낮추고 모델 성능을 향상시킬 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.