[논문 리뷰] Understanding and Detecting Hallucinations in Neural Machine Translation via Model Introspection
이 논문은 신경 기계 번역(NMT)에서 유리상자 허구 감지 방법을 제안하며, 계층적 관련성 전파(LRP)를 통해 내부 모델 증상—특히 집중적이고 정적인 소스 토큰 기여도—를 식별한다. 이 방법은 영어-중어 및 독일어-영어 테스트 세트에서 자연스러운 허구를 탐지하는 데 있어 모델에 의존하지 않는 기준선 및 사전 훈련된 모델 기반의 블랙박스 감지기보다 뛰어난 성능을 보인다.
Neural sequence generation models are known to "hallucinate", by producing outputs that are unrelated to the source text. These hallucinations are potentially harmful, yet it remains unclear in what conditions they arise and how to mitigate their impact. In this work, we first identify internal model symptoms of hallucinations by analyzing the relative token contributions to the generation in contrastive hallucinated vs. non-hallucinated outputs generated via source perturbations. We then show that these symptoms are reliable indicators of natural hallucinations, by using them to design a lightweight hallucination detector which outperforms both model-free baselines and strong classifiers based on quality estimation or large pre-trained models on manually annotated English-Chinese and German-English translation test beds.
연구 동기 및 목표
- 신경 기계 번역(NMT)에서 허구 유발 요인에 대한 체계적인 이해 부족을 해결한다.
- 추론 중 허구를 신호하는 신뢰할 수 있는 내부 모델 증상을 식별한다.
- 자연스럽고 변형되지 않은 입력으로 일반화 가능한 경량이고 해석 가능한 허구 감지기를 개발한다.
- 기존의 모델에 의존하지 않는 방법 및 블랙박스 접근 방식보다 검출 정확도와 강건성을 향상시킨다.
- 미래의 NMT 신뢰성 연구를 지원하기 위해 인간이 애너테이션한 자연스러운 허구 테스트 베드를 공개한다.
제안 방법
- 허구적 및 비허구적 번역 쌍을 생성하기 위해 반대 조건 입력 변형을 사용한다.
- 계층적 관련성 전파(LRP)를 적용하여 소스 및 타겟 시퀀스의 상대적 토큰 기여도를 계산한다.
- 생성 단계에 걸쳐 소스 기여도 패턴을 분석하여 허구의 일관된 증상을 식별한다.
- 두 가지 핵심 증상에 기반해 허구를 감지한다: (1) 소수의 소스 토큰에서 집중된 기여도와 (2) 시간에 따라 정적인 기여도 분포.
- 이러한 증상을 특징으로 사용해 경량 분류기를 훈련하여 자연 테스트 세트에서의 허구를 감지한다.
- 모델에 의존하지 않는 기준선, 품질 평가 모델, 대규모 사전 훈련된 모델 기반의 블랙박스 분류기와의 비교를 통해 감지기 성능을 평가한다.
실험 결과
연구 질문
- RQ1NMT에서 허구 번역과 일관되게 관련된 내부 모델 행동 또는 증상은 무엇인가?
- RQ2적대적 변형을 통해 식별된 증상은 자연 발생 번역에서의 허구 감지로 일반화될 수 있는가?
- RQ3소스 기여도 패턴은 주의 분포나 신뢰도 기반 특징과 비교해 허구 감지에 얼마나 효과적인가?
- RQ4이러한 증상에 기반한 경량 유리상자 감지기가 모델에 의존하지 않는 방법 및 블랙박스 감지 방법보다 뛰어난 성능을 낼 수 있는가?
- RQ5실제 번역 환경에서 도메인 이동에 대해 제안된 감지기는 얼마나 강건한가?
주요 결과
- 집중적이고 정적인 소스 토큰 기여도 패턴은 상대적 소스-타겟 기여도 지표보다 강력하고 신뢰할 수 있는 허구 지표이다.
- LRP 기반 증상 감지 방법은 변형된 입력에서부터 실제 테스트 세트의 자연스러운 허구로 효과적으로 일반화된다.
- 제안된 경량 감지기는 대규모 사전 훈련된 모델 기반의 블랙박스 분류기보다 더 높은 정확도와 도메인 이동에 대한 더 뛰어난 강건성을 확보한다.
- 인간이 애너테이션한 영어-중어 및 독일어-영어 테스트 세트에서, 감지기는 모델에 의존하지 않는 기준선 및 품질 평가 기반 분류기보다 허구 감지 성능이 뛰어나다.
- 연구 결과, 주의 분포나 모델 신뢰도 점수보다 소스 기여도 패턴이 허구에 더 예측 가능하다는 것이 드러났다.
- 저자들은 영어-중어 및 독일어-영어 번역에서의 인간 애너테이션 기반 자연스러운 허구 테스트 세트를 공개하여 향후 벤치마킹을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.