[논문 리뷰] On the Origin of Hallucinations in Conversational Models: Is it the Datasets or the Models?
이 논문은 지식 기반 대화 모델에서의 환각 현상이 훈련 데이터셋에 기인하는지 아니면 모델 아키텍처에 기인하는지 조사한다. Wizard of Wikipedia, CMU-DoG, TopicalChat 세 가지 주요 벤치마크와 최신 기술 모델을 대상으로 한 대규모 인간 주석 연구를 통해 저자들은 황금 표준 응답의 60% 이상이 환각되었으며, 모델 생성 응답이 이 문제를 악화시킨다는 것을 발견했다. 이 연구는 데이터 품질과 모델 행동 모두 환각의 원인임을 드러내며, 현재의 벤치마크와 훈련 파라다임의 신뢰성에 의문을 제기한다.
Knowledge-grounded conversational models are known to suffer from producing factually invalid statements, a phenomenon commonly called hallucination. In this work, we investigate the underlying causes of this phenomenon: is hallucination due to the training data, or to the models? We conduct a comprehensive human study on both existing knowledge-grounded conversational benchmarks and several state-of-the-art models. Our study reveals that the standard benchmarks consist of >60% hallucinated responses, leading to models that not only hallucinate but even amplify hallucinations. Our findings raise important questions on the quality of existing datasets and models trained using them. We make our annotations publicly available for future research.
연구 동기 및 목표
- 대화형 AI에서의 환각 현상이 훈련 데이터에 기인하는지 아니면 모델 아키텍처에 기인하는지 조사하기.
- 널리 사용되는 지식 기반 대화 벤치마크(DoW, CMU-DoG, TopicalChat)의 사실적 충실도를 감시하기.
- 최신 기술 모델이 생성 과정에서 환각을 악화시키는지 평가하기.
- 언어학적 및 논의 분석을 통해 환각 유형의 상세한 분류 체계를 제공하기.
- 향후 환각 탐지 및 완화 연구를 위한 주석 데이터를 공개하기.
제안 방법
- 황금 표준 응답과 모델 생성 응답에서 환각을 분류하기 위해 BEGIN 분류 체계와 VRM(구어 응답 방식)을 사용한 인간 주석 연구를 수행했다.
- 세 벤치마크에서 4,000개의 응답과 GPT-2, DoHA, CTRL 모델에서 생성한 1,200개의 모델 생성 응답을 주석 처리했다.
- 주석 신뢰성을 확보하기 위해 자격 시험, 프리랜딩 라운드, 일일 품질 점검을 포함한 계층적 아마존 메카니컬 터크(AMT) 작업 설계를 활용했다.
- 이면주석자 간 일致도를 측정하기 위해 Fleiss의 카파를 사용하여 평가했으며, 평가자 간 높은 일致도를 확보했다.
- 응답을 다섯 가지 BEGIN 유형으로 분류: 함의, 환각, 부분 환각, 일반적, 협력하지 않음.
- 언어학적 의사행위(예: 공개, 교육, 조언) 분석을 통해 환각 내용의 논의적 성격을 이해했다.
실험 결과
연구 질문
- RQ1대화형 모델에서의 환각 현상은 주로 잘못된 훈련 데이터에 기인하는가 아니면 모델 아키텍처에 기인하는가?
- RQ2기존 지식 기반 벤치마크의 응답 중 얼마나 많은 비율이 사실적으로 환각되는가?
- RQ3최신 기술 대화 모델은 훈련 데이터에 존재하는 환각을 생성 과정에서 악화시키는가?
- RQ4다양한 유형의 환각은 인간 생성 및 모델 생성 응답에서 어떤 언어학적 및 논의 패턴을 보이는가?
- RQ5GPT-2, DoHA, CTRL 등의 다양한 모델 아키텍처는 환각 프로파일에서 어떻게 다름이 있는가?
주요 결과
- Wizard of Wikipedia, CMU-DoG, TopicalChat 세 주요 벤치마크에서 60% 이상의 응답이 환각되었으며, 대부분은 의견, 감정, 개인 경험과 같은 지지되지 않는 주관적 내용을 포함한다.
- 가장 흔한 환각 유형은 주관적 표현(예: 신념, 의도)과 근거 없는 사실적 진술이며, 이들 유형에 속하는 응답 비율이 30-40%에 이른다.
- 모델 생성 응답은 황금 표준 응답보다 더 높은 환각 비율을 보이며, 이는 모델이 기존 데이터 결함을 악화시킨다는 것을 시사한다.
- 환각을 줄이기 위해 특별히 설계된 모델(예: DoHA)조차도 훈련 데이터보다 훨씬 더 많은 환각 응답을 생성함으로써 아키텍처적 한계가 있음을 시사한다.
- BEGIN 분류 체계에 따르면 25%의 응답이 부분 환각이며, 15%는 일반적 또는 협력하지 않는 것으로 분류되어 대화 품질을 더욱 악화시킨다.
- 이면주석자 간 일치도는 매우 높았으며(Fleiss의 카파 > 0.75), 주석 프레임워크와 연구 결과의 신뢰성을 검증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.