[논문 리뷰] Teaching Language Models to Hallucinate Less with Synthetic Tasks
이 논문은 인위적인 검색 작업에서 환각을 쉽게 탐지할 수 있도록 하여, 환각이 발생하기 쉬운 상황에서 LLM의 시스템 메시지를 프리픽스 튜닝을 통해 최적화함으로써 LLM의 환각을 줄이는 SynTra를 제안한다. 이 방법은 최적화된 시스템 메시지를 실제 추상적 요약 작업에 그대로 적용하여, 평균 7점 이상, 특정 작업에서는 최대 16점까지 환각을 감소시키며, 전체 모델을 파인튜닝하는 것은 오히려 환각을 악화시킬 수 있음을 보여준다.
Large language models (LLMs) frequently hallucinate on abstractive summarization tasks such as document-based question-answering, meeting summarization, and clinical report generation, even though all necessary information is included in context. However, optimizing LLMs to hallucinate less on these tasks is challenging, as hallucination is hard to efficiently evaluate at each optimization step. In this work, we show that reducing hallucination on a synthetic task can also reduce hallucination on real-world downstream tasks. Our method, SynTra, first designs a synthetic task where hallucinations are easy to elicit and measure. It next optimizes the LLM's system message via prefix-tuning on the synthetic task, and finally transfers the system message to realistic, hard-to-optimize tasks. Across three realistic abstractive summarization tasks, SynTra reduces hallucination for two 13B-parameter LLMs using only a synthetic retrieval task for supervision. We also find that optimizing the system message rather than the model weights can be critical; fine-tuning the entire model on the synthetic task can counterintuitively increase hallucination. Overall, SynTra demonstrates that the extra flexibility of working with synthetic data can help mitigate undesired behaviors in practice.
연구 동기 및 목표
- 실제 추상적 요약 작업에서 LLM의 환각을 줄이기 위한 도전 과제를 해결하기 위해, 환각 평가가 비용이 많이 들기 때문에 직접 최적화가 불가능한 상황에서의 접근을 제시한다.
- 환각 탐지가 용이한 인위적 작업을 활용하여, 환각에 대비한 효율적인 훈련을 가능하게 하는 확장 가능한 방법을 개발한다.
- 모델 가중치가 아닌 시스템 메시지를 최적화하는 것이 후행 작업에서 더 나은 일반화와 환각 감소를 이끌 수 있는지 조사한다.
- 인위적 데이터에서 최적화된 시스템 메시지를 실세계 작업, 예를 들어 임상 보고서 생성 및 회의 요약과 같은 작업에 전이했을 때 성능 향상 여부를 평가한다.
제안 방법
- LLM이 주어진 문자로 시작하는 이름 목록에서 이름을 검색해야 하는 인위적 검색 작업을 설계하며, 목록에 없는 이름을 생성하는 것을 환각으로 정의한다.
- 연속적인 후치(postfix)를 시스템 프롬프트에 추가하여 프리픽스 튜닝을 통해 시스템 메시지를 최적화함으로써 고수준 지시어의 기울기 기반 최적화를 가능하게 한다.
- 인위적 작업에서 환각을 최소화하면서도 기준 프롬프트에 대해 일관된 출력을 유지함으로써, 부작용 학습을 방지한다.
- 모델 가중치를 추가로 파인튜닝하지 않고도 최적화된 시스템 메시지를 실제 추상적 요약 작업에 전이한다.
- GPT-4를 환각 평가자로 사용하여 실제 작업에서의 환각 비율을 측정하고, SynTra를 기준선 파인튜닝 및 원본 모델과 비교한다.
- 모델이 인위적 작업의 구조에 기반한 부작용 패턴을 학습하지 않도록 일관성 정규화 손실을 적용한다.
실험 결과
연구 질문
- RQ1환각을 유도하고 측정할 수 있는 인위적 작업에서 시스템 메시지를 최적화하면, 실제 추상적 요약 작업에서 환각이 줄어들 수 있는가?
- RQ2프리픽스 튜닝을 통해 시스템 메시지를 최적화하는 것이, 인위적 작업에서 전체 모델 가중치를 파인튜닝하는 것보다 더 잘 전이되는가?
- RQ3인위적 작업 설계가 실제 작업으로 일반화될 수 있도록 환각을 효과적으로 유도하고 측정할 수 있는가?
- RQ4SynTra를 적용한 후 다양한 실제 작업에서 환각 비율은 어떻게 변화하며, 이는 모델 아키텍처에 따라 달라지는가?
주요 결과
- SynTra는 Orca(13B 파라미터 LLM)에 적용되었을 때, 세 가지 실제 추상적 요약 작업에서 평균 7점 이상 환각 비율을 감소시켰다.
- 특정 작업에서는 환각 비율이 최대 16점까지 감소하여, 도전적인 환경에서 뚜렷한 성능 향상을 보였다.
- 인위적 작업에서 전체 모델을 파인튜닝하면 환각 비율이 증가하여, 전체 파인튜닝이 환각 감소에 오히려 역효과를 낼 수 있음을 시사한다.
- 최적화된 시스템 메시지는 기준 요약과 더 많은 겹침을 보이며, 근거 없는 실체를 포함하는 비율도 감소시켜 사실 일관성이 향상됨을 확인했다.
- 모델 가중치가 아닌 시스템 메시지를 최적화하는 것이 핵심이었으며, 이는 다양한 후행 작업에서 더 나은 일반화와 환각 감소를 가능하게 했다.
- 이 방법은 검색-검색, 회의 요약, 임상 보고서 생성 작업에서 두 개의 13B 파라미터 LLM(Vicuna v1.1 및 Orca) 모두에서 일관된 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.