[논문 리뷰] Banishing LLM Hallucinations Requires Rethinking Generalization
논문은 LLM의 무작위 데이터 암기가 전통적 일반화 관점에 도전한다고 주장하며, 환각을 제거하기 위한 거대한 기억-전문가 혼합을 가진 Lamini-1을 제안하고 계산적 트레이드오프를 분석한다.
Despite their powerful chat, coding, and reasoning abilities, Large Language Models (LLMs) frequently hallucinate. Conventional wisdom suggests that hallucinations are a consequence of a balance between creativity and factuality, which can be mitigated, but not eliminated, by grounding the LLM in external knowledge sources. Through extensive systematic experiments, we show that these traditional approaches fail to explain why LLMs hallucinate in practice. Specifically, we show that LLMs augmented with a massive Mixture of Memory Experts (MoME) can easily memorize large datasets of random numbers. We corroborate these experimental findings with a theoretical construction showing that simple neural networks trained to predict the next token hallucinate when the training loss is above a threshold as it usually does in practice when training on internet scale data. We interpret our findings by comparing against traditional retrieval methods for mitigating hallucinations. We use our findings to design a first generation model for removing hallucinations -- Lamini-1 -- that stores facts in a massive mixture of millions of memory experts that are retrieved dynamically.
연구 동기 및 목표
- LLMs의 일반화 오차가 LLM의 환각 예측자로 충분한가를 질문한다.
- LLMs가 일반화 오차를 증가시키지 않으면서 무작위 데이터를 암기할 수 있음을 보여준다.
- 사실을 저장하고 검색하기 위해 거의 제로에 가까운 훈련 손실로 핵심 사실을 다루는 메모리 기반 아키텍처(Lamini-1)를 제안한다.
- 환각 제거를 위한 광범위한 기억화를 통한 계산 비용과 에너지 소모를 평가한다.
- 전통적 검색 및 규제 접근 방식의 한계를 강조한다.
제안 방법
- LLMs가 무작위 토큰을 거의 제로에 가까운 훈련 손실로 암기한다는 것을 보여주는 무작위 라벨링 실험을 수행한다.
- 참/무작위 라벨로 훈련될 때의 행태를 비교하기 위한 규제 실험을 사용한다.
- 환각 완화를 위한 정보 검색에서 영감을 받은 아키텍처와 그 한계를 분석한다.
- frozen 백본에 대규모 메모리 전문가 혼합(MoME)을 부착한 Lamini-1 아키텍처를 도입한다.
- 교차 어텐션 기반 라우팅으로 메모리 전문가의 일부만 업데이트하여 사실을 기억하도록 하는 훈련 프로토콜을 설명한다.
- 핵심 사실에서 거의 제로의 손실을 달성하기 위한 계산 비용 추정치를 제공하고 이를 기준 확장 레시피와 비교한다.
실험 결과
연구 질문
- RQ1일반화 오차가 환각을 보이는 모델과 보이지 않는 모델을 구분할 수 있는가?
- RQ2일반화 성능 손실 없이 LLM이 무작위 데이터를 어느 정도까지 암기할 수 있는가?
- RQ3Lamini-1 같은 메모리 기반 아키텍처가 사실 기억의 환각을 제거할 수 있는가, 그리고 그 계산 비용은 어느 정도인가?
- RQ4전통적 검색 및 규제 설명이 무작위화 및 메모리-밍 결과에 비해 환각에 대해 어떻게 작용하는가?
주요 결과
- LLMs는 무작위 라벨의 대규모 데이터셋을 거의 제로에 가까운 미세조정 손실로 암기할 수 있으며, 표준 태스크에서 일반화 저하가 눈에 띄게 나타나지 않는다.
- 일반화 오차만으로는 환각을 보이는 모델과 보이지 않는 모델을 구별할 수 없다; MMLU 같은 벤치마크도 사실 기억 능력을 신뢰성 있게 예측하지 않는다.
- 메모리 기반의 기존 확장 레시피 하에서 환각 제거를 위한 표적 훈련은 상당한 계산 비용이 든다(예: SGD 에포크 100배 증가).
- 메모리 기반 Lamini-1 아키텍처(MoME)는 수백만 개의 메모리 전문가로부터 정보를 검색하여 사실을 암기하고, 핵심 사실에서 거의 제로 손실을 달성하며, 특화된 하드웨어 커널로 사실 기억을 개선한다.
- 메모리 튜닝은 사실을 트랜스포머 파라미터에만 인코딩하는 것이 아니라 명시적 기억으로 저장함으로써 환각을 줄인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.