Skip to main content
QUICK REVIEW

[논문 리뷰] The Web Can Be Your Oyster for Improving Large Language Models

Junyi Li, Tianyi Tang|arXiv (Cornell University)|2023. 05. 18.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)의 성능을 향상시키기 위해 실시간으로 최신이고 종합적인 지식을 확보할 수 있도록 Google 검색을 동적으로 쿼리하는 통합 웹 증강 프레임워크인 UniWeb을 제안한다. 이는 노이즈가 많은 검색 결과를 줄이기 위한 적응형 검색 엔진 보조 학습과 검색된 웹 콘텐츠를 모델 내부 지식과 일치시키기 위한 지속적 지식 학습을 도입하여, 16개의 지식 집약적 과제에서 이전의 검색 증강 방법들을 크게 앞서는 성능을 보인다.

ABSTRACT

Large language models (LLMs) encode a large amount of world knowledge. However, as such knowledge is frozen at the time of model training, the models become static and limited by the training data at that time. In order to further improve the capacity of LLMs for knowledge-intensive tasks, we consider augmenting LLMs with the large-scale web using search engine. Unlike previous augmentation sources (e.g., Wikipedia data dump), the web provides broader, more comprehensive and constantly updated information. In this paper, we present a web-augmented LLM UNIWEB, which is trained over 16 knowledge-intensive tasks in a unified text-to-text format. Instead of simply using the retrieved contents from web, our approach has made two major improvements. Firstly, we propose an adaptive search engine assisted learning method that can self-evaluate the confidence level of LLM's predictions, and adaptively determine when to refer to the web for more data, which can avoid useless or noisy augmentation from web. Secondly, we design a pretraining task, i.e., continual knowledge learning, based on salient spans prediction, to reduce the discrepancy between the encoded and retrieved knowledge. Experiments on a wide range of knowledge-intensive tasks show that our model significantly outperforms previous retrieval-augmented methods.

연구 동기 및 목표

  • 정적이고 오래된 지식의 한계를 극복하기 위해 웹에서 동적으로 최신 정보를 통합함으로써 대규모 언어 모델(Large Language Models, LLMs)의 지식을 향상시키는 것.
  • 완전하지 않고 실시간으로 업데이트되지 않는 정적 지식 소스(예: 위키백과)에 대한 의존도를 줄이는 것.
  • 다양한 지식 집약적 과제를 효과적으로 활용하기 위해 웹 검색을 통합한 통합형 다중 작업 프레임워크를 개발하는 것.
  • 새로운 사전학습 작업을 통해 모델 내부 지식과 외부에서 검색된 지식 간의 격차를 최소화하는 것.
  • 노이즈를 줄이고 신뢰성을 향상시키기 위해 신뢰도 기반 선택적 웹 검색을 가능하게 하는 것.

제안 방법

  • 16개의 다양한 지식 집약적 과제를 통합하기 위해 텍스트-투-텍스트 형식을 채택하여 공동 학습을 수행한다.
  • 예측 신뢰도가 낮을 경우에만 웹 검색을 트리거하는 적응형 검색 엔진 보조 학습 방법을 구현하며, 이는 엔트로피 기반 자기 평가에 기반한다.
  • 광범위하고 실시간이며 종합적인 웹 콘텐츠에 접근하기 위해 상용 검색 엔진(Google Search)을 검색기로 사용한다.
  • 외부 지식을 내부 표현과 일치시키기 위해 검색된 웹 문서의 주요 마스킹 스펜을 예측하도록 훈련하는 '지속적 지식 학습'이라는 사전학습 작업을 설계한다.
  • 통합된 프ompt 구조를 통해 검색된 웹 문장을 모델 입력에 통합하여 외부 증거를 포함한 엔드 투 엔드 생성을 가능하게 한다.
  • 도메인 맞춤 미세조정과 검색된 웹 데이터 기반의 지속적 지식 학습을 조합하여 모델을 엔드 투 엔드로 훈련시킨다.

실험 결과

연구 질문

  • RQ1정적 지식 소스(예: 위키백과)를 초월하여 동적 웹 검색이 지식 집약적 과제에서 LLM의 성능을 향상시킬 수 있는가?
  • RQ2LLM이 필요할 경우에만 웹을 선택적으로 쿼리하도록 할 수 있는 방법은 무엇인가? 이는 노이즈를 줄이고 계산 비용을 절감할 수 있다.
  • RQ3내부 모델 지식와 검색된 웹 지식 간의 분포 격차를 효과적으로 줄이는 사전학습 전략은 무엇인가?
  • RQ4통합 프레임워크는 웹 증강 LLM을 활용해 다양한 지식 집약적 과제를 효과적으로 처리할 수 있는가?
  • RQ5검색된 검색 결과의 품질은 모델 성능에 어떤 영향을 미치며, 최적의 검색 깊이는 얼마인가?

주요 결과

  • UniWeb는 16개의 지식 집약적 과제에서 이전의 검색 증강 방법들을 크게 앞서는 성능을 보이며, 최신 기술 수준의 성능을 입증한다.
  • 실시간 질문 응답 벤치마크인 RealTime QA에서 높은 정확도를 달성하여, '크로아티아와 모로코'가 2022년 월드컵 결승 진출 팀임을 정확히 식별하는 데 성공했으며, 정적 소스는 오래된 콘텐츠로 인해 실패한다.
  • 상위 6~10개의 검색 결과를 사용할 경우 상위 1~5개 결과와 유사한 성능을 달성하여, 비용과 효율성을 균형 잡기 위해 K=10을 선택하는 것이 타당하다고 입증된다.
  • 예측 엔트로피를 통한 자기 평가 결과, 정확한 예측에서는 평균 엔트로피가 낮게 나타나 신뢰도와 강한 상관관계를 보였다.
  • 지속적 지식 학습 사전학습 작업은 인코딩된 지식와 검색된 지식 간 격차를 효과적으로 줄이며, 일치성과 일반화 능력을 향상시킨다.
  • 특히 신뢰도 기반 검색 게이팅과 결합했을 때, 노이즈가 많거나 품질이 낮은 결과에 대해서도 모델이 강건함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.