Skip to main content
QUICK REVIEW

[논문 리뷰] Long-Context LLMs Meet RAG: Overcoming Challenges for Long Inputs in RAG

Bowen Jin, Jinsung Yoon|arXiv (Cornell University)|2024. 10. 08.
Scientific Computing and Data ManagementDecision Sciences인용 수 3
한 줄 요약

이 논문은 장기적 맥락을 갖는 검색 증강 생성(RAG) 시스템에서 검색된 문단 수를 늘릴수록 성능 저하가 발생하는 원인을 조사하며, '하드 네거티브'가 주요 원인임을 규명한다. 이를 바탕으로 학습이 필요 없는 검색 재정렬 및 두 가지 RAG 전용 미세조정 방법—암묵적 강건성 미세조정과 명시적 추론 기반 미세조정—을 제안하며, 다양한 벤치마크에서 뚜렷한 성능 향상을 입증한다. 특히 최고의 방법은 기본 모델 대비 정확도를 최대 12.7% 향상시킨다.

ABSTRACT

Retrieval-augmented generation (RAG) empowers large language models (LLMs) to utilize external knowledge sources. The increasing capacity of LLMs to process longer input sequences opens up avenues for providing more retrieved information, to potentially enhance the quality of generated outputs. It is plausible to assume that a larger retrieval set would contain more relevant information (higher recall), that might result in improved performance. However, our empirical findings demonstrate that for many long-context LLMs, the quality of generated output initially improves first, but then subsequently declines as the number of retrieved passages increases. This paper investigates this phenomenon, identifying the detrimental impact of retrieved "hard negatives" as a key contributor. To mitigate this and enhance the robustness of long-context LLM-based RAG, we propose both training-free and training-based approaches. We first showcase the effectiveness of retrieval reordering as a simple yet powerful training-free optimization. Furthermore, we explore training-based methods, specifically RAG-specific implicit LLM fine-tuning and RAG-oriented fine-tuning with intermediate reasoning, demonstrating their capacity for substantial performance gains. Finally, we conduct a systematic analysis of design choices for these training-based methods, including data distribution, retriever selection, and training context length.

연구 동기 및 목표

  • 장기적 맥락을 갖는 RAG 시스템에서 검색된 문단 수를 늘릴수록 Recall은 높아지지만 성능 저하가 발생하는 이유를 조사한다.
  • 강력한 검색기에서 유도되는 '하드 네거티브'가 장기적 맥락 LLM에서의 성능 저하의 주요 원인임을 규명한다.
  • 노이즈가 섞이거나 관련성이 없는 검색된 내용에 대한 강건성을 향상시키기 위한 학습이 필요 없는 방법과 학습 기반 방법을 개발한다.
  • 데이터 분포, 검색기 선택, 맥락 길이 등의 설계 요소가 RAG 전용 미세조정에 미치는 영향을 평가한다.
  • 일반적인 SFT 데이터와 RAG 전용 미세조정 데이터를 조합함으로써 일반 능력을 유지하면서도 RAG 성능을 향상시킬 수 있음을 입증한다.

제안 방법

  • 검색 재정렬: 고점수를 받은 문서를 입력 시퀀스의 앞과 끝에 배치하여 '중간에서 잃어버림' 현상으로 인한 어텐션 문제를 완화한다.
  • 암묵적 강건성 미세조정: 노이즈가 섞이거나 하드 네거티브가 포함된 질의-문단 쌍으로 LLM을 미세조정하여 명시적 관련성 레이블 없이도 일반 강건성을 향상시킨다.
  • 명시적 관련성 미세조정: 미세조정 과정에서 LLM이 생성 전에 관련 정보를 식별하는 중간 추론 단계를 도입함으로써 관련성 식별 능력을 향상시킨다.
  • 학습 데이터 스케일링: RAG 전용 데이터 5,000~200,000개의 샘플을 대상으로 성능을 평가하며, 데이터 규모가 클수록 일관되게 정확도 향상을 보인다.
  • 하이브리드 미세조정: RAG 전용 데이터와 일반 SFT 데이터(예: UltraChat)를 조합하여 일반 능력을 유지하면서도 RAG 성능을 향상시킨다.
  • 체계적 아블레이션: 검색기의 강도, 학습 맥락 길이, 데이터 분포가 미세조정 효과에 미치는 영향을 평가한다.

실험 결과

연구 질문

  • RQ1장기적 맥락 RAG 시스템에서 검색된 문단 수를 늘릴수록 성능 향상이 일관되게 이루어지는가?
  • RQ2강력한 검색기에서 유도되는 '하드 네거티브'가 장기적 맥락 RAG에서 LLM 생성 품질에 얼마나 심각하게 악영향을 미치는가?
  • RQ3검색 재정렬이 장기적 맥락 LLM에서 어텐션 비효율성을 완화하는 데 효과적인가?
  • RQ4노이즈가 섞인 검색된 내용에 대한 강건성을 향상시키기 위해 암묵적 미세조정이 얼마나 효과적인가?
  • RQ5미세조정 과정에서 중간 추론 단계를 추가하면 관련성 식별 능력과 최종 출력 품질이 뚜렷이 향상되는가?

주요 결과

  • 장기적 맥락 RAG 작업에서 검색된 문단 수가 늘어나면 성능이 일시적으로 향상되지만, 이후 감소하며, 30개 문단에서 최고 성능을 기록한 후 하락함을 확인하여, Recall과 노이즈 사이의 상충 관계를 규명한다.
  • 더 강력한 검색기가 더 해로운 '하드 네거티브'를 유도하여, 약한 검색기 대비 성능 저하를 악화시킨다.
  • 검색 재정렬은 평균적으로 어텐션을 중간 순위의 관련 없는 문단에 덜 집중시킴으로써 성능을 최대 4.2% 향상시킨다.
  • 중간 추론 단계를 포함한 명시적 관련성 미세조정이 가장 높은 성능 향상을 기록하며, TriviaQA와 HotpotQA에서 기준 모델 대비 정확도를 최대 12.7% 향상시킨다.
  • RAG 전용 미세조정 데이터를 5,000개에서 200,000개로 확대하면 성능이 일관되게 향상되며, NQ에서 정확도는 0.5805에서 0.6176으로 상승한다.
  • RAG 전용 미세조정 데이터와 일반 SFT 데이터를 조합하면 일반 능력(예: MT-Bench 점수)을 유지하면서도 RAG 성능을 향상시키며, NQ 정확도는 0.5687에서 0.6033으로 상승한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.