Skip to main content
QUICK REVIEW

[논문 리뷰] FIT-RAG: Black-Box RAG with Factual Information and Token Reduction

Yuren Mao, Xuemei Dong|arXiv (Cornell University)|2024. 03. 21.
Handwritten Text Recognition Techniques인용 수 4
한 줄 요약

FIT-RAG는 검색 시 사실 정보와 LLM 선호도를 동시에 고려하여 LLM의 효과성과 효율성을 향상시키는 블랙박스 검색 보강 생성 프레임워크이며, 부분 문서 수준의 정제와 자기 지식 인식을 통해 입력 토큰을 줄입니다. 이는 Llama2-13B-Chat의 정확도를 PopQA에서 최대 27.5% 향상시키고, 다양한 데이터셋에서 입력 토큰을 최대 49% 감소시킵니다.

ABSTRACT

Due to the extraordinarily large number of parameters, fine-tuning Large Language Models (LLMs) to update long-tail or out-of-date knowledge is impractical in lots of applications. To avoid fine-tuning, we can alternatively treat a LLM as a black-box (i.e., freeze the parameters of the LLM) and augment it with a Retrieval-Augmented Generation (RAG) system, namely black-box RAG. Recently, black-box RAG has achieved success in knowledge-intensive tasks and has gained much attention. Existing black-box RAG methods typically fine-tune the retriever to cater to LLMs' preferences and concatenate all the retrieved documents as the input, which suffers from two issues: (1) Ignorance of Factual Information. The LLM preferred documents may not contain the factual information for the given question, which can mislead the retriever and hurt the effectiveness of black-box RAG; (2) Waste of Tokens. Simply concatenating all the retrieved documents brings large amounts of unnecessary tokens for LLMs, which degenerates the efficiency of black-box RAG. To address these issues, this paper proposes a novel black-box RAG framework which utilizes the factual information in the retrieval and reduces the number of tokens for augmentation, dubbed FIT-RAG. FIT-RAG utilizes the factual information by constructing a bi-label document scorer. Besides, it reduces the tokens by introducing a self-knowledge recognizer and a sub-document-level token reducer. FIT-RAG achieves both superior effectiveness and efficiency, which is validated by extensive experiments across three open-domain question-answering datasets: TriviaQA, NQ and PopQA. FIT-RAG can improve the answering accuracy of Llama2-13B-Chat by 14.3\% on TriviaQA, 19.9\% on NQ and 27.5\% on PopQA, respectively. Furthermore, it can save approximately half of the tokens on average across the three datasets.

연구 동기 및 목표

  • 기존의 블랙박스 RAG 시스템이 검색 시 사실 정보를 忽시하고 전체 문서를 연결함으로써 토큰을 낭비하는 한계를 해결하기 위해.
  • 검색 과정에 사실 관련성과 LLM 선호도를 이중 레이블로 통합하여 검색 효과성을 향상시키기 위해.
  • 자기 지식 인식과 부분 문서 수준의 토큰 감소를 통해 입력 증강을 줄여 토큰 효율성을 향상시키기 위해.
  • 지식 집약적인 질의 응답 작업에서 정답 정확도와 계산 효율성 사이의 균형 잡힌 트레이드오프를 달성하기 위해.
  • 제한된 계산 자원과 엄격한 토큰 제약 조건이 있는 실세계 응용 프로그램에 블랙박스 RAG의 실용적 구현을 가능하게 하기 위해.

제안 방법

  • 검색 시 사실 관련성과 LLM 선호도를 동시에 최적화하기 위해 두 개의 별도 레이블을 사용하는 이중 레이블 문서 스코어러를 제안합니다.
  • 외부 검색 없이도 LLM이 질문에 답할 수 있는지 식별하기 위해 자기 지식 인식기(self-knowledge recognizer)를 도입합니다.
  • 점수 집계와 필터링을 기반으로 가장 관련성이 높은 부분 문서만 선택하는 부분 문서 수준의 토큰 감소기(token reducer)를 활용합니다.
  • 추론와 설명을 장려하는 복잡한 프롬프트 템플릿을 사용하여 검색된 지식에 대한 LLM 성능을 향상시킵니다.
  • 이중 레이블 스코어러의 통합 점수를 기반으로 상위-k 문서를 선택하고, 가장 관련성 있는 부분 문서에 대해서만 토큰 감소를 적용하는 검색 전략을 적용합니다.
  • 두 단계 프로세스를 활용합니다: 첫 번째로 후보 문서를 검색하고, 두 번째로 부분 문서 필터링과 토큰 감소를 적용한 후 LLM에 입력합니다.

실험 결과

연구 질문

  • RQ1블랙박스 RAG의 검색 과정에 사실 정보를 효과적으로 통합하여 정답 정확도를 향상시킬 수 있는가?
  • RQ2블랙박스 RAG에서 검색 효과성을 훼손하지 않고 토큰 감소를 얼마나 달성할 수 있는가?
  • RQ3정확도와 효율성의 균형을 고려할 때 최적의 입력 문서 수는 얼마인가?
  • RQ4프롬프트 설계가 감소된 입력 토큰을 가진 블랙박스 RAG의 성능에 어떤 영향을 미치는가?
  • RQ5자기 지식 인식기가 실제로 불필요한 검색과 증강을 방지하는 데 효과적인가?

주요 결과

  • FIT-RAG는 Llama2-13B-Chat의 정답 정확도를 TriviaQA에서 14.3%, NQ에서 19.9%, PopQA에서 27.5% 향상시켜 뛰어난 효과성을 입증합니다.
  • FIT-RAG는 TriviaQA에서 49%, NQ에서 37%, PopQA에서 49%의 입력 토큰을 감소시켜 뚜렷한 효율성 향상을 달성합니다.
  • 토큰 감소기의 입력 문서 수로 10개를 사용할 경우 정확도와 토큰 감소 사이의 최적의 균형을 달성하며, 이 이상이 되면 성능 저하가 발생합니다.
  • 간단한 프롬프트와 CoT 프롬프트보다 종합적인 프롬프트 템플릿이 각각 2.7%와 1.5% 높은 정확도를 기록하여 그 효과성을 입증합니다.
  • 자기 지식 인식기가 외부 검색이 필요 없는 경우를 성공적으로 식별하여 불필요한 증강을 줄였습니다.
  • 이중 레이블 문서 스코어러는 사실 관련성과 LLM 선호도를 효과적으로 균형 잡아, 오락적 또는 관련 없는 문서의 검색을 방지합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.