[논문 리뷰] INTERS: Unlocking the Power of Large Language Models in Search with Instruction Tuning
이 논문은 정보 검색(IR) 작업을 위한 대규모 언어 모델(LLM)의 성능을 향상시키기 위해 특별히 설계된 새로운 지시 튜닝 데이터셋인 INTERS를 소개한다. 43개의 데이터셋에서 추출한 21개의 검색 관련 작업(질의 이해, 문서 이해, 질의-문서 관계 이해 포함)을 바탕으로 수작업으로 작성한 템플릿을 활용하여, LLaMA, 미스트랄, 파이와 같은 다양한 모델에서 도메인 내 및 도메인 외 IR 작업 전반에 걸쳐 일관된 성능 향상을 이룬다.
Large language models (LLMs) have demonstrated impressive capabilities in various natural language processing tasks. Despite this, their application to information retrieval (IR) tasks is still challenging due to the infrequent occurrence of many IR-specific concepts in natural language. While prompt-based methods can provide task descriptions to LLMs, they often fall short in facilitating a comprehensive understanding and execution of IR tasks, thereby limiting LLMs' applicability. To address this gap, in this work, we explore the potential of instruction tuning to enhance LLMs' proficiency in IR tasks. We introduce a novel instruction tuning dataset, INTERS, encompassing 20 tasks across three fundamental IR categories: query understanding, document understanding, and query-document relationship understanding. The data are derived from 43 distinct datasets with manually written templates. Our empirical results reveal that INTERS significantly boosts the performance of various publicly available LLMs, such as LLaMA, Mistral, and Phi, in IR tasks. Furthermore, we conduct extensive experiments to analyze the effects of instruction design, template diversity, few-shot demonstrations, and the volume of instructions on performance. We make our dataset and the fine-tuned models publicly accessible at https://github.com/DaoD/INTERS.
연구 동기 및 목표
- 정보 검색(IR) 작업에서 관련성 및 사용자 의도와 같은 IR 전용 개념에 대한 노출 빈도가 낮아 LLM의 성능이 제한되는 문제를 해결하기 위해.
- IR에 특화된 지시 튜닝 데이터셋의 부족을 보완하기 위해 검색 관련 작업을 위한 전용이고 종합적인 데이터셋을 구축하기 위해.
- 지시 설계, 데이터 양, few-shot 학습이 LLM의 IR 성능에 미치는 영향을 체계적인 실험을 통해 조사하기 위해.
- 다양하고 작업 중심의 템플릿에 대한 지시 튜닝을 통해 LLM의 새로운 IR 작업으로의 일반화 능력을 향상시키기 위해.
제안 방법
- 저자들은 21개의 검색 관련 작업으로 구성된 3개의 범주(질의 이해, 문서 이해, 질의-문서 관계 이해)에 속하는 43개의 기존 데이터셋을 수집한다.
- 각 작업에 대해 모델의 행동을 이끌고 작업 이해도를 향상시키기 위해 작업 설명과 12개의 고유한 입력 템플릿을 수작업으로 설계한다.
- 모든 예시를 43개의 데이터셋에서 혼합하여, 해당하는 지시와 템플릿을 사용해 포맷팅한 후 데이터셋을 구성한다.
- LLaMA, 미스트랄, 파이와 같은 여러 오픈소스 LLM에 대해 INTERS 데이터셋을 사용하여 피니테인딩을 수행하여 IR 작업에 적합하게 조정한다.
- 템플릿, 데이터 양, few-shot 학습의 영향을 평가하기 위해, 이러한 구성 요소가 포함된 경우와 포함되지 않은 경우를 비교하는 추상화 실험을 수행한다.
- 일반화 능력을 평가하기 위해 미리 보지 않은 작업에서 제로샷 및 few-shot 추론을 평가하며, 표준 IR 메트릭을 사용해 성능을 측정한다.
실험 결과
연구 질문
- RQ1INTERS와 같이 작업 중심의 데이터셋에 대한 지시 튜닝이 다양한 IR 작업 전반에서 LLM 성능을 어떻게 향상시키는가?
- RQ2수작업으로 설계된 지시 템플릿이 모델 성능과 작업 이해도에 어떤 영향을 미치는가?
- RQ3훈련 데이터의 양이 지시 튜닝된 LLM의 일반화 능력과 성능에 어떤 영향을 미치는가?
- RQ4few-shot 예시가 도메인 외 IR 작업으로의 일반화 능력 향상에 얼마나 기여하는가?
- RQ5다양한 작업 유형에서 LLaMA, 미스트랄, 파이와 같은 다양한 베이스 모델은 INTERS에서의 피니테인딩을 통해 어떤 이점을 얻는가?
주요 결과
- INTERS는 LLaMA, 미스트랄, 파이 모델 전반에 걸쳐 도메인 내 및 도메인 외 IR 작업에서 다수의 오픈소스 LLM 성능을 뚜렷이 향상시키며, 일관된 성능 향상을 보였다.
- 훈련 중 지시 템플릿의 사용은 성능 향상에 명백한 기여를 하며, 템플릿을 생략한 추상화 실험에서 성능이 열 劣하므로, 작업 이해도 향상에 있어 템플릿의 중요성을 확인한다.
- 훈련 데이터의 양을 늘일수록 성능 향상이 일관되게 관찰되나, 작업 유형에 따라 데이터 양에 대한 민감도가 달라지며, 특히 리랭킹 작업에서 더 많은 데이터가 성능 향상에 가장 크게 기여한다.
- few-shot 예시는 모든 작업에서 성능 향상에 일관되게 기여하며, 특히 읽기 이해(BoolQ)와 같은 복잡한 출력 공간에서는 작업과 출력 형식을 명확히 하는 데 도움을 주어 성능 향상에 기여한다.
- FLAN으로 튜닝한 모델에 비해 INTERS로 튜닝한 모델은 특히 리랭킹 작업에서 뛰어난 성능을 보이며, IR 작업에 특화된 지시 튜닝의 우수성을 입증한다.
- 질의 재구성 작업은 다양한 데이터 양에서도 안정적인 성능을 유지하여, 간단한 성격 덕분에 데이터 민감도가 낮다는 것을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.