Skip to main content
QUICK REVIEW

[논문 리뷰] Multiview Identifiers Enhanced Generative Retrieval

Yongqi Li, Nan Yang|arXiv (Cornell University)|2023. 05. 26.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 다중 시각 식별자 기반의 생성적 검색 프레임워크인 MINDER를 제안한다. MINDER는 문단 내용에서 합성 식별자—특히 다중 문장 의미를 반영한 의사 질의(pseudo-queries)를 생성함으로써 검색 성능을 향상시킨다. 제목, 부분 문자열, 그리고 내용 기반의 의사 질의와 같은 상호보완적인 시각을 함께 활용함으로써 MINDER는 세 개의 공개 데이터셋에서 최신 기준 성능을 달성하며, 다양한 유형의 질의에 걸쳐 뛰어난 강건성과 포괄성을 입증한다.

ABSTRACT

Instead of simply matching a query to pre-existing passages, generative retrieval generates identifier strings of passages as the retrieval target. At a cost, the identifier must be distinctive enough to represent a passage. Current approaches use either a numeric ID or a text piece (such as a title or substrings) as the identifier. However, these identifiers cannot cover a passage's content well. As such, we are motivated to propose a new type of identifier, synthetic identifiers, that are generated based on the content of a passage and could integrate contextualized information that text pieces lack. Furthermore, we simultaneously consider multiview identifiers, including synthetic identifiers, titles, and substrings. These views of identifiers complement each other and facilitate the holistic ranking of passages from multiple perspectives. We conduct a series of experiments on three public datasets, and the results indicate that our proposed approach performs the best in generative retrieval, demonstrating its effectiveness and robustness.

연구 동기 및 목표

  • 기존의 생성적 검색 방법이 제목이나 숫자 식별자와 같은 정적 식별자에 의존함에 따라 맥락적 풍부성과 종합적 커버리지가 부족한 점을 해결하기 위해.
  • 특히 다중 문장 의미를 반영한 의사 질의와 같은 문단 내용에서 유도된 합성 식별자를 도입하여 검색 성능을 향상시키기 위해.
  • 일반 질의, 세부 질의, 복잡한 질의 등 다양한 유형의 질의에 적합한 각기 다른 식별자 시각(제목, 부분 문자열, 의사 질의)을 동시에 고려함으로써 종합적인 문단 순위 매기기를 가능하게 하기 위해.
  • 다중 시각 식별자 통합이 다양한 검색 시나리오 전반에서 모델의 강건성과 효과성을 향상시킨다는 것을 입증하기 위해.

제안 방법

  • MINDER는 질의와 식별자 유형(예: '제목', '부분 문자열', '의사 질의')에 조건부로 작동하는 자동회귀 언어 모델을 사용하여 식별자를 생성한다.
  • 합성 식별자는 문단의 일부를 질문 형식으로 재구성한 것으로, 맥락적으로 풍부한 다중 문장 식별자 역할을 한다.
  • 모델은 각 시각에 대해 다수의 후보 식별자를 생성하기 위해 비드 서치를 활용하며, 이후 히우리스틱 함수를 통해 후보 문단을 집계 및 순위 매긴다.
  • 문단은 모든 세 가지 식별자 시각에서의 커버리지 기반으로 순위가 매겨지며, 서로 다른 시각에서 유도된 상호보완적 점수를 제공한다.
  • 식별자 저장 및 검색을 효율적으로 수행하기 위해 FM-인덱스 데이터 구조를 사용하여 식별자 크기와 선형적인 공간 복잡도를 확보한다.

실험 결과

연구 질문

  • RQ1문단 내용에서 유도된 합성 식별자가 제목이나 부분 문자열과 같은 정적 식별자보다 생성적 검색 성능을 향상시킬 수 있는가?
  • RQ2제목, 부분 문자열, 의사 질의와 같은 다중 시각 식별자를 통합할 경우 단일 시각 접근 방식에 비해 검색 성능이 어떻게 향상되는가?
  • RQ3다중 시각 식별자가 일반 질의, 세부 질의, 복잡한 질의 등 다양한 유형의 질의에 걸쳐 강건성을 얼마나 향상시키는가?
  • RQ4의사 질의를 합성 식별자로 포함할 경우 검색 커버리지와 정확도에 어떤 영향을 미치는가?

주요 결과

  • MINDER는 MSMARCO, NQ, TriviaQA 세 개의 공개 데이터셋에서 기존의 생성적 검색 방법을 능가하는 최신 기준 성능을 달성한다.
  • 의사 질의를 합성 식별자로 포함시킴으로써 복잡한 질의에 대해 다중 문장 이해가 필요한 경우 검색 커버리지가 크게 향상된다.
  • NQ와 TriviaQA에서 비드 크기가 15~20일 때 최적의 성능을 기록하지만, 높은 문단 중복성으로 인해 MSMARCO에서는 더 작은 비드 크기(예: 5)가 더 바람직하다.
  • MSMARCO에서는 부분 문자열 시각이 낮은 특이성으로 인해 성능 기여도가 낮은 반면, 제목과 의사 질의 시각은 모든 데이터셋에서 뛰어난 성능을 보였다.
  • 다중 시각 생성 과정으로 인해 MINDER는 SEAL 대비 1.2배 더 많은 추론 시간을 소모하지만, 이는 향상된 검색 정확도로 상쇄된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.