Skip to main content
QUICK REVIEW

[논문 리뷰] Interpreting search result rankings through intent modeling

Jaspreet Singh, Avishek Anand|arXiv (Cornell University)|2018. 09. 13.
Explainable Artificial Intelligence (XAI)참고 문헌 26인용 수 4
한 줄 요약

이 논문은 복잡한 신경 순위 매기기 모델의 의도를 해석하기 위해 쿼리 확장과 단순 검색 모델을 사용하는 후행적이고 모델에 종속되지 않는 프레임워크를 제안한다. 확장된 쿼리 텀이 순위 결정의 해석 가능한 설명으로 기능하며, 높은 局소 적합도와 전역 정확도 향상을 위해 선별적인 선호도 쌍 샘플링을 통해 모델의 편향과 쌍별 문서 순위 차이를 탐지할 수 있음을 입증한다.

ABSTRACT

Given the recent interest in arguably accurate yet non-interpretable neural models, even with textual features, for document ranking we try to answer questions relating to how to interpret rankings. In this paper we take first steps towards a framework for the interpretability of retrieval models with the aim of answering 3 main questions "What is the intent of the query according to the ranker?", "Why is a document ranked higher than another for the query?" and "Why is a document relevant to the query?" Our framework is predicated on the assumption that text based retrieval model behavior can be estimated using query expansions in conjunction with a simpler retrieval model irrespective of the underlying ranker. We conducted experiments with the Clueweb test collection. We show how our approach performs for both simpler models with a closed form notation (which allows us to measure the accuracy of the interpretation) and neural ranking models. Our results indicate that we can indeed interpret more complex models with reasonable accuracy under certain simplifying assumptions. In a case study we also show our framework can be employed to interpret the results of the DRMM neural retrieval model in various scenarios.

연구 동기 및 목표

  • 정보 검색에서 사용되는 복잡한 신경 순위 매기기 모델의 해석 가능성 부족 문제를 해결하기 위해.
  • 문서 A가 문서 B보다 높이 순위 매겨지거나 쿼리에 관련 있다고 판단되는 이유를 설명하는 후행적이고 모델에 종속되지 않는 방법을 개발하기 위해.
  • 쿼리 확장과 간단한 검색 모델을 사용해 블랙박스 순위 매기기 모델이 인식하는 잠재적 쿼리 의도를 추정하기 위해.
  • 해석된 의도에 포함된 단어를 분석함으로써 시간적 및 모델 고유의 편향을 탐지하기 위해.
  • 개발자와 사용자가 이해하고 디버깅하며 모델을 향상시킬 수 있도록 인간이 읽을 수 있는 설명을 제공하기 위해.

제안 방법

  • 블랙박스 순위 매기기 모델이 인식하는 쿼리 의도를 반영하는 의도 텀 세트를 생성하기 위해 쿼리 확장을 사용한다.
  • 확장된 쿼리를 기반으로 기존 순위 매기기 모델의 출력을 근사하기 위해 단순하고 해석 가능한 검색 모델(예: BM25 또는 TF-IDF)을 훈련시킨다.
  • 원래 순위에서 유도된 쌍별 문서 비교를 통해 해석 작업을 선호도 학습 문제로 공식화한다.
  • 선호도 쌍을 사용해 블랙박스 모델과 단순 모델 간의 순위 불일치를 최소화함으로써 확장된 쿼리를 최적화한다.
  • 약한 지도 학습 환경에서 설명에 포함된 잘못된 양성 텀을 줄이기 위해 문서 편집 기법을 적용한다.
  • 어휘 빈도와 문서 길이를 활용한 단어 중요도 점수를 시각화하여 왜 한 문서가 다른 문서보다 더 높이 순위 매겨졌는지 설명한다.

실험 결과

연구 질문

  • RQ1블랙박스 순위 매기기 모델이 인식하는 실제 쿼리 의도는 무엇인가?
  • RQ2주어진 쿼리에서 왜 문서 A가 문서 B보다 높이 순위 매겨졌는가?
  • RQ3어떤 특정 문서가 모델의 내부 논리에 따라 쿼리에 관련 있다고 판단되는 이유는 무엇인가?
  • RQ4해석 가능한 쿼리 확장 설명을 통해 복잡한 신경 순위 매기기 모델의 행동을 정확히 근사할 수 있는가?
  • RQ5이 프레임워크는 순위 결정에서 시간적 및 모델 고유의 편향을 탐지할 수 있는가?

주요 결과

  • 프레임워크는 상위-k 결과에서 유도된 선호도 쌍에 집중함으로써 높은 국소 적합도를 달성하지만, 이는 전역 정확도를 약간 희생시킨다.
  • 낮은 순위의 문서들로부터 추가적인 선호도 쌍을 샘플링하면 국소 정밀도가 감소하더라도 전역 적합도가 크게 향상된다.
  • 상위-k + 무작위 순위 샘플링 전략은 순수 무작위 또는 순위 편향 샘플링보다 항상 뛰어나며, 국소와 전역 적합도 사이의 균형이 최적임을 시사한다.
  • 약한 지도 학습 환경에서는 설명에 포함된 잘못된 양성 텀을 줄이기 위해 문서 편집이 필수적이다.
  • DRMM과 DESM에 대한 사례 연구에서 명확한 시간적 편향을 확인할 수 있었다: DRMM은 2004년대 뉴스 이벤트(예: 아프가니스탄 전쟁, 고어의 2000년 선거)를 선호하는 경향이 있었고, DESM은 더 일반적인 의미적 개념(예: 국기, 간호사)을 반영했다.
  • 어휘 중요도 점수를 기반으로 한 시각화된 설명은 예를 들어 희귀하지만 관련성이 높은 단어(예: '장기')를 포함한 문서가 의미적으로 유사하지만 덜 구체적인 문서보다 더 높이 순위 매겨지는 이유를 효과적으로 설명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.