[논문 리뷰] Overview of the TREC 2019 Fair Ranking Track
이 논문은 정보 검색 시스템에서 콘텐츠 제공자에 대한 공정성과 관련성의 균형을 평가하기 위한 TREC 2019 Fair Ranking Track를 소개한다. 학술 초록을 기반으로 한 재정렬 작업을 제안하며, 그룹 정의가 알려지지 않은 상황(예: 소속 기관의 명성, h-지수)에서 노출도를 기반으로 공정성을 측정한다. 다양한 그룹화 방식에서 fair_LambdaMART 및 uognleMaxUtil과 같은 시스템이 높은 공정성과 유틸리티의 상호보완적 성능을 달성한 것으로 보고된다.
The goal of the TREC Fair Ranking track was to develop a benchmark for evaluating retrieval systems in terms of fairness to different content providers in addition to classic notions of relevance. As part of the benchmark, we defined standardized fairness metrics with evaluation protocols and released a dataset for the fair ranking problem. The 2019 task focused on reranking academic paper abstracts given a query. The objective was to fairly represent relevant authors from several groups that were unknown at the system submission time. Thus, the track emphasized the development of systems which have robust performance across a variety of group definitions. Participants were provided with querylog data (queries, documents, and relevance) from Semantic Scholar. This paper presents an overview of the track, including the task definition, descriptions of the data and the annotation process, as well as a comparison of the performance of submitted systems.
연구 동기 및 목표
- 정보 검색 시스템에서 소외된 저자들의 콘텐츠 가시성 불균형을 해결하기 위해.
- 기존의 관련성 지표와 보완되는 표준화된 공정성 평가 프레임워크를 개발하기 위해.
- 공정성 평가를 위한 벤치마크 데이터셋을 구축하여 저자 그룹 소속 및 관련성 레이블을 함께 제공하기 위해.
- 테스트 시기 동안 다수의 알려지지 않은 그룹 정의에 대해 강건한 재정렬 시스템 개발을 장려하기 위해.
- 개별 순위가 아니라 순서 전체에 걸쳐 저자들의 장기적 노출도를 측정하는 공정성 지표를 촉진하기 위해.
제안 방법
- 사용자가 정지 확률과 순위 위치에 기반해 저자에 대한 기대 노출도를 계산하는 브라우징 모델 기반의 노출 지표를 정의한다.
- Semantic Scholar의 클릭 로그를 사용하여 클릭이 관련성임을 가정하고 이진 관련성 레이블을 유도한다.
- 관련성과 공정성을 동시에 최적화하기 위해 각 쿼리에 대해 문서 집합을 재정렬하는 재정렬 작업을 적용한다.
- 사전 정의된 저자 그룹 간의 노출 불균형에서 유도된 불공정성 지표를 사용해 공정성을 측정한다.
- 질의 수준에서의 매크로 및 마이크로 암ort라이제이션 평가를 통해 대규모 시스템 성능을 평가한다.
- 그룹 정의가 제출 이후에 공개되는 프rotocol를 사용하여 시스템의 다양한 그룹화에 대한 강건성을 테스트한다.
실험 결과
연구 질문
- RQ1내용 생산자의 장기적 노출도를 고려할 때, 순위의 공정성은 어떻게 측정할 수 있는가?
- RQ2초기 검색 결과에서 우세한 저자나 기관을 우선시하는 편향을 재정렬 시스템이 얼마나 효과적으로 수정할 수 있는가?
- RQ3테스트 시기 동안 알려지지 않은 다수의 그룹 정의에 대해 다양한 공정성 인식 알고리즘이 어떻게 성능을 내는가?
- RQ4다양한 그룹화 방식 하에서 학술 검색 순위에서 관련성과 공정성 간의 상호보완적 성능는 어떠한가?
- RQ5클릭 기반의 관련성 레이블링 편향이 순위 시스템의 공정성 평가에 어떤 영향을 미치는가?
주요 결과
- IMF 수준의 그룹 정의(두 그룹) 하에서 fair_LambdaMART 시스템은 기대 유틸리티 0.6599와 중간 수준의 불공정성(0.0741)을 기록했다.
- 동일한 그룹 정의 하에서 uognleMaxUtil 시스템은 기대 유틸리티 0.6741과 중간 수준의 불공정성(0.0799)을 기록했다.
- QUARTZ-e0.00100 및 QUARTZ-e0.00200 시스템은 IMF 수준의 그룹화에서 불공정성 값 약 0.035를 기록하며 뛰어난 공정성 성능를 보였다.
- 4개 그룹으로 나누어진 h-index 그룹화 하에서 fair_LambdaMART는 불공정성 0.0855와 유틸리티 0.6599를 기록하여 뚜렷한 상호보완적 성능를 보였다.
- h-index 그룹화 하에서 uognleMaxUtil 시스템은 최고의 유틸리티(0.6741)와 중간 수준의 불공정성(0.0656)을 기록하여 다양한 그룹 정의에서 뛰어난 성능를 보였다.
- 결과는 공정성 인식 재정렬 기법이 관련성 손실 없이 노출의 공정성을 향상시킬 수 있으며, 특히 그룹 정의가 사전에 알려지지 않은 경우에 특히 효과적임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.