Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Optimal Tree Models Under Beam Search

Jingwei Zhuo, Ziru Xu|arXiv (Cornell University)|2020. 06. 27.
Advanced Image and Video Retrieval Techniques인용 수 7
한 줄 요약

이 논문은 대규모 검색을 위한 트리 기반 모델에서 추론 시 비드 서치를 고려하여 훈련-테스트 불일치를 제거하기 위해 새로운 훈련 알고리즘인 최적 트리 모델(Optimal Tree Model, OTM)을 제안한다. OTM는 비드 서치 인식 서브샘플링과 최적의 의사 타겟 정의를 도입하여, 기존 방법 대비 Amazon Books에서 29.8%의 상대적 리콜 향상과 UserBehavior에서 6.3%의 향상을 달성하며 최신 기술 수준의 성능을 확보한다.

ABSTRACT

Retrieving relevant targets from an extremely large target set under computational limits is a common challenge for information retrieval and recommendation systems. Tree models, which formulate targets as leaves of a tree with trainable node-wise scorers, have attracted a lot of interests in tackling this challenge due to their logarithmic computational complexity in both training and testing. Tree-based deep models (TDMs) and probabilistic label trees (PLTs) are two representative kinds of them. Though achieving many practical successes, existing tree models suffer from the training-testing discrepancy, where the retrieval performance deterioration caused by beam search in testing is not considered in training. This leads to an intrinsic gap between the most relevant targets and those retrieved by beam search with even the optimally trained node-wise scorers. We take a first step towards understanding and analyzing this problem theoretically, and develop the concept of Bayes optimality under beam search and calibration under beam search as general analyzing tools for this purpose. Moreover, to eliminate the discrepancy, we propose a novel algorithm for learning optimal tree models under beam search. Experiments on both synthetic and real data verify the rationality of our theoretical analysis and demonstrate the superiority of our algorithm compared to state-of-the-art methods.

연구 동기 및 목표

  • 비드 서치를 사용한 추론 시 성능 저하가 발생하더라도 최적의 훈련이 이루어지는 트리 기반 모델의 훈련-테스트 불일치 문제를 해결한다.
  • 비드 서치 하에서의 베이즈 최적성과 校정성(calibration)을 새로운 최적성 기준으로 도입하여 문제를 이론적으로 분석한다.
  • 다양한 데이터셋에서 훈련-테스트 불일치를 해결하고 검색 성능을 향상시키는 일반 목적의 훈련 알고리즘을 개발한다.
  • 극도로 다중 레이블 분류를 포함한 합성 및 실세계 데이터셋에서 제안된 방법의 우수성을 입증한다.

제안 방법

  • 비드 서치가 존재하는 상황에서 최적의 검색 성능를 정의하기 위해 비드 서치 하에서의 베이즈 최적성을 개념화한다.
  • 모델 예측을 비드 서치 결과와 일치시키기 위해 비드 서치 하에서의 校정성(calibration)을 훈련 목표로 제안한다.
  • 비드 서치 중 확장될 가능성이 높은 노드를 기반으로 훈련 노드를 선택하는 비드 서치 인식 서브샘플링 전략을 설계한다.
  • 비드 서치 경로를 사용하여 의사 타겟을 최적의 검색 타겟으로 재정의함으로써 훈련과 추론 간 일관성을 확보한다.
  • 확률 추정이 아닌 비드 서치 성능을 최적화하기 위해 손실 함수를 사용하여 노드별 스코어러를 훈련한다.
  • 비드 서치 제약 조건 하에서 트리 구조와 노드별 스코어러를 동시에 최적화하는 엔드 투 엔드 훈련 알고리즘(OTM)을 구현한다.

실험 결과

연구 질문

  • RQ1추론 시 비드 서치가 사용될 경우 트리 모델에 대한 최적성을 공식적으로 정의할 수 있는가?
  • RQ2기존 트리 모델에서 훈련과 테스트 간 성능 격차가 발생하는 원인은 무엇이며, 이는 어떻게 이론적으로 기술할 수 있는가?
  • RQ3비드 서치 기반 검색에서 훈련-테스트 불일치를 제거하는 훈련 절차를 설계하는 것이 가능한가?
  • RQ4비드 서치 인식 서브샘플링과 최적의 의사 타겟은 어떻게 검색 성능 향상에 기여하는가?
  • RQ5제안된 방법은 다양한 트리 구조와 노드별 스코어러 아키텍처에 일반화 가능한가?

주요 결과

  • OTM는 최신 기술 수준의 JTM 방법 대비 Amazon Books에서 29.8%의 상대적 리콜 향상과 UserBehavior에서 6.3%의 향상을 달성한다.
  • 비드 서치 인식 서브샘플링 전략이 최적의 의사 타겟 정의보다 성능 향상에 더 크게 기여한다.
  • 트리 구조 내 수준별 데이터 불균형이 성능 향상의 정도에 영향을 미치며, 핵심 노드에 집중된 불균형일수록 더 큰 성과를 얻는다.
  • OTM의 훈련 시간은 Tesla P100 GPU 기준으로 배치당 0.671초이며, PLT 대비 3.6배 느리지만 동일 주기대 내에 있어 분산 훈련에 실용적이다.
  • 이론적 분석을 통해 TDMs와 PLTs가 비드 서치 하에서 최적이 아니며, 최적 트리 모델을 위한 충분조건을 도출하였다.
  • 실험을 통해 |I_x|=1 제약 조건을 제거함(즉, 각 인스턴스에 대해 다수의 관련 타겟을 允許함)하면 성능 향상이 이루어짐을 입증하였으며, 이는 HSM이 PLT를 능가하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.