Skip to main content
QUICK REVIEW

[논문 리뷰] Expert Finding in Heterogeneous Bibliographic Networks with Locally-trained Embeddings

Huan Gui, Qi Zhu|arXiv (Cornell University)|2018. 03. 09.
Expert finding and Q&A systems참고 문헌 28인용 수 10
한 줄 요약

이 논문은 일반적이고 특정적인 검색어 모두에 대해 정밀도를 향상시키기 위해 국소적으로 훈련된 임베딩 학습과 개념 계층 구조 가이던스를 결합한 LE-expert라는 프레임워크를 제안한다. 이는 질의 확장에 사용되며, 다중 유형 엣지 랭킹 알고리즘을 통해 권위 평가를 수행한다. 이 방법은 세분화된 의미론적 정보를 유지하고 네트워크 구조를 활용함으로써, 200만 건이 넘는 항목을 포함한 대규모 데이터셋에서 기존 방법들을 능가한다.

ABSTRACT

Expert finding is an important task in both industry and academia. It is challenging to rank candidates with appropriate expertise for various queries. In addition, different types of objects interact with one another, which naturally forms heterogeneous information networks. We study the task of expert finding in heterogeneous bibliographical networks based on two aspects: textual content analysis and authority ranking. Regarding the textual content analysis, we propose a new method for query expansion via locally-trained embedding learning with concept hierarchy as guidance, which is particularly tailored for specific queries with narrow semantic meanings. Compared with global embedding learning, locally-trained embedding learning projects the terms into a latent semantic space constrained on relevant topics, therefore it preserves more precise and subtle information for specific queries. Considering the candidate ranking, the heterogeneous information network structure, while being largely ignored in the previous studies of expert finding, provides additional information. Specifically, different types of interactions among objects play different roles. We propose a ranking algorithm to estimate the authority of objects in the network, treating each strongly-typed edge type individually. To demonstrate the effectiveness of the proposed framework, we apply the proposed method to a large-scale bibliographical dataset with over two million entries and one million researcher candidates. The experiment results show that the proposed framework outperforms existing methods for both general and specific queries.

연구 동기 및 목표

  • 질의의 구체성에 따라 크게 달라지는 전문가 찾기의 과제를 해결하기 위해.
  • 개념 계층에 의해 안내되는 국소적으로 훈련된 임베딩를 사용하여 질의 확장에서 의미의 왜곡을 줄이기 위해.
  • 다양한 네트워크 구조, 예를 들어 저자, 논문, 회의(또는 학술 대회) 간의 관계를 활용하여 후보자 랭킹을 향상시키기 위해.
  • 일반적이고 특정적인 질의 모두에서 높은 정확도를 유지하는 강력하고 확장 가능한 프레임워크를 개발하기 위해.
  • 실제 전문가 찾기 작업에서 의미 표현 학습과 네트워크 기반의 권위 평가를 결합할 수 있는 효과성을 입증하기 위해.

제안 방법

  • 개념 계층에 의해 안내되는 국소적으로 훈련된 임베딩 학습을 제안하여 의미의 왜곡을 최소화하는 질의 전용 저차원 벡터 표현을 생성한다.
  • 계층적 개념 구조를 사용하여 임베딩 공간을 관련 주제로 제한함으로써 좁은 의미론적 질의에 대해 정밀도를 향상시킨다.
  • 다양한 엣지 유형(예: 공저자, 논문-저자, 논문-회지)을 별도로 처리하여 후보자의 권위를 추정하기 위해 다중 유형의 무작위 보행 알고리즘을 적용한다.
  • 학습 가능한 파rameter(λ)를 사용하여 다양한 네트워크 관계의 기여도를 가중 조합한다.
  • 질의-문서 공통 등장 기반으로 관련성 하위 네트워크를 구성하여 랭킹 과정을 관련 콘텐츠에 집중시킨다.
  • 하이브리드 프레임워크를 구현: 국소 임베딩을 통한 질의 확장 이후 네트워크 기반의 권위 랭킹을 수행하여 후보자 랭킹을 향상시킨다.

실험 결과

연구 질문

  • RQ1개념 계층에 의해 안내되는 국소적으로 훈련된 임베딩는 특히 의미 범위가 좁은 특정 질의에 대해 전문가 찾기의 질의 확장을 향상시킬 수 있는가?
  • RQ2공저자, 논문, 회지(또는 학술 대회) 관계와 같은 이질적 네트워크 구조를 통합할 경우 후보자 랭킹 정확도에 어떤 영향을 미치는가?
  • RQ3다양한 엣지 유형(예: PA, PP, PV) 중 각각의 기여도는 최종 권위 점수에 얼마나 기여하는가?
  • RQ4제안된 프레임워크는 정확도를 희생시키지 않고 일반적이고 특정적인 질의 모두에서 높은 성능을 유지할 수 있는가?
  • RQ5전역 임베딩 방법과 전통적인 검색 기반 접근법에 비해 이 프레임워크는 전문가 찾기 작업에서 어떻게 비교되는가?

주요 결과

  • 제안된 LE-expert 프레임워크는 200만 건이 넘는 항목과 100만 명이 넘는 연구자 후보자가 포함된 대규모 문헌 네트워크에서 기존 방법들을 능가한다.
  • ‘정보 추출’ 및 ‘온톨로지 정렬’과 같은 특정 질의에 대해 국소적으로 훈련된 임베딩 방법은 더 정확하고 완전한 질의 확장을 제공하여 정밀도가 높아진다.
  • 랭킹 알고리즘이 후보자 랭킹을 크게 향상시켰으며, 정보 추출에 전문성을 가진 데이너 프리타그와 같은 연구자가 더 경력이 많지만 전문성이 떨어지는 전문가들보다 높은 순위를 차지한다.
  • 성능에 가장 민감한 파라미터는 λ_PA(공저자-논문 관계)이며, 이 엣지 유형을 제거하면 정밀도에 심각한 하락이 발생하여 그 중요성을 보여준다.
  • λ_PA가 0으로 설정되면 랭킹이 공저자 관계에 의해 지배되어 정확도가 떨어지며, 무한대 값으로 설정하면 모델이 기초적인 문서 검색 시스템으로 축소된다.
  • λ_PP와 λ_PV를 0으로 설정해도 프레임워크의 성능이 안정적으로 유지되므로, 논문-논문 및 논문-회지 엣지가 권위 평가에 공저자-논문 관계만큼 기여하지 못하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.