Skip to main content
QUICK REVIEW

[논문 리뷰] Knowledge-Based Trust: Estimating the Trustworthiness of Web Sources

Xin Luna Dong, Evgeniy Gabrilovich|arXiv (Cornell University)|2015. 02. 12.
Access Control and Trust인용 수 14
한 줄 요약

이 논문은 다층 확률 모델을 사용하여 사실적 정확성과 추출 오류를 동시에 모델링함으로써 웹 소스 신뢰성 점수를 추정하는 지식 기반 신뢰(Knowledge-Based Trust, KBT) 방법을 제안한다. 28억 개의 추출 사실을 바탕으로 1억 1900만 개의 웹페이지와 560만 개의 웹사이트에서 신뢰할 수 있는 소스를 식별하는 데 높은 정확도를 달성하며, 이는 이전 방법보다 사실 오류와 추출 오류를 구분함으로써 신뢰성 있는 소스에 대한 오해를 줄이는 데 기여한다.

ABSTRACT

The quality of web sources has been traditionally evaluated using exogenous signals such as the hyperlink structure of the graph. We propose a new approach that relies on endogenous signals, namely, the correctness of factual information provided by the source. A source that has few false facts is considered to be trustworthy. The facts are automatically extracted from each source by information extraction methods commonly used to construct knowledge bases. We propose a way to distinguish errors made in the extraction process from factual errors in the web source per se, by using joint inference in a novel multi-layer probabilistic model. We call the trustworthiness score we computed Knowledge-Based Trust (KBT). On synthetic data, we show that our method can reliably compute the true trustworthiness levels of the sources. We then apply it to a database of 2.8B facts extracted from the web, and thereby estimate the trustworthiness of 119M webpages. Manual evaluation of a subset of the results confirms the effectiveness of the method.

연구 동기 및 목표

  • 하이퍼링크와 같은 외생 신호에 의존하는 전통적인 웹 소스 품질 평가 방식의 한계를 해결하기 위해, 인기도가 아니라 사실적 정확성에 기반한 평가가 가능하도록 하는 것.
  • 외생 신호에 기반한 정보 추출된 웹 소스의 사실적 정확성에 기반해 소스의 신뢰성을 평가하는 방법을 개발하는 것.
  • 이전 방법이 분리하지 못한 바, 웹페이지의 사실 오류와 정보 추출 시스템에 의한 오류를 명시적으로 구분하는 것.
  • 수십억 개의 사실과 웹 소스에 대해 계산 효율성과 정확성을 유지하면서도 확장 가능한 신뢰성 평가 과정을 설계하는 것.
  • 기존의 PageRank와 같은 지표들과 보완적으로 작동할 수 있는 신뢰할 수 있는 데이터 기반의 신호를 제공하는 것.

제안 방법

  • 소스 신뢰성과 사실 정확성 간의 상호의존성을 해결하기 위해, 추출된 사실의 정확성과 소스 및 추출기의 정확성을 동시에 추론하는 다층 확률 모델을 사용한다.
  • 추출기 e가 소스 w의 데이터 항목 d에 대해 값 v를 추출했는지 여부를 나타내는 이진 지표 X_{ewdv}를 모델링하고, 소스가 제공하는 사실과 사실의 진실을 각각 잠재 변수 C_{wdv}와 T_{dv}로 표현한다.
  • 소스 정확도가 사실 정확성에 의존하고, 사실 정확도가 소스 정확도에 의존하는 순환적 의존성을 다층적 다수의 소스와 추출기를 통해 재현함으로써 대칭성을 깨뜨리는 반복 추론을 수행한다.
  • 희소 데이터 상황에서도 수렴 가능한 정확한 해에 도달할 수 있도록, 권위 있는 지식 기반 데이터베이스를 사용해 초기 신뢰도 추정을 설정한다.
  • 정확성과 계산 확장성의 균형을 맞추기 위해, 저커버리지 페이지는 통합하고 고커버리지 웹사이트를 분할하는 방식으로 소스의 세분성 수준을 동적으로 조정한다.
  • 280억 개의 사실과 1억 1900만 개의 웹페이지를 처리할 수 있도록 효율적인 추론 및 파라미터 추정 알고리즘을 설계하여 대규모 배포를 가능하게 한다.

실험 결과

연구 질문

  • RQ1다층 확률 모델이 추출된 사실의 정확성과 웹 소스 및 추출기의 신뢰성을 동시에 추정하면서도 사실 오류와 추출 오류를 명시적으로 구분할 수 있는가?
  • RQ2희소 데이터, 예를 들어 하나 또는 몇 개의 추출 사실만 존재하는 웹페이지의 경우에도 모델이 정확성과 수렴성을 유지할 수 있는가?
  • RQ3대규모 웹 데이터에서 소스의 세분성 수준을 동적으로 조정함(통합 또는 분할)하는 것이 확장성과 추정 정확성에 미치는 영향은 무엇인가?
  • RQ4신뢰성 있는 소스를 식별하는 데 있어 기존의 TrustRank나 PageRank와 비교해 KBT는 저인기이지만 사실적으로 정확한 웹사이트에 대해 얼마나 효과적인가?
  • RQ5KBT는 검색 및 정보 검색 시스템에서 기존의 웹 품질 지표들과 보완적으로 사용될 수 있는 정도는 어느 정도인가?

주요 결과

  • 280억 개의 추출 사실을 기반으로 1억 1900만 개의 웹페이지와 560만 개의 웹사이트에 대해 신뢰성 있는 신뢰도 점수를 성공적으로 계산하여 실세계 웹 규모 데이터에 대한 확장성을 입증했다.
  • 수작업 평가 결과, KBT는 저인기이지만 사실적으로 정확한 웹사이트를 포함한 신뢰할 수 있는 소스를 효과적으로 식별함을 확인했다. 이는 링크 기반 지표가 자주 간과하는 소스들이다.
  • 이전의 단일층 접근 방식보다 사실 오류와 추출 오류를 명시적으로 분리함으로써 신뢰성 있는 소스에 대한 오해를 줄여, 성능이 뚜렷이 향상되었다.
  • 고 KBT 점수를 받은 웹사이트 대부분은 위키피디아나 정부 웹사이트와 같은 권위 있는 소스이며, 저 KBT 점수는 예를 들어 사실 오류가 명백한 Yahoo Answers와 같은 포럼 및 루머 사이트에서 흔히 발견된다.
  • 특히 기존 방법이 실패하는 저데이터 환경에서 정확한 소스 신뢰도 추정을 가능하게 하여 지식 융합 성능을 향상시켰다.
  • 동적 소스 세분성 적응 전략은 계산 병목 현상을 효과적으로 완화하고, 사실 커버리지가 매우 다양하게 퍼진 소스들 사이에서 추정의 안정성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.