Skip to main content
QUICK REVIEW

[논문 리뷰] Open Domain Question Answering Using Web Tables

Kaushik Chakrabarti, Zhi‐Min Chen|arXiv (Cornell University)|2020. 01. 10.
Data Quality and Management참고 문헌 29인용 수 5
한 줄 요약

이 논문은 심층 신경망 기반의 질의-테이블 의미 유사도와 테이블 지배도 및 품질 특징을 조합하여 웹 테이블을 활용해 사실 기반 및 비사실 기반 질의를 모두 처리하는 새로운 개방형 도메인 질의 응답 시스템을 제안한다. 이 방법은 기존의 기준보다 유의미하게 뛰어나며 실험에서 80% 정밀도에서 20% 재현율을 달성했고, 주요 상용 웹 검색 엔진에 구현되어 월간 수십만 건의 테이블 응답을 제공하고 있다.

ABSTRACT

Tables extracted from web documents can be used to directly answer many web search queries. Previous works on question answering (QA) using web tables have focused on factoid queries, i.e., those answerable with a short string like person name or a number. However, many queries answerable using tables are non-factoid in nature. In this paper, we develop an open-domain QA approach using web tables that works for both factoid and non-factoid queries. Our key insight is to combine deep neural network-based semantic similarity between the query and the table with features that quantify the dominance of the table in the document as well as the quality of the information in the table. Our experiments on real-life web search queries show that our approach significantly outperforms state-of-the-art baseline approaches. Our solution is used in production in a major commercial web search engine and serves direct answers for tens of millions of real user queries per month.

연구 동기 및 목표

  • 웹 테이블을 활용해 목록, 순위, 또는 구조화된 데이터를 요구하는 비사실 기반 질의를 해결하는 데 도전한다.
  • 기존의 정보 검색 기반 및 지배 테이블 기반 기준을 초월해 개방형 도메인 질의 응답에서 테이블 응답 선택의 정밀도를 향상시키는 것.
  • 사실 기반 및 비사실 기반 질의를 모두 효과적으로 처리할 수 있는 통합 프레임워크를 개발하는 것.
  • 의미적 관련성, 테이블 지배도, 정보 품질 기반으로 대량의 후보 테이블 중에서 가장 관련성이 높은 테이블을 식별하고 순위를 매기는 것.

제안 방법

  • 주어진 질의에 대해 웹 검색 엔진을 사용해 후보 웹 테이블 풀을 검색한다.
  • 질의와 각 후보 테이블 간의 심층 신경망 기반 의미 유사도를 계산하여 관련성 수준을 평가한다.
  • 세 가지 유형의 특징을 통합한다: 문서 내 테이블 비율(지배도), 문서 내 테이블 위치, 품질 측정 지표.
  • 학습 기반 순위 매기기 모델이 질의-테이블 의미 유사도와 지배도 및 품질 특징을 조합하여 최적의 테이블 응답을 점수화하고 선택한다.
  • 실제 사용자 질의를 기반으로 모델을 학습하고 평가하며, 정밀도 및 다양한 임계값에서의 재현율을 성능 측정 지표로 사용한다.
  • 높은 정보 검색 매칭 점수를 가졌지만 관련성이 떨어지는 테이블을 선택하는 것을 방지하기 위해, 지배도가 높지 않거나 품질이 낮은 테이블에 대해 가중치를 부여하는 방식으로 설계되어 있다.

실험 결과

연구 질문

  • RQ1웹 테이블을 응답으로 사용하는 통합적 접근법이 사실 기반 및 비사실 기반 질의를 효과적으로 처리할 수 있는가?
  • RQ2신경망 기반 의미 유사도와 테이블 지배도 및 품질 특징을 조합하면 정보 검색 기반 또는 지배 테이블 기반 기준보다 테이블 응답 선택 성능이 어떻게 향상되는가?
  • RQ3테이블 지배도 및 품질 특징이 높은 IR 매칭 점수를 가졌지만 관련성이 낮은 테이블로 인한 거짓 양성 결과를 어느 정도 줄이는가?
  • RQ4높은 정밀도의 테이블 응답 선택을 달성하는 데 있어 의미 유사도 특징과 지배도 및 품질 특징 간의 상대 기여도는 어떠한가?

주요 결과

  • 의미 유사도, 지배도, 품질 특징의 세 그룹을 모두 사용할 경우 제안된 방법은 80% 정밀도에서 20% 재현율을 달성하며 기준보다 뚜렷하게 뛰어나다.
  • 의미 유사도 특징을 제외하고 지배도 및 품질 특징만 사용할 경우 80% 정밀도에서 16% 재현율을 달성하여, 심층 학습 없이도 이러한 특징의 가치가 입증된다.
  • 질의-테이블 의미 유사도 특징을 포함하면 지배도 및 품질 특징만 사용할 경우에 비해 80% 정밀도에서 재현율이 4% 향상된다.
  • 지배 테이블 접근법은 상위 랭킹 문서가 완벽한 답변이 아닐 경우 실패한다. 예를 들어 'Saratoga, NY에서 열리는 향후 경기' 질의에서 주 단위의 테이블이 잘못 선택된 바 있다.
  • 정보 검색 기반 기준은 높은 IR 매칭 점수를 가진 테이블을 선호하나, 그것이 최적의 답변은 아닐 수 있으므로 성능이 열악하다. 예를 들어 '그래프 데이터베이스'에 대한 위키백과 테이블이 실제 설명적 내용보다 우선 선택되는 경우가 있다.
  • 이 시스템은 주요 상용 웹 검색 엔진에서 실사용 중이며, 월간 수십만 건의 실제 사용자 질의에 대해 직접적인 테이블 응답을 제공하고 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.