Skip to main content
QUICK REVIEW

[논문 리뷰] HiTab: A Hierarchical Table Dataset for Question Answering and Natural Language Generation

Zhoujun Cheng, Haoyu Dong|arXiv (Cornell University)|2021. 08. 15.
Advanced Text Analysis Techniques인용 수 11
한 줄 요약

HiTab는 통계 보고서와 위키백과에서 유래한 계층적 표의 대규모이고 다중 도메인 데이터셋을 소개하며, 질문 응답(QA) 및 자연어 생성(NLG)을 위해 설계되었다. 엔티티 및 수량의 세밀한 정렬(annotation)을 특징으로 하며, 계층에 민감한 논리적 형식과 부분적으로 감독된 학습 방식을 통해 QA 정확도를 45.1%로 향상시키고, 부적절한 예측과 의미 없는 NLG 출력을 줄였다.

ABSTRACT

Tables are often created with hierarchies, but existing works on table reasoning mainly focus on flat tables and neglect hierarchical tables. Hierarchical tables challenge existing methods by hierarchical indexing, as well as implicit relationships of calculation and semantics. This work presents HiTab, a free and open dataset to study question answering (QA) and natural language generation (NLG) over hierarchical tables. HiTab is a cross-domain dataset constructed from a wealth of statistical reports (analyses) and Wikipedia pages, and has unique characteristics: (1) nearly all tables are hierarchical, and (2) both target sentences for NLG and questions for QA are revised from original, meaningful, and diverse descriptive sentences authored by analysts and professions of reports. (3) to reveal complex numerical reasoning in statistical analyses, we provide fine-grained annotations of entity and quantity alignment. HiTab provides 10,686 QA pairs and descriptive sentences with well-annotated quantity and entity alignment on 3,597 tables with broad coverage of table hierarchies and numerical reasoning types. Targeting hierarchical structure, we devise a novel hierarchy-aware logical form for symbolic reasoning over tables, which shows high effectiveness. Targeting complex numerical reasoning, we propose partially supervised training given annotations of entity and quantity alignment, which helps models to largely reduce spurious predictions in the QA task. In the NLG task, we find that entity and quantity alignment also helps NLG models to generate better results in a conditional generation setting. Experiment results of state-of-the-art baselines suggest that this dataset presents a strong challenge and a valuable benchmark for future research.

연구 동기 및 목표

  • 계층적 표에서 질문 응답(QA) 및 자연어 생성(NLG)을 위한 벤치마크 데이터셋의 부족을 해결하기 위해.
  • 합성 또는 수동으로 생성된 질문에 의존하지 않고, 전문가가 작성한 실제 문장들에서 추출하고 수정함으로써 현실적이고 다양한 고품질의 데이터셋을 구축하기 위해.
  • 자연어 텍스트와 표 셀 간의 엔티티 및 수량 정렬에 대한 세밀한 annotation을 도입하여 표 추론 성능을 향상시키기 위해.
  • 스팸 예측을 줄이고 NLG의 사실적 일관성을 향상시키기 위해 계층에 민감한 논리적 형식과 부분적으로 감독된 학습 전략을 개발하기 위해.
  • 실제 세계의 복잡성인 수치 추론, 계층적 색인, 표 내 암묵적인 의미 관계를 반영하는 도전적인 벤치마크를 구축하기 위해.

제안 방법

  • 공개 자료에서 유래한 계층적 표와 그에 수반되는 서술 문장을 추출하여 HiTab를 구축함: Statistics Canada(StatCan), National Science Foundation(NSF), 그리고 ToTTo 데이터셋을 통해 확보한 위키백과.
  • 인간 애너테이터가 질문을 처음부터 생성하는 대신, 실제 분석가가 작성한 문장을 QA 쌍으로 수정함으로써 자연스럽고 도메인 관련성이 높은 문장을 확보함.
  • 자연어 텍스트의 언급을 표 셀에 연결하는 엔티티 정렬과 수치 표현을 표 셀 및 그 계산 관계에 연결하는 수량 정렬에 대한 세밀한 annotation을 도입함.
  • 상단 및 왼쪽 헤더를 사용한 다수준, 이차원 색인을 지원하는 계층에 민감한 논리적 형식을 설계하여 기호적 추론을 가능하게 함.
  • 정렬된 엔티티와 수량을 활용한 부분적으로 감독된 학습 전략을 구현함으로써 QA의 부적절한 예측을 줄이고 NLG의 사실적 일관성을 향상시킴.
  • 셀과 계산 유형(e.g., 총합, 비율)에 조건을 걸어 NLG 생성을 유도함으로써 더 의미 있고 맥락에 부합하는 텍스트 생성을 가능하게 함.

실험 결과

연구 질문

  • RQ1실제 통계 보고서에서 작성된 전문가 문장들로부터 구성된 데이터셋이 합성 또는 수동 생성된 데이터에 비해 계층적 표의 QA 및 NLG에 더 자연스럽고 다양한 벤치마크로 기능할 수 있는가?
  • RQ2세밀한 엔티티 및 수량 정렬 annotation이 계층적 표에서 QA 및 NLG 모델의 성능과 사실적 일관성에 얼마나 기여하는가?
  • RQ3표의 계층 깊이가 QA 및 NLG의 난이도에 미치는 영향은 어떠하며, 모델은 다양한 계층 깊이 간에 일반화할 수 있는가?
  • RQ4계층에 민감한 논리적 형식과 부분적으로 감독된 학습 전략이 QA의 부적절한 예측과 NLG의 의미 없는 출력을 상당히 줄일 수 있는가?
  • RQ5다양한 도메인 간 일반화는 계층적 표 추론 작업에서 모델 성능에 어떻게 영향을 미치는가?

주요 결과

  • HiTab는 기존 베이스라인에 도전적이며, 평탄한 표에 최적화된 논리적 형식을 사용할 경우 MAPO의 QA 정확도는 단 29.2%에 그침.
  • 제안된 계층에 민감한 논리적 형식과 부분적으로 감독된 학습 전략이 조합되어 QA 정확도를 45.1%로 향상시키며, 부적절한 예측을 상당히 줄임.
  • BLEU 및 PARENT 점수는 계층 깊이가 증가함에 따라 감소함—깊이 4 이상일 경우 각각 21.3과 31.6—깊은 계층이 NLG 모델에 더 큰 과제를 안겨줌을 시사함.
  • 셀과 계산 유형 조건을 고려해 T5를 미세조정한 결과 16.9 BLEU 및 28.8 PARENT 점수를 기록하며 BART를 능가함—구조화된 조건화의 이점이 입증됨.
  • 다양한 도메인 평가에서 모든 지표에서 성능 저하가 일관되게 관찰되어, 도메인 간 일반화의 과제를 부각함.
  • 데이터셋은 개인정보 문제 없이 공개 보고서에서 윤리적으로 수집되었으며, 철저한 인간 애너테이션을 거친 후 총 3,597개의 표와 10,672개의 애너테이션된 문장 포함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.