Skip to main content
QUICK REVIEW

[논문 리뷰] TAT-QA: A Question Answering Benchmark on a Hybrid of Tabular and Textual Content in Finance

Fengbin Zhu, Wenqiang Lei|arXiv (Cornell University)|2021. 05. 17.
Topic Modeling참고 문헌 39인용 수 9
한 줄 요약

이 논문은 표와 텍스트 데이터를 결합한 대규모 실생활 금융 QA 벤치마크인 TAT-QA를 소개한다. 이 벤치마크는 복잡한 수치적 추론을 요구한다. 본 논문은 표와 텍스트에서 증거를 추출하기 위해 시퀀스 태깅을 사용하고, 집계 연산자를 활용한 상징적 추론을 적용하는 TagOp 모델을 제안한다. 이 모델은 58.0%의 F1 점수를 기록했으며, 이는 이전 베이스라인 대비 11.1% 향상된 성능이지만 여전히 인간 전문가 수준(90.8% F1)에 크게 못 미치며, 수치적 추론이 수반된 하이브리드 데이터 QA의 과도한 난이도를 보여준다.

ABSTRACT

Hybrid data combining both tabular and textual content (e.g., financial reports) are quite pervasive in the real world. However, Question Answering (QA) over such hybrid data is largely neglected in existing research. In this work, we extract samples from real financial reports to build a new large-scale QA dataset containing both Tabular And Textual data, named TAT-QA, where numerical reasoning is usually required to infer the answer, such as addition, subtraction, multiplication, division, counting, comparison/sorting, and the compositions. We further propose a novel QA model termed TAGOP, which is capable of reasoning over both tables and text. It adopts sequence tagging to extract relevant cells from the table along with relevant spans from the text to infer their semantics, and then applies symbolic reasoning over them with a set of aggregation operators to arrive at the final answer. TAGOPachieves 58.0% inF1, which is an 11.1% absolute increase over the previous best baseline model, according to our experiments on TAT-QA. But this result still lags far behind performance of expert human, i.e.90.8% in F1. It is demonstrated that our TAT-QA is very challenging and can serve as a benchmark for training and testing powerful QA models that address hybrid form data.

연구 동기 및 목표

  • 표와 텍스트 금융 데이터를 결합하고 수치적 추론 요구 사항을 갖춘 대규모 실생활 QA 데이터셋의 부족을 보완하기 위해.
  • 금융 보고서에서 표와 서술적 텍스트 간의 밀접한 의미적 및 수치적 의존성을 반영하는 벤치마크를 개발하기 위해.
  • 표와 텍스트에서 증거를 통합하여 정확한 수치적 답변을 도출할 수 있는 모델을 제안하기 위해.
  • 모델 성능(58.0% F1)과 인간 전문가 성능(90.8% F1) 간의 뚜렷한 격차를 통해 하이브리드 데이터 QA의 난이도를 부각시키기 위해.
  • 연구를 촉진하기 위해 공개된 데이터셋과 베이스라인 모델을 제공하기 위해.

제안 방법

  • TAT-QA 데이터셋은 182개의 실생활 금융 보고서에서 유래했으며, 행/열 헤더와 수치 데이터를 포함한 표와 최소 두 개의 서술적 문단이 결합된 하이브리드 컨텍스트로 구성된다.
  • 금융 전문 지식을 가진 애너테이터들이 덧셈, 뺄셈, 곱셈, 나눗셈, 세기, 비교와 같은 수치적 추론이 필요한 질문을 생성하고, 전체 유도 단계를 제공한다.
  • TagOp는 표의 셀과 텍스트 조각을 증거로 식별하기 위해 시퀀스 태깅을 활용하며, 이는 의미적 및 수치적 관계를 고려한다.
  • 모델은 추출된 증거에서 최종 답변을 계산하기 위해 사전 정의된 집계 연산자(예: 합계, 차이, 비율)를 사용한 상징적 추론을 적용한다.
  • 다중 클래스 분류기가 수치적 답변의 척도(예: 백만, 조 등)를 예측하기 위해 통합되었으며, 이는 종종 헤더나 텍스트에 암시되어 있다.
  • 프레임워크는 2,757개의 하이브리드 컨텍스트에 걸쳐 16,552개의 질문에서 평가되었으며, F1 점수와 증거 추출, 계산, 척도 예측 오류 분석을 통해 성능을 측정했다.

실험 결과

연구 질문

  • RQ1QA 시스템은 금융 보고서의 표와 텍스트 구성 요소에서 효과적으로 증거를 추출하고 통합할 수 있는가?
  • RQ2구조화된 데이터와 비구조화된 데이터에서 상징적 추론을 적용할 경우 금융 분야의 수치적 QA 성능에 어떤 영향을 미치는가?
  • RQ3현재 모델들은 하이브리드 금융 데이터에서 추론하는 데 얼마나 실패하는가? 주요 오류 원인은 무엇인가?
  • RQ4통합된 모델 아키텍처는 이전 접근 방식에 비해 하이브리드 컨텍스트에서 증거 추출과 수치적 추론을 더 효과적으로 처리할 수 있는가?
  • RQ5제안된 모델의 성능는 실생활 금융 QA 과제에서 인간 전문가와 비교해 어떻게 되는가?

주요 결과

  • TAT-QA는 182개의 실생활 금융 보고서에서 추출한 2,757개의 하이브리드 컨텍스트에 걸쳐 16,552개의 질문을 포함하고 있으며, 수치적 추론과 유도 단계에 중점을 두고 있다.
  • TagOp는 TAT-QA에서 58.0%의 F1 점수를 기록했으며, 이는 최고의 베이스라인 모델 대비 11.1%p의 절대적 향상이다.
  • 인간 전문가는 90.8%의 F1 점수를 기록했으며, 이는 성능 격차가 크고 TAT-QA 벤치마크의 높은 난이도를 시사한다.
  • 주요 오류 원인(84%)은 잘못된 증거 추출—잘못된 증거(55%)와 누락된 증거(29%)—로, 표와 텍스트의 통합 이해가 어렵다는 것을 보여준다.
  • 오류의 상당 부분(55%)은 잘못된 증거 선택에서 기인하며, 9%는 잘못된 계산, 4%는 근거 없는 계산에서 기인하여 추론 오류가 드러난다.
  • 척도 예측 오류는 전체 오류의 3%를 차지하며, 이는 명시적인 모델링에도 불구하고 척도 모델링(예: 백만, 조 등)이 여전히 비단순 과제임을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.