Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-View Graph Representation Learning for Answering Hybrid Numerical Reasoning Question

Yifan Wei, Fangyu Lei|arXiv (Cornell University)|2023. 05. 05.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 표-텍스트 하이브리드 질의응답을 향상시키기 위해 표의 구조를 유지하고 다중 분량 증거를 모델링함으로써 다중 시각 그래프(Multi-View Graph, MVG) 표현 학습을 제안한다. 다중 시각 주의 메커니즘을 통해 표, 관계, 수치 시각을 구성함으로써 재무 보고서에 대한 추론 성능을 향상시켰으며, TAT-QA에서 74.5 EM과 81.5 F1를 달성하여 SOTA보다 각각 0.6점과 1.1점 높게 성과를 냈다.

ABSTRACT

Hybrid question answering (HybridQA) over the financial report contains both textual and tabular data, and requires the model to select the appropriate evidence for the numerical reasoning task. Existing methods based on encoder-decoder framework employ a expression tree-based decoder to solve numerical reasoning problems. However, encoders rely more on Machine Reading Comprehension (MRC) methods, which take table serialization and text splicing as input, damaging the granularity relationship between table and text as well as the spatial structure information of table itself. In order to solve these problems, the paper proposes a Multi-View Graph (MVG) Encoder to take the relations among the granularity into account and capture the relations from multiple view. By utilizing MVGE as a module, we constuct Tabular View, Relation View and Numerical View which aim to retain the original characteristics of the hybrid data. We validate our model on the publicly available table-text hybrid QA benchmark (TAT-QA) and outperform the state-of-the-art model.

연구 동기 및 목표

  • 표를 평탄화할 때 발생하는 표 구조의 열화와 공간적 관계 손실 문제를 해결하기 위해.
  • 셀, 헤더, 스파니 등 다중 분량 증거의 역할을 구분하여 추론에 기여하는 방식으로 모델링함으로써 성능 향상시키기 위해.
  • 텍스트와 표 간의 구조적 및 의미적 관계를 유지함으로써 재무 QA에서의 수치 추론 성능 향상시키기 위해.
  • 학습 가능한 주의 메커니즘을 통해 다양한 증거 시각을 통합하여 맥락에 따라 기여도를 동적으로 평가함으로써 다중 분량 신호의 적응적 융합을 가능하게 하기 위해.
  • 하이브리드 수치 추론 질문에 대해 TAT-QA 벤치마크에서 기존 모델을 능가하기 위해.

제안 방법

  • 표의 2차원 행-열 구조를 유지하기 위해 행과 열 간의 관계를 그래프 간선으로 모델링함으로써 표 시각을 구성한다.
  • 문장, 행, 열, 숫자, 단어 노드 등 텍스트와 표 요소를 통합한 단일 그래프로 관계 시각을 설계하여 다중 모odal 관계를 포착한다.
  • 세분화된 숫자 노드와 그들의 추상화된 헤더와의 정렬을 중시하는 수치 시각을 구축하여 양의 표현을 향상시킨다.
  • 각 노드에 대해 각 시각의 기여도를 동적으로 평가하는 다중 시각 주의 네트워크를 활용하여 다중 분량 신호의 적응적 융합을 가능하게 한다.
  • 스팬 기반 답변을 위해 시퀀스 태깅 모듈을, 수식 표현 생성을 위해 시퀀스에서 트리로의 디코딩 모듈을 사용하여 $Q_S$ 및 $Q_N$ 질문을 별도로 처리한다.
  • 스팬 추출과 수식 트리 생성을 동시에 최적화하기 위해 교차 엔트로피 손실과 트리 구조 손실을 함께 사용하여 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1표의 2차원 구조를 유지함으로써 하이브리드 QA에서의 추론 성능 향상이 가능한가?
  • RQ2행 헤더, 열 헤더, 개별 숫자와 같은 다중 분량 증거는 어떻게 효과적으로 모델링하고 구분할 수 있는가?
  • RQ3시각별 주의 기반의 다중 시각 그래프 표현이 단일 시각 또는 평탄화된 입력 인코딩보다 성능 향상에 기여하는가?
  • RQ4재무 수치 추론 과제에서 정확한 척도 및 연산자 예측에 모델 성능이 얼마나 의존하는가?
  • RQ5시각별 표현을 갖는 통합 인코더가 TAT-QA에서 기존의 GNN 또는 Transformer 기반 인코더를 능가할 수 있는가?

주요 결과

  • MVG 모델은 TAT-QA 개발 세트에서 74.5 EM과 81.5 F1를 기록하여 SOTA 모델을 각각 0.6점과 1.1점 뛰어넘었다.
  • 제거 실험 결과, 다중 시각 주의 메커니즘을 제거하면 EM이 1.6점 감소하여 이는 시각 통합에서의 중요성을 확인한다.
  • 척도 예측 성능 향상이 뚜렷하게 나타났으며, 골드 스케일 입력을 사용할 경우 EM이 84.4%까지 상승하여 척도 예측이 핵심 제약 요소임을 시사한다.
  • 골드 연산자만 사용할 경우 성능 향상이 미미하게 나타나 (EM +0.2), 이는 모델의 카테고리 기반 디코딩 전략이 강건하며 오류 전파에 취약하지 않음을 시사한다.
  • 수치 시각이 성능에 가장 큰 기여를 하며, 특히 복잡한 산술 추론에서 세분화된 숫자 표현의 가치를 입증한다.
  • 모델은 뛰어난 일반화 능력을 보이며, 개발 및 테스트 세트에서 일관된 성능 향상을 보여, 실제 재무 QA 과제에 대한 효과성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.