Skip to main content
QUICK REVIEW

[논문 리뷰] Logical Natural Language Generation from Open-Domain Tables

Wenhu Chen, Jianshu Chen|arXiv (Cornell University)|2020. 04. 22.
Topic Modeling참고 문헌 44인용 수 10
한 줄 요약

이 논문은 개방 도메인 테이블의 사실들에 대해 논리적으로 함의되는 자연어 문장을 생성해야 하는 새로운 작업인 논리적 자연어 생성(LogicNLG)을 소개한다. 이는 표면적 복수화에 그치지 않고, 새로운 데이터셋 LogicNLG를 제안하며, 논리적 충실도를 평가하기 위한 자동 평가 지표도 도입한다. 주요 발견은 사전 훈련된 언어 모델이 논리적 충실도를 크게 향상시키며, 강화 학습과 적대적 훈련은 유창성과의 상충 관계를 보이며, 계층적 추론 생성은 두 요소를 균형 있게 유지하는 데 도움이 된다.

ABSTRACT

Neural natural language generation (NLG) models have recently shown remarkable progress in fluency and coherence. However, existing studies on neural NLG are primarily focused on surface-level realizations with limited emphasis on logical inference, an important aspect of human thinking and language. In this paper, we suggest a new NLG task where a model is tasked with generating natural language statements that can be \emph{logically entailed} by the facts in an open-domain semi-structured table. To facilitate the study of the proposed logical NLG problem, we use the existing TabFact dataset \cite{chen2019tabfact} featured with a wide range of logical/symbolic inferences as our testbed, and propose new automatic metrics to evaluate the fidelity of generation models w.r.t.\ logical inference. The new task poses challenges to the existing monotonic generation frameworks due to the mismatch between sequence order and logical order. In our experiments, we comprehensively survey different generation architectures (LSTM, Transformer, Pre-Trained LM) trained with different algorithms (RL, Adversarial Training, Coarse-to-Fine) on the dataset and made following observations: 1) Pre-Trained LM can significantly boost both the fluency and logical fidelity metrics, 2) RL and Adversarial Training are trading fluency for fidelity, 3) Coarse-to-Fine generation can help partially alleviate the fidelity issue while maintaining high language fluency. The code and data are available at \url{https://github.com/wenhuchen/LogicNLG}.

연구 동기 및 목표

  • 신경 자연어 생성(NLG)에서 논리적 추론의 부족을 해결하기 위해 현재 표면적 사실 복수화에 집중하고 있는 경향을 다루기 위함.
  • 반세미구조화된 테이블의 사실들에 의해 논리적으로 함의되어야 하는 텍스트를 생성해야 하는 새로운 NLG 작업—논리적 NLG—제안.
  • TabFact에서 유도된 새로운 벤치마크 데이터셋 LogicNLG 개발. 비교, 수량 세기, 산술 연산을 포함한 다양한 논리적 추론을 포함하도록 풍부화함.
  • 표면적 사실 매칭을 넘어서는 논리적 충실도 평가를 위한 새로운 자동 지표 설계 및 평가.
  • 다양한 생성 아키텍처와 훈련 전략이 새로운 논리적 충실도 제약 조건 하에서 어떻게 성능을 내는지 탐구하기 위함.

제안 방법

  • 저자들은 TabFact 데이터셋을 확장하여 최댓값/최솟값/합계, 비교(동일/다른), 수량 세기(총합/유일) 등의 논리적 추론 유형을 추가함으로써 LogicNLG 데이터셋을 구축함.
  • 생성된 텍스트가 테이블에 의해 논리적으로 함의되는지 평가하기 위해 두 가지 자동 평가 지표를 제안: 구문 분석 기반 방법과 NLI 기반 방법.
  • 다양한 방법으로 훈련된 여러 생성 모델을 평가: LSTM, Transformer, 사전 훈련된 언어 모델(GPT-2 등), 강화 학습(RL), 적대적 훈련, 계층적 추론 디코딩.
  • 순서 기반 추론과 논리적 순서 간의 괴리 문제를 해결하기 위해 비단조화적인 계층적 추론 생성 모델을 제안함. 이는 논리적 일관성을 향상시키기 위해 전방 계획 수립을 가능하게 함.
  • 자동 지표와 인간 평가를 모두 사용하여 모델을 평가하며, 인간 평가를 통해 자동 점수의 신뢰성을 검증함.
  • 재현 가능성과 향후 연구를 지원하기 위해 코드와 데이터를 https://github.com/wenhuchen/LogicNLG 에 공개함.

실험 결과

연구 질문

  • RQ1기존의 신경 NLG 모델들은 표면적 복수화를 넘어서 테이블 사실들에 의해 논리적으로 함의되는 문장을 생성할 수 있는가?
  • RQ2LSTM, Transformer, 사전 훈련된 언어 모델 등 다양한 생성 아키텍처는 새로운 작업에서 논리적 충실도를 유지하는 데 얼마나 잘 성능을 내는가?
  • RQ3강화 학습과 적대적 훈련과 같은 훈련 전략은 유창성의 손실을 감수하면서까지 논리적 충실도를 얼마나 향상시키는가?
  • RQ4계층적 추론 생성은 NLG에서 순서 순서와 논리 순서 간의 괴리 문제를 완화시킬 수 있는가?
  • RQ5자동 지표의 논리적 충실도 평가는 얼마나 신뢰할 수 있으며, 인간 평가와 얼마나 상관관계가 있는가?

주요 결과

  • 사전 훈련된 언어 모델(GPT-2 등)은 유창성과 논리적 충실도 양쪽 모두를 크게 향상시키며, 표준 Transformer와 LSTM 모델을 압도적으로 능가함.
  • 강화 학습과 적대적 훈련은 논리적 충실도를 향상시키지만, 그 대가로 유창성이 감소함을 보여, 두 목표 간의 상충 관계가 있음을 시사함.
  • 계층적 추론 생성은 높은 유창성을 유지하면서도 논리적 충실도 문제를 완화시키며, 비단조화적인 논리적 의존성 처리에 효과적임을 보여줌.
  • 구문 분석 기반 자동 지표는 60%의 정확도를 기록했고, NLI 기반 지표는 65%에 도달함. 이는 자동 충실도 평가가 여전히 도전적이지만, 모델 개발에 정보를 제공할 수 있음을 시사함.
  • 모델은 엔티티 순서와 비교 연산에서는 가장 잘 수행하지만, 평균, 합계와 같은 수치 집계 작업과 '유일한' 또는 '고유한'과 같은 드문 연산에서는 크게 어려움을 겪음.
  • 문자 기반 연산은 수치 기반 연산보다 모델에게 더 쉽다는 점을 시사하며, 이는 자연어 생성에 수치 추론을 통합하는 데 있어 핵심적인 열린 과제임을 강조함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.