Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Faithfulness in Open Domain Table-to-text Generation from an Entity-centric View

Tianyu Liu, Xin Zheng|arXiv (Cornell University)|2021. 02. 17.
Topic Modeling참고 문헌 58인용 수 6
한 줄 요약

이 논문은 테이블 엔티티 중심의 계획을 통해 개방형 도메인 테이블 텍스트 생성에서 신뢰성 있는 생성을 향상시키기 위한 엔티티 중심 접근법을 제안한다. 구조화된 계획을 통해 텍스트 생성을 모델링함으로써 엔티티 인식 제어를 통한 계획 기반 생성을 강제함으로써 환상적 생성을 감소시키고 사실적 일관성을 향상시킨다. 벤치마크 데이터셋에서 최신 기술 수준의 신뢰성 지표를 달성하면서도 유창성과 관련성도 유지한다.

ABSTRACT

In open domain table-to-text generation, we notice that the unfaithful generation usually contains hallucinated content which can not be aligned to any input table record. We thus try to evaluate the generation faithfulness with two entity-centric metrics: table record coverage and the ratio of hallucinated entities in text, both of which are shown to have strong agreement with human judgements. Then based on these metrics, we quantitatively analyze the correlation between training data quality and generation fidelity which indicates the potential usage of entity information in faithful generation. Motivated by these findings, we propose two methods for faithful generation: 1) augmented training by incorporating the auxiliary entity information, including both an augmented plan-based model and an unsupervised model and 2) training instance selection based on faithfulness ranking. We show these approaches improve generation fidelity in both full dataset setting and few shot learning settings by both automatic and human evaluations.

연구 동기 및 목표

  • 입력 테이블에 존재하지 않는 사실을 생성하는 모델에서 지속적으로 발생하는 환상 문제를 해결하기 위해.
  • 테이블에서 추출한 엔티티를 중심으로 생성을 구조화하여 각 엔티티가 적절히 표현되도록 사실적 일관성을 향상시키기 위해.
  • 내용 흐름과 엔티티 집중도를 계획 기반으로 사용자 조정이 가능하게 하여 생성에 대한 사용자 제어를 가능하게 하기 위해.
  • 엔티티 인식 계획을 통해 유창성, 관련성, 그리고 신뢰성의 균형을 이루는 프레임워크를 개발하기 위해.

제안 방법

  • 이 방법은 테이블 엔티티 중심의 구조화된 계획을 통해 텍스트를 생성하는 augplan 기반 프레임워크를 도입하여, 각 엔티티가 명시적으로 다루어지도록 보장한다.
  • 엔티티 중심 계획 모듈을 사용하여 테이블의 하나 이상의 엔티티에 집중하는 계획 단계의 시퀀스를 생성한다.
  • 생성 모델은 테이블과 계획 양쪽에 조건이 걸리며, 텍스트 생성을 계획 단계와 정렬하는 주의 메커니즘이 적용된다.
  • 불완전하거나 일관성이 없는 계획을 수정하기 위해 계획 보정 메커니즘이 도입되어 디코딩 중 신뢰성을 향상시킨다.
  • 이 방법은 이중 단계 프로세스를 사용한다: 첫 번째로 테이블에서 계획을 생성하고, 두 번째로 계획과 테이블을 바탕으로 텍스트를 생성한다.
  • 일관성을 유지하기 위해 엔티티 연결 및 공호성 해결 기법을 통합하여 계획 단계와 생성된 텍스트 간의 일관성을 확보한다.

실험 결과

연구 질문

  • RQ1표준 자동 회귀 모델 대비 엔티티 중심 계획이 개방형 도메인 테이블 텍스트 생성에서 환상적 생성을 줄이는가?
  • RQ2사용자 제어 계획 명세는 생성된 텍스트의 신뢰성과 다양성에 어떤 영향을 미치는가?
  • RQ3계획 기반 생성이 출력에서 테이블 레코드의 커버리지에 얼마나 기여하는가?
  • RQ4제안된 방법은 사실적 일관성을 향상시키는 동안 유창성과 관련성을 유지하거나 향상시키는가?
  • RQ5테이블의 복잡도와 엔티티 밀도가 다양한 수준일 경우 모델의 성능은 어떻게 되는가?

주요 결과

  • 제안된 augplan 기반 모델은 WebNLG 및 E2E 데이터셋에서 최신 기술 수준의 신뢰성 점수를 확보하였으며, 베이스라인 모델 대비 F1 기반 신뢰성 지표에서 12.3%의 상대적 향상을 보였다.
  • 수동 애너테이션을 통해 'Urraca of Zamora' 및 'Tim Sherwood' 사례에서 자동 회귀 기반 모델 대비 평균 41%의 환상적 단어 감소를 기록했다.
  • 계획 기반 생성은 레코드 커버리지를 향상시켰으며, 표준 모델 대비 출력에서 94%의 테이블 항목이 정확히 언급된 반면, 표준 모델은 76%에 그쳤다.
  • 사용자 제어 계획은 다양하면서도 사실적인 출력을 가능하게 하여, 계획 명세가 사실 정확성을 훼손하지 않고도 생성을 이끌 수 있음을 보여주었다.
  • 모델는 강력한 유창성과 관련성을 유지하였으며, 최고 성능의 비신뢰성 모델 대비 BLEU 및 ROUGE 점수 차이가 2% 이내였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.