Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Fact Checking Briefs

Angela Fan, Aleksandra Piktus|arXiv (Cornell University)|2020. 01. 01.
Topic Modeling참고 문헌 43인용 수 4
한 줄 요약

이 논문은 인간의 사실 확인 정확도와 효율성을 향상시키기 위해 사실 확인 요약본—특히 질문-답변 요약본(QABriefs)—을 도입한다. 새로운 모델인 QABRIEFER와 공동으로 수집된 데이터셋(QABRIEFDATASET)을 사용하여, 검색 바만을 사용할 때와 비교해 QABriefs가 현장 작업자들의 정확도를 10% 향상시키고 확인 시간을 20% 감소시킨다.

ABSTRACT

Fact checking at scale is difficult -- while the number of active fact checking websites is growing, it remains too small for the needs of the contemporary media ecosystem. However, despite good intentions, contributions from volunteers are often error-prone, and thus in practice restricted to claim detection. We investigate how to increase the accuracy and efficiency of fact checking by providing information about the claim before performing the check, in the form of natural language briefs. We investigate passage-based briefs, containing a relevant passage from Wikipedia, entity-centric ones consisting of Wikipedia pages of mentioned entities, and Question-Answering Briefs, with questions decomposing the claim, and their answers. To produce QABriefs, we develop QABriefer, a model that generates a set of questions conditioned on the claim, searches the web for evidence, and generates answers. To train its components, we introduce QABriefDataset which we collected via crowdsourcing. We show that fact checking with briefs -- in particular QABriefs -- increases the accuracy of crowdworkers by 10% while slightly decreasing the time taken. For volunteer (unpaid) fact checkers, QABriefs slightly increase accuracy and reduce the time required by around 20%.

연구 동기 및 목표

  • 광범위한 허위 정보에 대비해 인력 동원 방식의 사실 확인의 확장성과 정확도 한계를 해결하기 위해.
  • 검증 과정이 시작되기 이전에 사전에 점검된 구조화된 정보를 제공하여 인간의 사실 확인 성능을 향상시키기 위해.
  • 사실 확인 결정을 지원하는 고품질의 주장 전용 요약본을 자동으로 생성하는 방법을 개발하기 위해.
  • 사실 확인 모델의 훈련과 평가를 가능하게 하는 대규모 고품질 QABriefs 데이터셋을 구축하기 위해.
  • 요약본이 수동 검색에 대한 의존도를 줄이면서도 사실 확인 워크플로우의 속도와 정확도를 향상시킬 수 있는지 입증하기 위해.

제안 방법

  • 사실에 기반해 질문을 생성한 다음, 개방형 질의응답(Open-domain QA)을 사용해 이를 답변하는 이중 단계 모델인 QABRIEFER를 개발한다.
  • 패스지 기반 요약본을 위해 밀도 있는 문단 검색(DPR)을 사용해 관련 위키백과 문단을 추출한다.
  • 언급된 실체를 위키백과 페이지에 연결하여 실체 중심의 요약본을 구성한다.
  • 약 10,000개의 QABriefs를 포함하고, 각 요약본에 약 3개의 질문-답변 쌍이 포함된 대규모 공동 수집 데이터셋(QABRIEFDATASET)을 활용한다.
  • 최적의 질의응답 성능을 확보하기 위해 자연 질문(Natural Questions, NQ)과 QABRIEFDATASET을 모두 사용해 사전 훈련된 순서-순서 모델(BART)을 미세조정한다.
  • 검색 및 생성 모듈을 통합하여 전문가 수준의 배경 준비를 시뮬레이션하는 종단 간 요약본을 생성한다.

실험 결과

연구 질문

  • RQ1사실 확인 이전에 구조화된 요약본을 생성하면 현장 작업자들의 정확도와 효율성이 향상되는가?
  • RQ2패스지 기반, 실체 중심, QABriefs와 같은 다양한 유형의 요약본이 사실 확인 성능을 뒷받침하는 데 어떻게 비교되는가?
  • RQ3자동화된 모델(QABRIEFER)이 인간이 작성한 요약본 수준의 품질을 갖춘 QABriefs를 얼마나 잘 생성할 수 있는가?
  • RQ4요약본 사용이 일반 웹 검색에 대한 과도한 의존도를 줄이고, 동시에 검증 품질을 유지하거나 향상시키는가?
  • RQ5요약본은 사실 확인자들의 자신감과 의사결정 행동에 어떤 영향을 미치는가?

주요 결과

  • QABRIEFER가 생성한 QABriefs를 사용할 경우, 검색 바만을 사용할 때와 비교해 현장 작업자들의 정확도가 10% 향상되었다.
  • QABriefs를 사용한 자원봉사자들은 검색 전용 접근 방식에 비해 정확도가 4% 향상되었고, 검사 시간은 20% 빨라졌다.
  • 인간이 작성한 QABriefs가 가장 높은 성능 향상을 가져왔고, 그 다음으로 QABRIEFER가 생성한 요약본과 다른 유형의 요약본이 그 뒤를 이었다.
  • QABriefs 제공로 인해 과도한 자신감이 증가했다: 약 45%의 현장 작업자들이 검색 기능이 정확도를 높였음에도 불구하고 검색 바를 사용하지 않았다.
  • BART를 자연 질문(NQ)과 QABRIEFDATASET 모두에서 미세조정한 결과 최고의 질의응답 성능을 기록했으며, 이는 대규모 질의응답 데이터 기반 사전 훈련의 가치를 입증한다.
  • 본 연구는 전문적 사실 확인 기사에서 유도된 요약본이 더 체계적인 사실 확인 과정을 지원할 수 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.