Skip to main content
QUICK REVIEW

[논문 리뷰] Seeing Things from a Different Angle: Discovering Diverse Perspectives about Claims

Sihao Chen, Daniel Khashabi|arXiv (Cornell University)|2019. 06. 08.
Topic Modeling참고 문헌 48인용 수 7
한 줄 요약

이 논문은 논란이 되는 주장에 대해 다양한 증거 기반 시각을 식별하는 임무인 '근거 있는 시각 탐색'을 소개하며, NLP 분야에 새로운 도전 과제를 제시한다. 저자들은 온라인 토론, 검색 증강, 그리고 인크루트를 활용하여 907개의 주장, 11,164개의 시각, 8,092개의 증거 문단을 포함한 고품질 데이터셋인 Perspective를 구축하였으며, 인간의 성능이 최신 기계 기반 모델을 크게 능가함을 보여주어 향후 NLP 연구의 핵심 과제임을 시사한다.

ABSTRACT

One key consequence of the information revolution is a significant increase and a contamination of our information supply. The practice of fact checking won't suffice to eliminate the biases in text data we observe, as the degree of factuality alone does not determine whether biases exist in the spectrum of opinions visible to us. To better understand controversial issues, one needs to view them from a diverse yet comprehensive set of perspectives. For example, there are many ways to respond to a claim such as "animals should have lawful rights", and these responses form a spectrum of perspectives, each with a stance relative to this claim and, ideally, with evidence supporting it. Inherently, this is a natural language understanding task, and we propose to address it as such. Specifically, we propose the task of substantiated perspective discovery where, given a claim, a system is expected to discover a diverse set of well-corroborated perspectives that take a stance with respect to the claim. Each perspective should be substantiated by evidence paragraphs which summarize pertinent results and facts. We construct PERSPECTRUM, a dataset of claims, perspectives and evidence, making use of online debate websites to create the initial data collection, and augmenting it using search engines in order to expand and diversify our dataset. We use crowd-sourcing to filter out noise and ensure high-quality data. Our dataset contains 1k claims, accompanied with pools of 10k and 8k perspective sentences and evidence paragraphs, respectively. We provide a thorough analysis of the dataset to highlight key underlying language understanding challenges, and show that human baselines across multiple subtasks far outperform ma-chine baselines built upon state-of-the-art NLP techniques. This poses a challenge and opportunity for the NLP community to address.

연구 동기 및 목표

  • 논란이 되는 주장에 대해 다양한 잘 뒷받mel린 시각을 파생시킬 수 있도록 정보 검색의 선택 편향을 해소하기 위해 시스템이 다양한 근거 기반 시각을 드러내도록 하는 것.
  • 자세한 입장을 탐지하고, 시각의 관련성과 증거 기반을 포함하는 핵심 NLP 과제로 근거 기반 시각 탐색 임무를 체계화하는 것.
  • 논란이 되는 주장에 대해 미묘한 시각과 그에 따른 증거를 포괄하는 고품질이고 확장 가능한 데이터셋을 구축하는 것.
  • 현재 NLP 모델이 해결하기 어려운 핵심 언어 이해 과제, 즉 시각의 다양성, 입장 일치, 증거의 관련성 문제를 규명하는 것.

제안 방법

  • 온라인 토론 포럼을 시드 데이터로 사용하여 Perspective 데이터셋을 구축하고, 검색 엔진 결과와 재구성 기반 문장 변형을 통해 다양성과 커버리지 확보.
  • 인크루트를 활용해 노이즈를 걸러내고, 시각-입장 일치성과 증거 관련성을 검증하여 높은 데이터 품질 확보.
  • 다섯 가지 하위 임무를 설계: 시각 관련성, 입장 분류, 시각 동치성, 증거 추출, 종합적 시각 탐색.
  • 각 하위 임무에 대해 검색 기반(IR) 및 BERT 기반 모델을 활용한 지도 학습 기반 베이스라인을 학습하고 인간 애너테이션 기반 골드 표준과 성능 비교.
  • 내용 의도(예: 모욕적 언어)에 기반한 필터링을 피하기 위해 엄격한 품질 제어를 적용하여 다양성을 유지하면서도 신뢰성 확보.
  • 주장, 시각, 증거 간의 의미 관계에 집중하며, 출처의 신뢰성과 사실적 진실성과는 분리하여 방법론적 명확성을 확보.

실험 결과

연구 질문

  • RQ1어떻게 논란이 되는 주장에 대해 관련 증거로 뒷받mel린 다양하고 종합적인 시각 세트를 체계적으로 식별할 수 있는가?
  • RQ2주장에 대한 시각의 입장을 판단하는 데 있어 핵심 NLP 과제는 무엇이며, 두 시각이 동일한 개념을 표현하는지 확인하는 데에는 어떤 과제가 존재하는가?
  • RQ3현재의 NLP 모델, 특히 BERT를 포함하여 인간 수준의 성능을 얼마나 잘 달성할 수 있는가? 특히 주장에 대한 관련 시각과 증거를 인식하는 데서 말이다.
  • RQ4검색 기반과 신경 기반 방법 간에는 어떤 차이가 있으며, 주어진 주장에 대해 가장 관련 있는 시각과 증거 문단을 식별하는 데 어떤 방법이 더 효과적인가?
  • RQ5현재 NLP 시스템에서 맥락에 따라 변화하는 미묘한 시각과 그에 기반한 사실 증거 이해에 있어 핵심적인 제약 요소는 무엇인가?

주요 결과

  • 시각 관련성 임무에서 인간의 성능은 F1 점수 72.5%를 기록했으며, IR + BERT 기반 최고의 기계 기반 베이스라인(50.8% F1)을 크게 앞서는 성과를 보였다.
  • 입장 분류 임무에서 인간은 F1 점수 90.9%를 기록했고, 최고의 모델(BERT)은 70.8%에 머물러 큰 성능 격차를 보였다.
  • 시각 동치성 임무에서 인간의 F1 점수는 83.7%였고, BERT 기반 베이스라인은 63.7%에 머물러 의미적 동치성 탐지 능력에 심각한 한계가 있음을 시사했다.
  • 증거 추출 임무에서 인간의 성능은 F1 점수 60.7%로 가장 높았고, IR + BERT는 55.7%, IR 전용은 46.8%를 기록하여 장문의 맥락에서 증거를 매칭하는 난이도가 높음을 확인했다.
  • 종합적 시각 탐색(엔드 투 엔드) 성능은 인간 애너테이션 기반으로 F1 점수 40.0%를 기록했고, IR + BERT 기반 모델은 단지 17.5%에 머물러 통합적 추론 능력 격차를 확인했다.
  • 최신 기술 기반 모델을 사용함에도 불구하고, 모든 기계 기반 베이스라인은 모든 하위 임무에서 인간 애너테이터보다 유의미하게 뒤져, 복잡하고 다양한 시각을 이해하는 데서 NLP 분야의 핵심 과제임을 재확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.