Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic Argument Quality Assessment -- New Datasets and Methods

Assaf Toledo, Shai Gretz|arXiv (Cornell University)|2019. 09. 03.
Software Engineering Research참고 문헌 24인용 수 6
한 줄 요약

이 논문은 자동적 논증 품질 평가를 향상시키기 위해 6.3만 개의 수동으로 수집되고 명시적으로 애너테이션된 논증과 14만 개의 쌍 비교 데이터를 포함하는 새로운 대규모 데이터셋을 소개한다. 또한 BERT 기반의 신경망 모델을 제안하여 논증 쌍 분류에서 최신 기술 수준(SOTA) 성능을 달성하고, 논증 순위 매기기에서도 경쟁 가능한 성능을 보이며, 주관적인 성격을 지닌 작업임에도 불구하고 높은 애너테이션 일관성을 입증한다.

ABSTRACT

We explore the task of automatic assessment of argument quality. To that end, we actively collected 6.3k arguments, more than a factor of five compared to previously examined data. Each argument was explicitly and carefully annotated for its quality. In addition, 14k pairs of arguments were annotated independently, identifying the higher quality argument in each pair. In spite of the inherent subjective nature of the task, both annotation schemes led to surprisingly consistent results. We release the labeled datasets to the community. Furthermore, we suggest neural methods based on a recently released language model, for argument ranking as well as for argument-pair classification. In the former task, our results are comparable to state-of-the-art; in the latter task our results significantly outperform earlier methods.

연구 동기 및 목표

  • 자동 논증 품질 평가를 위한 고품질, 대규모 데이터셋의 부족 문제를 해결하기 위해.
  • 대규모이고 통제된 데이터 수집 및 철저한 정제 절차를 통해 논증 품질 애너테이션의 주관성을 줄이기 위해.
  • 이전 방법보다 논증 쌍 분류에서 뛰어난 성능을 보이고, 논증 순위 매기기에서 경쟁적인 성능을 달성하는 신경망 모델을 개발하기 위해.
  • 개별 논증 품질 점수와 쌍 비교 간의 관계를 조사하기 위해.
  • 향후 논증 품질 평가 연구를 지원하기 위해 데이터셋과 모델을 공개하기 위해.

제안 방법

  • 명확한 지침을 제공한 전용 사용자 인터페이스를 통해 6.3만 개의 논증을 수거하여 통제되고 고품질의 데이터 수집을 보장하였다.
  • 모든 6.3만 개의 논증을 [0,1] 척도 기반의 명시적 품질 점수로 애너테이션하여 개별 논증의 품질 평가가 가능하도록 하였다.
  • 각 쌍에서 더 높은 품질의 논증을 식별하기 위해 14만 개의 논증 쌍을 애너테이션하여 상대적 품질 분류가 가능하도록 하였다.
  • 저품질 기여물과 애너테이션을 걸러내기 위한 정제 절차를 적용하여 최종 평가를 위한 5.3만 개의 논증과 9.1만 개의 쌍을 확보하였다.
  • 쌍 내의 더 높은 품질의 논증을 예측하기 위해 미세조정된 BERT 기반 아키텍처를 사용한 논증 쌍 분류를 위한 신경망 모델을 제안하였다.
  • 개별 논증의 품질 점수를 예측하기 위해 동일한 BERT 기반 아키텍처를 사용한 논증 순위 매기기 모델을 제안하였다.

실험 결과

연구 질문

  • RQ1명시적 개별 논증 품질 애너테이션의 일관성은 쌍 비교 애너테이션과 비교해 어떻게 되는가?
  • RQ2새로운 데이터셋으로 훈련된 신경망 모델이 이전 방법보다 논증 쌍 분류와 논증 순위 매기기에서 뛰어난 성능을 보일 수 있는가?
  • RQ3개별 점수 기반 애너테이션 체계와 쌍 비교 기반 체계 간의 일치 정도는 어느 정도인가?
  • RQ4신경망 모델의 실패 유형은 무엇이며, 특히 어조 품질과 관련된 문제나 주제에서 벗어난 내용에 대해 어떻게 작동하는가?
  • RQ5작은 차이가 있는 경우, 특히 작은 차이가 있는 경우 쌍 비교 애너테이션을 개별 품질 점수에서 유추할 수 있는가?

주요 결과

  • 새로운 데이터셋인 IBM-ArgQ-6.3kArgs는 6.3만 개의 논증과 명시적 품질 점수를 포함하며, 이는 이전의 UKPRank와 같은 데이터셋보다 5배 이상 크다.
  • 쌍 비교 데이터셋인 IBM-ArgQ-14kPairs는 14만 개의 논증 쌍과 상대적 품질 레이블을 포함하여 분류 모델의 강력한 평가가 가능하도록 한다.
  • 제안된 논증 쌍 분류 모델은 IBM-ArgQ-9.1kPairs 서브셋에서 이전의 방법, 특히 시아미즈 네트워크 기반 모델보다 뚜렷이 뛰어난 성능을 보였다.
  • 논증 순위 매기기 모델은 최신 기술 수준의 방법과 비교해 유사한 성능을 달성하여, 개별 품질 점수 기반 체계의 유용성을 입증하였다.
  • 논증 품질의 주관적인 성격에도 불구하고, 두 애너테이션 체계(개별 및 쌍 비교) 모두 애너테이터 간에 높은 일관성을 보였다.
  • 논증의 설득력이 높지만 어색한 어휘나 철자 실수가 있는 경우 모델은 자주 실패하며, 주제에서 벗어나 있거나 도발적인 논증에 대해서도 어려움을 겪는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.