Skip to main content
QUICK REVIEW

[논문 리뷰] Creating a Domain-diverse Corpus for Theory-based Argument Quality Assessment

Lily Ng, Anne Lauscher|arXiv (Cornell University)|2020. 11. 03.
Software Engineering Research인용 수 8
한 줄 요약

이 논문은 5,285개의 영어 논거를 포함한 첫 번째 대규모이자 도메인 다양성이 확보된 GAQCorpus를 소개한다. 이 논거들은 논증의 타당성, 효과성, 타당성, 종합적 품질의 네 차원에서 이론 기반 논증 품질(AQ)에 대해 주석 처리되었다. 저자들은 전문가 협업을 통해 복잡한 이론 기반 AQ 분류 체계를 단순화한 주석 지침을 개발하여, 웹 디베이트, 커뮤니티 질문-답변 포럼, 제품 리뷰와 같은 비표준 도메인에서도 높은 상호 주석자 일致도를 달성하고, 신뢰할 수 있고 확장 가능한 주석 처리를 가능하게 하였다.

ABSTRACT

Computational models of argument quality (AQ) have focused primarily on assessing the overall quality or just one specific characteristic of an argument, such as its convincingness or its clarity. However, previous work has claimed that assessment based on theoretical dimensions of argumentation could benefit writers, but developing such models has been limited by the lack of annotated data. In this work, we describe GAQCorpus, the first large, domain-diverse annotated corpus of theory-based AQ. We discuss how we designed the annotation task to reliably collect a large number of judgments with crowdsourcing, formulating theory-based guidelines that helped make subjective judgments of AQ more objective. We demonstrate how to identify arguments and adapt the annotation task for three diverse domains. Our work will inform research on theory-based argumentation annotation and enable the creation of more diverse corpora to support computational AQ assessment.

연구 동기 및 목표

  • 이론 기반 논증 품질(AQ) 평가를 위한 대규모이자 도메인 다양성이 확보된 코퍼스의 부족을 해결하기 위해.
  • 웹 디베이트, 커뮤니티 Q&A, 제품 리뷰와 같은 비표준 도메인에서 AQ의 신뢰성 있고 확장 가능한 주석 처리를 가능하게 하기 위해.
  • 복잡한 이론 기반 AQ 분류 체계를 군중 작업자 사용에 적합하도록 단순화하면서도 이론적 충실도를 유지하기 위해.
  • 군중을 활용한 이론 기반 AQ 주석 처리에서 높은 상호 주석자 일치도가 달성될 수 있음을 입증하기 위해.
  • 미래의 계산 기반 논증 품질 평가 및 글쓰기 지원 시스템 연구의 기초를 마련하기 위해.

제안 방법

  • 논증 이론에서 유래한 이론 기반 AQ 분류 체계를 개발하였으며, 이는 논증의 타당성, 효과성, 타당성, 종합적 품질의 네 차원으로 구성되어 있다.
  • 기초 언어학자들과 협업하여 군중 작업자용 주석 지침과 작업 설계를 단순화함으로써, 이론적 일관성을 유지하면서도 명확성과 신뢰성을 향상시켰다.
  • 웹 디베이트, 커뮤니티 질문-답변 포럼(CQA), 제품 리뷰의 세 가지 다양한 도메인에서 논거를 수집하였다.
  • 전문가 캘리브레이션, 점진적 지침 개선, 품질 제어를 포함한 다단계 주석 처리 파이프라인을 활용하였다.
  • 다양한 도메인과 차원에서 주석의 신뢰성을 검증하기 위해 상호 주석자 일치도 지표(예: Fleiss의 카파)를 사용하였다.
  • 최종 코퍼스인 GAQCorpus를 연구 목적을 위해 GitHub를 통해 공개하였다.

실험 결과

연구 질문

  • RQ1비표준이자 도메인 다양성이 확보된 환경에서 군중을 활용한 이론 기반 논증 품질(AQ) 주석 처리는 신뢰성 있게 수행될 수 있는가?
  • RQ2복잡한 이론 기반 AQ 분류 체계는 군중 작업자에게 사용 가능하도록 단순화할 수 있으며, 이론적 충실도를 유지할 수 있는가?
  • RQ3전문가와 군중 작업자 간에 다차원 AQ 주석 처리에서 달성할 수 있는 일치 수준은 어느 정도인가?
  • RQ4디베이트, Q&A, 리뷰와 같은 다양한 도메인 간에 논증 품질 평가가 어떻게 다름을 보이는가?
  • RQ5저점수를 받은 논거들은 추론, 구조, 또는 관련성 측면에서 공통적인 결함을 보이는가?

주요 결과

  • GAQCorpus는 네 가지 이론 기반 AQ 차원에서 주석 처리된 5,285개의 논거를 포함하며, 이는 유사한 종류의 가장 크고 유일하게 도메인 다양성이 확보된 코퍼스이다.
  • 전문가와 군중 작업자 간의 상호 주석자 일치도는 이전 연구에서 보고된 수준을 초월하였으며, Fleiss의 카파 값은 높은 신뢰도를 나타내었다.
  • 논증 스타일과 구조가 다양함에도 불구하고, 디베이트, CQA 포럼, 제품 리뷰 도메인 간에 주석 처리 과정에서 높은 일관성이 확보되었다.
  • 다양한 도메인에서 저점수를 받은 논거들은 일반적으로 반론에 대한 대응 부족, 관련 없는 개인적 경험 기록, 또는 근거 없는 주장 등의 결함을 보였다.
  • 코퍼스는 타당성이 특히 어조와 윤리적 고려 사항에 민감하며, 농담이나 비난 어조가 점수를 크게 낮춘다는 점을 드러냈다.
  • 연구는 전문가가 검증한 단순화된 지침을 기반으로 이론 기반 AQ 주석 처리가 스케일링 가능한 방식으로 가능하다는 것을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.