[논문 리뷰] Conversations Gone Awry: Detecting Early Signs of Conversational Failure
이 논문은 첫 교환으로부터 조기에 예측하는 작업을 도입한다: 공손함과 수사적 프롬프트를 사용하여 공손 온라인 대화가 개인 공격으로 흐트러질지 여부를 예측한다.
One of the main challenges online social systems face is the prevalence of antisocial behavior, such as harassment and personal attacks. In this work, we introduce the task of predicting from the very start of a conversation whether it will get out of hand. As opposed to detecting undesirable behavior after the fact, this task aims to enable early, actionable prediction at a time when the conversation might still be salvaged. To this end, we develop a framework for capturing pragmatic devices---such as politeness strategies and rhetorical prompts---used to start a conversation, and analyze their relation to its future trajectory. Applying this framework in a controlled setting, we demonstrate the feasibility of detecting early warning signs of antisocial behavior in online discussions.
연구 동기 및 목표
- 온라인 대화에서 발생하기 전에 미래의 antisocial 행동을 예측하는 문제의 동기를 부여한다.
- 시작은 시민적이지만 derailed될 수 있는 Wikipedia 토크 페이지 대화의 제어된, 라벨이 부여된 데이터셋을 구성한다.
- politeness strategies와 rhetorical prompts 같은 pragmatic devices를 추출하는 프레임워크를 개발한다.
- 이러한 초기 언어적 단서가 대화의 전개를 예측하고 실행 가능한 통찰을 제공할 수 있는지 평가한다.
제안 방법
- 오염도(classifier) 및 crowdsourced filtering을 사용하여 시민적으로 시작된 대화를 식별한다.
- 같은 토크 페이지에서 문제를 제어하기 위해 awry-turning 대화와 on-track 대화를 매칭된 제어 세트로 만들어 주제 상충(confounds)을 제어한다.
- Brown and Levinson (1987)의 의존성 파싱을 따라 패턴 매칭을 통해 politeness strategies를 추출한다.
- 비지도 방식의 의존성 파싱 기반 표현과 클러스터링을 통해 도메인 특화 대화 프롬프트를 발견한다.
- Leave-one-page-out 교차 검증에서 로지스틱 회귀로 실용적 특성의 예측력을 평가한다.
실험 결과
연구 질문
- RQ1초기 교환의 조기 언어 신호가 대화가 개인 공격으로 흐트러질지 여부를 예측할 수 있는가?
- RQ2공손 전략은 대화의 미래 전개와 어떻게 관련되는가?
- RQ3비지도적으로 발견된 도메인 특화 프롬프트가 미리 정의된 공손성 표지자 이외의 예측 신호에 기여하는가?
- RQ4실용적 특성의 예측력이 기본 언어 또는 사용자 특성에 비해 어떤 차이를 보이는가?
주요 결과
- 처음 두 개의 코멘트에서의 공손성과 프롬프트 유형 특성은 향후 흐트러짐에 대한 측정 가능한 예측 신호를 제공한다.
- 초기의 직접적인 질문과 문장 시작의 you 대명사는 awry-turning conversations와 관련이 있다 (p < 0.001).
- 처음 교환의 감사 인사와 인사는 on-track 대화에서 더 흔하다 (p < 0.001 ~ p < 0.05).
- Pragmatic features (prompts + politeness)는 미래 결과를 예측하는 정확도가 61.6%로, bag-of-words 및 sentiment만의 베이스라인보다 우수하다.
- toxicity 신호와 pragmatic features를 결합하면 64.9%의 정확도에 도달해 인간 성능(72%)에 근접하고 일부 베이스라인을 상회한다.
- 사람은 미래의 공격을 72%의 정확도로 예측하고, 모델은 사람이 옳았던 80%의 케이스에서 사람과 일치한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.