[논문 리뷰] Towards Measuring Adversarial Twitter Interactions against Candidates in the US Midterm Elections
이 논문은 2018년 중간 선거 기간 동안 미국 하원 후보자들을 대상으로 한 악성 상호작용—예를 들어, 독성 답변, 신원 공격, 메시지 반복—을 인지하는 맥락 인식 기반 방법을 제안한다. 일반적인 독성 모델이 놓치는 세밀하고 맥락에 따라 달라지는 폭력적 발언을 보다 정확하게 탐지하기 위해, Perspective API와 정당 성향 히وري스틱, 후보자별 악성 어휘 사전을 위한 신규 레이블 전파 알고리즘을 융합함으로써 정밀도를 향상시켰으며, 786명의 후보자로부터 분석된 170만 개의 트윗을 대상으로 분석하였다.
Adversarial interactions against politicians on social media such as Twitter have significant impact on society. In particular they disrupt substantive political discussions online, and may discourage people from seeking public office. In this study, we measure the adversarial interactions against candidates for the US House of Representatives during the run-up to the 2018 US general election. We gather a new dataset consisting of 1.7 million tweets involving candidates, one of the largest corpora focusing on political discourse. We then develop a new technique for detecting tweets with toxic content that are directed at any specific candidate.Such technique allows us to more accurately quantify adversarial interactions towards political candidates. Further, we introduce an algorithm to induce candidate-specific adversarial terms to capture more nuanced adversarial interactions that previous techniques may not consider toxic. Finally, we use these techniques to outline the breadth of adversarial interactions seen in the election, including offensive name-calling, threats of violence, posting discrediting information, attacks on identity, and adversarial message repetition.
연구 동기 및 목표
- 트위터에서 정치적 후보자들을 향한 악성 상호작용을 식별하는 데 있어 맥락 무관 독성 탐지의 한계를 해결하기 위해.
- 정치적 정당성과 상호작용 맥락을 통합하여 독성 콘텐츠의 실제 대상이 누구인지 추론함으로써 탐지 정밀도를 향상시키기 위해.
- 일반적인 언어 모델이 탐지하지 못하는 세밀하고 개인화된 폭력적 형태를 포괄하는 후보자별 악성 어휘 사전을 발견하기 위해.
- 신원 공격, 위협, 오락성 정보, 메시지 반복을 포함한 악성 상호작용의 범위와 유형을 정량화하기 위해.
- 확장 가능하고 고정밀도의 프레임워크를 제공하여 정치적 논의에서 악성 콘텐츠를 탐지하고, 더 건강한 온라인 민주적 참여를 지원하기 위해.
제안 방법
- 최첨단 언어 기반 독성 분류기인 Perspective API와 함께, 사용자의 정당 성향을 추론하기 위한 히وري스틱을 활용하여 독성 답변의 가능성이 있는 대상을 추론한다.
- 멘션, 응답, 재트윗 등의 상호작용 맥락을 활용하여 독성 콘텐츠가 특정 후보자에게 향해 있는지 여부를 판단함으로써, 비방된 대상이 명시된 사용자에게 향하지 않은 비방의 오류 양성률을 감소시킨다.
- 정치 네트워크 그래프에 레이블 전파 알고리즘을 적용하여 후보자별 악성 어휘 사전을 발견함으로써, 맥락상 악성임을 보여주지만 본질적으로 독성이 없는 표현들을 식별한다.
- 미국 정치의 이원적 구조(공화당 대 민주당)를 대체 지표로 활용하여, 모호한 상호작용에서 대상 추론을 향상시킨다.
- 인간 평가자들이 참여하는 다단계 애너테이션 파이프라인을 통해 탐지 결과를 검증하고 악성 상호작용 유형을 분류한다.
- 786명의 후보자와 관련된 170만 개의 트윗 데이터셋을 분석하여 독성, 신원 공격, 위협, 오락성 정보, 메시지 반복 패턴에 중점을 둔다.
실험 결과
연구 질문
- RQ1언제나 언급된 사용자나 응답 대상자에게 향하지 않는 독성 콘텐츠가 존재할 경우, 트위터에서 악성 상호작용을 더 정확하게 탐지하는 방법은 무엇인가?
- RQ2정치적 정당성이 정치 후보자들을 향한 방향성 독성 탐지 정밀도 향상에 어떤 역할을 하는가?
- RQ3맥락에 의존하지 않는 언어 모델이 놓치는 악성 상호작용의 형태는 무엇이며, 후보자별 어휘 사전을 통해 어떤 형태로 드러날 수 있는가?
- RQ4성별 및 정당 소속과 같은 후보자 특성은 수신하는 악성 상호작용의 양과 어떤 관련이 있는가?
- RQ5악성 메시지 반복과 신원 기반 공격은 정치적 트위터 논의의 전체 독성 환경에 얼마나 기여하는가?
주요 결과
- 후보자가 트위터에서 받는 관심의 총량이 악성 상호작용의 강도를 가장 강력하게 예측하며, 성별이나 정당 소속의 영향은 유의미하지 않다.
- Perspective API와 정당 히وري스틱을 조합함으로써 비방된 대상이 명시되지 않은 비방의 오류 양성률을 줄여 탐지 정밀도를 향상시켰으며, 특히 응답 및 멘션 맥락에서 두드러진다.
- 제안된 레이블 전파 알고리즘이 일반 모델이 경고하지 않는 후보자별 악성 어휘 사전(예: 개인화된 모욕어, 암시적 비하어)을 성공적으로 식별하였다.
- 상당 부분의 악성 상호작용은 성별 기반 비하어나 인종적 비하어를 포함한 신원 기반 공격을 포함하며, 이를 탐지하기 위해서는 맥락 이해가 필요하다.
- 반복된 사퇴 요구나 위조 스캔들에 대한 반복적 메시지 전파와 같은 메시지 반복은 일반적으로 악성 전략이며, 트윗 시퀀스를 분석하지 않으면 탐지하기 어려운 편이다.
- 인간 평가자들은 많은 악성 상호작용이 배경 지식과 맥락적 해석이 필요로 하며, 고도로 발전한 모델을 사용하더라도 자동 탐지의 한계를 드러내었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.