Skip to main content
QUICK REVIEW

[논문 리뷰] Accenture at CheckThat! 2020: If you say so: Post-hoc fact-checking of claims using transformer-based models

Evan Williams, Paul Rodrigues|arXiv (Cornell University)|2020. 09. 05.
Topic Modeling참고 문헌 23인용 수 12
한 줄 요약

이 논문은 RoBERTa 및 BERT 모델을 미세조정하여 영어 및 아랍어 데이터셋을 기반으로 검증이 필요한 사회적 미디어 주장들을 식별하고 순위를 매기는 트랜스포머 기반 접근법을 제시한다. 이 방법은 최신 기술 수준의 성능을 달성하여 영어 트랙에서 1위(평균 정밀도 = 0.8064)를 기록했고, 아랍어 트랙에서는 1위에서 4위까지를 차지하며, P@30 점수가 최대 0.7000에 이르렀으며, 역번역 기법이 자원이 적은 아랍어 데이터에 대해 성능 향상에 크게 기여하였다.

ABSTRACT

We introduce the strategies used by the Accenture Team for the CLEF2020 CheckThat! Lab, Task 1, on English and Arabic. This shared task evaluated whether a claim in social media text should be professionally fact checked. To a journalist, a statement presented as fact, which would be of interest to a large audience, requires professional fact-checking before dissemination. We utilized BERT and RoBERTa models to identify claims in social media text a professional fact-checker should review, and rank these in priority order for the fact-checker. For the English challenge, we fine-tuned a RoBERTa model and added an extra mean pooling layer and a dropout layer to enhance generalizability to unseen text. For the Arabic task, we fine-tuned Arabic-language BERT models and demonstrate the use of back-translation to amplify the minority class and balance the dataset. The work presented here was scored 1st place in the English track, and 1st, 2nd, 3rd, and 4th place in the Arabic track.

연구 동기 및 목표

  • 저널리스트들이 정보 과부하를 겪지 않도록 전문적 사실 확인이 필요한 사회적 미디어 주장들을 식별하고 순위를 매기는 기계 학습 시스템을 개발하는 것.
  • 자원이 적은 NLP 환경에서의 도전 과제를 해결하기 위해 데이터 증강 기법을 통해 모델의 일반화 능력을 향상시키는 것.
  • 사전 훈련된 트랜스포머 모델(BERT, RoBERTa)을 활용한 전이 학습을 통해 多국어 사회적 미디어 텍스트 내 주장들을 분류하고 우선순위를 매기는 것.
  • 역번역 및 사전 처리 전략이 불균형한 아랍어 주장 식별 데이터에서 모델 성능 향상에 기여하는지 평가하는 것.
  • 신뢰할 수 있고 설명 가능하며 확장 가능한 사실 확인 추천 시스템을 구축하여 전문가의 의사결정 워크플로우를 지원하는 것.

제안 방법

  • 사회적 미디어 데이터셋에서 주장의 검증 가능성을 주석 처리한 영어 및 아랍어 데이터셋을 기반으로 RoBERTa 및 아랍어 BERT 모델을 미세조정하였다.
  • 미세조정된 영어 모델에 평균 풀링 레이어와 드롭아웃을 추가하여 새로운 텍스트에 대한 일반화 능력을 향상시켰다.
  • 아랍어 훈련 세트의 소수 클래스를 증강하기 위해 역번역(Arabic → English → Arabic) 기법을 적용하여 모델의 강건성을 높였다.
  • 다양한 사전 처리 전략(음절 표기 제거, URL 제거, 구두점 제거, 불용어 제거)을 평가했지만 성능 향상이 없어 모든 사전 처리를 제거하였다.
  • 평가 지표로는 보류된 테스트 세트에서의 순위 성능을 평가하기 위해 정밀도@k(P@k)와 평균 평균 정밀도(mAP)를 사용하였다.
  • 모델 버전 간의 내부 평가를 수행하여 최고의 성능을 보인 설정을 선별하고 제출하였다.

실험 결과

연구 질문

  • RQ1RoBERTa 및 BERT 모델은 제한된 레이블 데이터와 최소한의 미세조정으로 사회적 미디어 텍스트 내 검증이 필요한 주장들을 효과적으로 식별할 수 있는가?
  • RQ2역번역 기법은 자원이 적고 불균형한 아랍어 주장 식별 데이터셋에서 모델 성능을 어떻게 향상시키는가?
  • RQ3다양한 사전 처리 기법이 다국어 주장 식별에서 트랜스포머 모델의 성능에 어떤 영향을 미치는가?
  • RQ4사전 훈련된 모델을 활용한 전이 학습은 사실 확인 시스템에서 대규모 애너테이션 데이터의 필요성을 줄일 수 있는가?
  • RQ5역번역을 통한 데이터 증강이 레이블 누출 없이 아랍어 주장 식별에서 클래스 불균형 문제를 얼마나 효과적으로 완화하는가?

주요 결과

  • Accenture 팀은 영어 트랙에서 평균 정밀도(mAP) 0.8064를 기록하여 다른 제출물들을 압도하며 1위를 차지하였다.
  • 아랍어 트랙에서는 각각 P@30 점수 0.7000, 0.6750, 0.6694, 0.6639를 기록하여 1위에서 4위까지를 석권하였다.
  • 역번역(Arabic → English → Arabic) 기법이 성능 향상에 크게 기여하여, 수정되지 않은 모델의 P@30 0.6694에서 증강된 모델의 P@30 0.7000으로 상승시켰다.
  • 음절 표기, URL, 구두점 제거 등의 사전 처리 단계는 성능 향상에 기여하지 않아 최종적으로 모두 제거되었다.
  • 역번역된 데이터의 사용이 테스트된 모든 기법 중에서 가장 큰 성능 향상을 이끌었으며, 하이퍼파라미터 튜닝 및 데이터 균형 조정을 초월하였다.
  • 특히 훈련 데이터와 테스트 데이터 간 주제 이질성이 존재함에도 불구하고, 아랍어 트랙에서 훌륭한 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.