[논문 리뷰] NoFake at CheckThat! 2021: Fake News Detection Using BERT
이 논문은 추가로 확인된 사실 자료를 활용하여 성능을 향상시키는 BERT 기반 모델을 제안하며, 가짜 뉴스 탐지 및 도메인 분류를 수행한다. CheckThat! 2021 평가에서 Task 3A에서 83.76%의 매크로 F1 점수와 Task 3B에서 85.55%의 매크로 F1 점수를 기록하여, 레이블 병합 및 도메인 인식 분류를 통해 일반화 능력이 향상됨을 보여준다.
Much research has been done for debunking and analysing fake news. Many researchers study fake news detection in the last year, but many are limited to social media data. Currently, multiples fact-checkers are publishing their results in various formats. Also, multiple fact-checkers use different labels for the fake news, making it difficult to make a generalisable classifier. With the merge classes, the performance of the machine model can be enhanced. This domain categorisation will help group the article, which will help save the manual effort in assigning the claim verification. In this paper, we have presented BERT based classification model to predict the domain and classification. We have also used additional data from fact-checked articles. We have achieved a macro F1 score of 83.76 % for Task 3Aand 85.55 % for Task 3B using the additional training data.
연구 동기 및 목표
- 가짜 뉴스 탐지 및 기사 도메인 분류를 동시에 수행할 수 있는 통합 BERT 기반 모델 개발.
- 다양한 사실 확인 소스에서 유사한 가짜 뉴스 레이블을 병합하여 모델의 일반화 능력을 향상시키기.
- 도메인 기반 자동 기사 분류를 통해 주장 검증 과정에서 수동 작업을 줄이기.
- 추가로 제공된 사실 확인 기사 데이터를 활용하여 성능 향상.
- 다양한 사실 확인 플랫폼 간 레이블 불일치 문제를 해결하기 위해 통합 분류 프레임워크 구축.
제안 방법
- 유사한 레이블을 병합한 다중 레이블 가짜 뉴스 데이터셋에 사전 학습된 BERT 모델을 피팅하여 일반화 능력을 향상.
- 모델의 강건성 향상을 위해 사실 확인된 기사에서 유래한 추가 학습 데이터 통합.
- 가짜 뉴스 상태와 기사 도메인을 동시에 예측할 수 있는 공동 분류 헤드 훈련.
- 다양한 사실 확인 소스에서의 클래스 불균형 문제를 완화하고 성능 향상을 위해 레이블 병합 전략 적용.
- 이진 가짜 뉴스 탐지 및 다중 클래스 도메인 분류 작업 모두에 매크로 F1 점수를 주요 평가 지표로 사용.
- 뉴스 텍스트의 맥락적 및 의미적 특징을 효과적으로 포착하기 위해 BERT에서의 전이 학습 활용.
실험 결과
연구 질문
- RQ1통합 BERT 기반 모델이 가짜 뉴스 탐지 및 도메인 분류를 효과적으로 수행할 수 있는가?
- RQ2다양한 사실 확인 소스에서의 레이블 병합 전략이 모델 성능과 일반화 능력에 어떤 영향을 미치는가?
- RQ3추가로 제공된 사실 확인 데이터를 통합할 경우 탐지 정확도가 얼마나 향상되는가?
- RQ4도메인 분류 기능이 주장 검증 과정에서 수동 작업을 얼마나 줄일 수 있는가?
- RQ5표준화된 벤치마크인 CheckThat! 2021의 Task 3A 및 Task 3B에서 모델의 성능은 어떠한가?
주요 결과
- 모델은 가짜 뉴스 탐지에 중점을 둔 Task 3A에서 매크로 F1 점수 83.76%를 기록했다.
- 가짜 뉴스 탐지 및 도메인 분류를 모두 포함하는 Task 3B에서 매크로 F1 점수 85.55%를 기록했다.
- 추가로 통합된 사실 확인 데이터가 두 작업 모두에서 모델 성능 향상에 크게 기여했다.
- 다양한 사실 확인 소스 간 레이블 병합 전략이 더 나은 모델 일반화 능력과 클래스 불균형 완화에 기여했다.
- 가짜 뉴스 상태와 도메인을 동시에 예측함으로써 더 효율적이고 확장 가능한 주장 검증 워크플로우가 가능해졌다.
- 결과적으로 도메인 인식 분류가 가짜 뉴스 탐지 시스템의 종합적 효과를 높임을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.