[논문 리뷰] Label Noise-Resistant Mean Teaching for Weakly Supervised Fake News Detection
이 논문은 사용자 피드백 댓글을 활용하여 약한 레이블을 생성하고 개선하는 데 기반한 새로운 약한 지도 학습 기반 가짜 뉴스 탐지 방법인 레이블 노이즈 저항성 평균 트레이닝(LNMT)을 제안한다. 의미적 및 정서적 상관관계 모델링과 레이블 전파 및 신뢰도 추정 기능을 갖춘 평균 트레이너 프레임워크를 통합함으로써, LNMT는 약한 레이블의 노이즈를 크게 감소시키고 실제 데이터셋에서 최신 기술 수준의 성능을 달성한다.
Fake news spreads at an unprecedented speed, reaches global audiences and poses huge risks to users and communities. Most existing fake news detection algorithms focus on building supervised training models on a large amount of manually labeled data, which is expensive to acquire or often unavailable. In this work, we propose a novel label noise-resistant mean teaching approach (LNMT) for weakly supervised fake news detection. LNMT leverages unlabeled news and feedback comments of users to enlarge the amount of training data and facilitates model training by generating refined labels as weak supervision. Specifically, LNMT automatically assigns initial weak labels to unlabeled samples based on semantic correlation and emotional association between news content and the comments. Moreover, in order to suppress the noises in weak labels, LNMT establishes a mean teacher framework equipped with label propagation and label reliability estimation. The framework measures a weak label similarity matrix between the teacher and student networks, and propagates different valuable weak label information to refine the weak labels. Meanwhile, it exploits the consistency between the output class likelihood vectors of the two networks to evaluate the reliability of the weak labels and incorporates the reliability into model optimization to alleviate the negative effect of noisy weak labels. Extensive experiments show the superior performance of LNMT.
연구 동기 및 목표
- 감독 학습에서 가짜 뉴스 데이터를 수동으로 레이블링하는 데 드는 높은 비용과 자원의 부족 문제를 해결하기 위해.
- 사용자 피드백 댓글을 약한 지도 학습의 원천으로 활용하여 약한 지도 학습 기반의 가짜 뉴스 탐지 성능을 향상시키기 위해.
- 사용자 댓글에서 유도된 노이즈가 많은 약한 레이블이 모델 성능에 악영향을 미치는 것을 최소화하기 위해.
- 평균 트레이너 프레임워크 내에서 레이블 전파 및 신뢰도 추정을 통합하여 모델의 강건성을 향상시키기 위해.
제안 방법
- 기본 모델은 뉴스 콘텐츠와 사용자 댓글 간의 의미적 상관관계 및 정서적 연관성을 측정하여, 레이블이 없는 뉴스에 대해 초기 약한 레이블을 자동으로 할당한다.
- 같은 아키텍처를 공유하지만 다른 학습률로 훈련되는 교사 및 학생 네트워크를 갖춘 평균 트레이너 프레임워크를 적용하여 정보 상호작용을 가능하게 한다.
- 유사도 기반으로 교사 네트워크의 개선된 레이블 정보를 학생 네트워크로 전파하기 위해 레이블 전파를 적용한다.
- 교사 및 학생 네트워크 간 예측 일관성을 평가하여 레이블 신뢰도 추정을 수행하며, 최적화 과정에서 신뢰도가 낮은 약한 레이블에 낮은 가중치를 할당한다.
- 레이블 신뢰도를 고려한 손실 함수를 사용하여, 레이블 데이터와 개선된 약한 레이블을 동시에 최적화함으로써 학생 네트워크를 공동으로 최적화한다.
- 기본 모델은 사용자 피드백 내 정서적 연관성을 포착함으로써 특징 표현을 향상시키기 위해 정서 인식 인코더를 통합한다.
실험 결과
연구 질문
- RQ1사용자 피드백 댓글을 효과적으로 활용하여 가짜 뉴스 탐지에 대한 신뢰할 수 있는 약한 레이블을 생성할 수 있는가?
- RQ2딥 러닝 프레임워크를 활용해 약한 지도 학습 기반의 가짜 뉴스 탐지에서 발생하는 레이블 노이즈를 어떻게 완화할 수 있는가?
- RQ3의미적 및 정서적 상관관계 통합이 약한 레이블 품질에 얼마나 기여하는가?
- RQ4레이블 전파 및 신뢰도 추정 기능을 갖춘 평균 트레이너 프레임워크가 기존의 약한 지도 학습 방법보다 우월한가?
주요 결과
- LNMT는 모든 설정(감독, 준감독, 약한 지도 학습)에서 WeChat 데이터셋에서 정확도, AUC-ROC, 정밀도, 재현율, F1 점수 등 모든 지표에서 최고 성능을 기록한다.
- 약한 지도 학습 설정에서 LNMT는 두 번째로 우수한 성능을 보인 WeFEND보다 정확도 2.7%p, AUC-ROC 2.8%p 향상되었다.
- 제거 실험 결과, 정서 인식 인코더를 제거하면 정확도가 1.3%p 감소하고 AUC-ROC가 1.2%p 감소하여, 이는 특징 품질 향상에 기여함을 확인한다.
- 레이블 전파 기능을 포함한 평균 트레이너 프레임워크는 기본 평균 트레이너보다 정확도 1.3%p, AUC-ROC 1.4%p 향상되었다.
- 레이블 신뢰도 추정 기능은 정확도 1.8%p, AUC-ROC 1.7%p 향상시키며, 노이즈가 많은 레이블 억제에 효과적임을 입증한다.
- 준감독 설정에서 LNMT의 변종은 두 번째로 뛰어난 성능을 보인 CNN+Semi보다 정확도 4.2%p, AUC-ROC 0.3%p 향상되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.