[논문 리뷰] Contrastive Domain Adaptation for Early Misinformation Detection: A Case Study on COVID-19
이 논문은 코로나19 분야에서 조기 위기 정보 유포 탐지에 대비한 대비적 도메인 적응 프레임워크인 CANMD를 제안한다. 이는 가짜 레이블 보정과 허위 레이블링 및 대비적 적응 손실을 통한 불변 표현 학습을 동시에 수행한다. 이 방법은 도메인 및 레이블 이동이 심한 상황에서도 기존의 최고 성능 기준보다 최대 34.5% 향상된 균형 정확도를 달성한다.
Despite recent progress in improving the performance of misinformation detection systems, classifying misinformation in an unseen domain remains an elusive challenge. To address this issue, a common approach is to introduce a domain critic and encourage domain-invariant input features. However, early misinformation often demonstrates both conditional and label shifts against existing misinformation data (e.g., class imbalance in COVID-19 datasets), rendering such methods less effective for detecting early misinformation. In this paper, we propose contrastive adaptation network for early misinformation detection (CANMD). Specifically, we leverage pseudo labeling to generate high-confidence target examples for joint training with source data. We additionally design a label correction component to estimate and correct the label shifts (i.e., class priors) between the source and target domains. Moreover, a contrastive adaptation loss is integrated in the objective function to reduce the intra-class discrepancy and enlarge the inter-class discrepancy. As such, the adapted model learns corrected class priors and an invariant conditional distribution across both domains for improved estimation of the target data distribution. To demonstrate the effectiveness of the proposed CANMD, we study the case of COVID-19 early misinformation detection and perform extensive experiments using multiple real-world datasets. The results suggest that CANMD can effectively adapt misinformation detection systems to the unseen COVID-19 target domain with significant improvements compared to the state-of-the-art baselines.
연구 동기 및 목표
- 기존의 소스 도메인에서 학습된 모델을 새로운 목표 도메인에 적용할 때 일반화 성능이 열 劣한 문제를 해결하기 위해, 특히 코로나19 패닉 초기 단계의 위기 정보 유포 탐지에 초점을 맞춘다.
- 소스 도메인과 목표 도메인 간의 큰 조건부 및 레이블 이동이 발생할 경우 실패하는 기존의 도메인 적응 방법의 한계를 극복한다.
- 코로나19 패닉 기간 동안 발생하는 새로운 위기 정보 탐지와 같은 저자원, 레이블 부족 환경에서의 조기 탐지 성능을 향상시키기 위해 노력한다.
- 클래스 사전 이동을 효과적으로 보정하고 다양한 도메인 간에 불변 표현을 학습함으로써 더 견고한 탐지 성능을 확보하는 방법을 개발한다.
제안 방법
- 목표 도메인에 대해 고신뢰도의 가짜 레이블 예측을 생성하기 위해 미리 학습된 위기 정보 탐지 모델을 활용한다.
- 소스 도메인과 목표 도메인 간의 레이블 이동(즉, 클래스 사전 차이)을 추정하고 보정하기 위해 학습 가능한 스케일링 구성 요소를 도입한다.
- 소스 데이터와 가짜 레이블이 부여된 목표 데이터 간의 공동 학습 분포를 균형 잡기 위해 클래스 인식 샘플링 전략을 적용한다.
- 특징 공간 내에서 동일 클래스 간 변동성을 최소화하고 이질 클래스 간 분리를 최대화하기 위해 대비적 적응 손실을 적용한다.
- 분류, 레이블 보정, 대비적 적응을 조합한 다목적 손실을 사용하여 소스 데이터와 가짜 레이블이 부여된 목표 데이터를 함께 학습한다.
- 가짜 레이블링 과정에서 온도 스케일링과 신뢰도 임계값 설정을 적용하여 공동 학습에 적합한 고품질의 목표 예측을 보장한다.
실험 결과
연구 질문
- RQ1소스 도메인과 목표 도메인 간에 큰 레이블 이동과 조건부 이동이 발생할 경우, 도메인 적응 방법이 코로나19 도메인에서 조기 위기 정보 유포를 효과적으로 탐지할 수 있는가?
- RQ2레이블 이동 보정은 저자원 위기 정보 탐지 환경에서 도메인 적응 모델의 성능에 어떤 영향을 미치는가?
- RQ3대비적 학습은 위기 정보 탐지에서 소스 도메인과 목표 도메인 간의 특징 불변성과 분류 견고성을 어느 정도 향상시키는가?
- RQ4제안된 프레임워크는 심한 도메인 차이와 클래스 불균형 상황에서도 기존의 최고 수준의 도메인 적응 기준을 초월하는가?
- RQ5신뢰도 임계값과 대비적 손실 가중치와 같은 하이퍼파rameter에 대해 이 프레임워크는 얼마나 민감한가?
주요 결과
- CANMD는 다양한 목표 데이터셋에서 최고 수준의 기준 대비 평균 11.5% 향상된 균형 정확도를 달성한다.
- CoAID 데이터셋에서 CANMD는 0.6487의 균형 정확도를 기록했으며, 이는 클래스 불균형이 심각한 상황에서 기준 모델들이 약 0.5 수준에 머무르는 것과 비교해 뚜렷한 성능 향상을 보였다.
- CoAID에서 레이블 보정 구성 요소가 성능 향상의 대부분 기여를 했으며, 이는 약 90% 이상의 예측이 신뢰할 수 있는 것으로 간주되는 상황에서 사전 이동 보정의 효과를 입증한다.
- 대비적 적응 손실은 모든 데이터셋에서 성능 향상을 이끌었으며, 도메인 간 차이가 큰 데이터셋에서 가장 뚜렷한 성과를 보였다.
- 프레임워크는 하이퍼파rameter 변화에 대해 뛰어난 내구성을 보였으며, 다양한 신뢰도 임계값과 대비적 손실 가중치에서도 안정적인 성능을 유지했다.
- 제거 실험 결과, 레이블 보정과 대비적 적응 모두 필수적임을 확인했으며, 둘 중 하나를 제거할 경우 성능이 크게 떨어졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.