Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Causal Models Online

Khurram Javed, Martha White|arXiv (Cornell University)|2020. 06. 12.
Domain Adaptation and Few-Shot Learning참고 문헌 25인용 수 14
한 줄 요약

이 논문은 신경망 내 임의의 특징을 탐지하고 제거하기 위해 시간적 불안정성을 활용하는 온라인 알고리즘인 PwB*를 제안한다. 이 특징들은 목표와의 상관관계가 시간이 지남에 따라 변화한다. 반복적인 네트워크 파라미터 변형과 손실 및 특징 분산 최소화를 통해, 이 방법은 일반화 능력이 뛰어난 모델로 수렴하며, 개입 데이터나 전체 분포 커버리지가 없는 조건에서도 기준 방법인 Oracle IRM보다 온라인 환경에서 더 우수한 성능을 보인다. 원시 데이터로부터 비임의적 특징을 탐지한다.

ABSTRACT

Predictive models -- learned from observational data not covering the complete data distribution -- can rely on spurious correlations in the data for making predictions. These correlations make the models brittle and hinder generalization. One solution for achieving strong generalization is to incorporate causal structures in the models; such structures constrain learning by ignoring correlations that contradict them. However, learning these structures is a hard problem in itself. Moreover, it's not clear how to incorporate the machinery of causality with online continual learning. In this work, we take an indirect approach to discovering causal models. Instead of searching for the true causal model directly, we propose an online algorithm that continually detects and removes spurious features. Our algorithm works on the idea that the correlation of a spurious feature with a target is not constant over-time. As a result, the weight associated with that feature is constantly changing. We show that by continually removing such features, our method converges to solutions that have strong generalization. Moreover, our method combined with random search can also discover non-spurious features from raw sensory data. Finally, our work highlights that the information present in the temporal structure of the problem -- destroyed by shuffling the data -- is essential for detecting spurious features online.

연구 동기 및 목표

  • 부분적인 데이터 분포에서 학습된 예측 모델의 취약성을 인과 불변성의 통합을 통해 해결하기 위해.
  • 완전한 데이터 커버리지에 의존하지 않고 온라인 지속 학습을 가능하게 하며 인과 일반화를 달성하기 위해.
  • 실시간으로 비임의적 특징을 식별하고 제거하기 위한 확장 가능한 비기울기 기반 방법을 개발하기 위해.
  • 데이터의 시간적 구조—온라인 학습에서 유지되는 것—가 비임의적 상관관계 탐지에 필수적임을 보여주기 위해.
  • 무작위로 파라미터 변형을 시행하는 검색 기반 접근이 원시 감각 입력에서 비임의적 특징을 효과적으로 탐지할 수 있음을 보여주기 위해.

제안 방법

  • 이 방법은 시간에 따른 특징 분산 변화를 측정함으로써 비임의적 특징을 탐지하기 위해 온라인 변형 기반 검색을 사용한다.
  • 두 가지 목표를 유지한다: 예측 손실 최소화와 시간에 따른 특징 가중치 분산(v) 최소화이며, 효율성을 위해 v는 오프라인 추정을 통해 계산된다.
  • 손실 최소화와 분산 최소화 간의 갈등을 방지하기 위해, 변형을 합성곱 및 완전 연결 레이어에 선택적으로 적용한다.
  • 온라인 동작을 가능하게 하기 위해, 이 알고리즘은 이진화된 특징 표현(PwB*)을 사용하여 v를 효율적으로 추정한다.
  • 비임의적 특징의 시간적 불안정성—목표와의 상관관계가 시간에 따라 변동됨—을 신호로 활용하여 제거한다.
  • 특징 선택을 위해 기울기 기반 최적화를 피함으로써, 장기간에 걸친 신용 할당이 가능해진다.

실험 결과

연구 질문

  • RQ1개입 정보나 전체 데이터 커버리지 없이도 온라인 지속 학습 환경에서 비임의적 특징을 탐지하고 제거할 수 있는가?
  • RQ2비임의적 특징의 시간적 불안정성이 실시간에서 인과적 특징 탐지에 신뢰할 수 있는 신호가 될 수 있는가?
  • RQ3비기울기 기반의 변형 기반 방법이 신경망 내 비임의적 상관관계를 효과적으로 식별하고 제거할 수 있는가?
  • RQ4이 방법이 원시 감각 데이터에서 비임의적 특징을 얼마나 잘 탐지할 수 있는가?
  • RQ5온라인 학습에서 유지되는 데이터의 시간적 구조는 셔플된 데이터보다 비임의적 상관관계 탐지에 더 나은 성능을 내는 데 어떤 기여를 하는가?

주요 결과

  • PwB*는 온라인 컬러드 MNIST 벤치마크에서 68.83 ± 0.49의 테스트 정확도를 달성하여 온라인 환경에서 기준 방법보다 뛰어난 성능을 보였다.
  • 비임의적 상관관계를 안정적으로 유지하도록 설정한 PwB* (0.85) 버전은 색상 정보를 예상대로 활용하여, 이 방법이 상관관계 불안정성에 민감함을 확인했다.
  • 온라인 및 오프라인 추정치 간의 강한 피어슨 상관계수(r = +0.91)가 발견되어, 정확도를 저하시키지 않고도 속도를 높이기 위해 오프라인 v 추정을 사용하는 것이 타당함을 검증했다.
  • 이 방법은 랜덤 검색을 통해 원시 이미지에서 비임의적 특징을 성공적으로 탐지하여 감각 데이터 적용 가능성을 입증했다.
  • PwB*는 Oracle IRM과 같은 기울기 기반 방법과 달리 확장 가능하고 온라인 지속 학습과 호환됨을 입증했다.
  • 결과는 데이터의 시간적 구조가 비임의적 특징 탐지에 필수적임을 시사한다—셔플링은 이 신호를 파괴하고 탐지 능력을 약화시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.