Skip to main content
QUICK REVIEW

[논문 리뷰] Prediction with Unpredictable Feature Evolution

Bojian Hou, Lijun Zhang|arXiv (Cornell University)|2019. 04. 27.
Data Stream Mining Techniques참고 문헌 46인용 수 6
한 줄 요약

이 논문은 임의의 비동시적 특성 변화 상황에서 온라인 학습을 위한 새로운 프레임워크인 예측 불가능한 특성 변화를 고려한 예측(PUFE)을 제안한다. 불완전한 겹침 기간을 행렬 완성 문제로 모델링하고 기저 모델의 적응형 앙상블을 사용함으로써, PUFE는 새로운 특성 공간이 시작된 이후에도 최고의 기저 모델과 유사한 성능을 달성하여, 특성 변화가 예측 불가능한 실세계 스트리밍 환경에서의 강인성을 확보한다.

ABSTRACT

Learning with feature evolution studies the scenario where the features of the data streams can evolve, i.e., old features vanish and new features emerge. Its goal is to keep the model always performing well even when the features happen to evolve. To tackle this problem, canonical methods assume that the old features will vanish simultaneously and the new features themselves will emerge simultaneously as well. They also assume there is an overlapping period where old and new features both exist when the feature space starts to change. However, in reality, the feature evolution could be unpredictable, which means the features can vanish or emerge arbitrarily, causing the overlapping period incomplete. In this paper, we propose a novel paradigm: Prediction with Unpredictable Feature Evolution (PUFE) where the feature evolution is unpredictable. To address this problem, we fill the incomplete overlapping period and formulate it as a new matrix completion problem. We give a theoretical bound on the least number of observed entries to make the overlapping period intact. With this intact overlapping period, we leverage an ensemble method to take the advantage of both the old and new feature spaces without manually deciding which base models should be incorporated. Theoretical and experimental results validate that our method can always follow the best base models and thus realize the goal of learning with feature evolution.

연구 동기 및 목표

  • 데이터 스트림에서 특성 변화가 동기화되고 예측 가능하다고 가정하는 기존 방법의 한계를 해결하기 위해.
  • 구형 특성이 임의의 시점에 사라져 새로운 특성와의 겹침 기간이 불완전해지는 실세계 시나리오를 모델링하기 위해.
  • 전이 기간 동안 누락된 특성 데이터를 복구하고 강력한 예측 성능를 유지할 수 있는 프레임워크를 개발하기 위해.
  • 제한된 데이터가 존재하는 상황에서도 모델이 초기 단계부터 강인하고 잘 작동하도록 보장하기 위해.

제안 방법

  • 예측 불가능한 특성 소멸로 인해 발생하는 불완전한 겹침 기간을 행렬 완성 문제로 공식화하기.
  • 기저 데이터 구조가 저랭크라는 사실을 활용하여, 저랭크 행렬 복원 기법을 사용해 특성 행렬의 누락된 항목을 보간하기.
  • 목표 행렬을 정확히 복원하기 위해 필요한 관측 항목의 최소 수를 보장하는 이론적 경계를 설정함: Ω(dr ln r) 관측 항목이 충분하며, 여기서 d는 행의 수이고 r은 랭크이다.
  • 기저 모델(NOGD, ROGD-f, ROGD-u)의 앙상블을 구성하고 이들의 과거 성능에 기반한 가중 융합 전략을 사용해 적응적으로 통합하기.
  • 보간된 행렬을 현재 완전한 특성 데이터와 통합하여, 이전과 새로운 특성 정보를 모두 활용하는 통합 모델을 훈련하기.
  • 모델 업데이트 동안 수렴성과 안정성을 확보하기 위해 시간에 따라 변화하는 학습률 τt = 1/(c√t)를 적용한 온라인 학습 수행하기.

실험 결과

연구 질문

  • RQ1구형 특성이 스트림 전이 중 예측 불가능하게 사라질 때, 행렬 완성 기법이 누락된 특성 데이터를 효과적으로 복원할 수 있는가?
  • RQ2저랭크 가정 하에, 불완전한 겹침 행렬을 정확히 복원하기 위해 최소 몇 개의 관측 항목이 필요한가?
  • RQ3적응형 앙상블 방법이 예측 불가능한 특성 변화 환경에서 개별 기저 모델보다 우월한 성능을 낼 수 있는가?
  • RQ4제안된 PUFE 프레임워크는 새로운 특성 공간의 시작 단계부터 최고의 기저 모델과 유사한 성능을 유지하는가?
  • RQ5예측 가능한 및 예측 불가능한 특성 변화 상황에서 기존 방법(FESL-c 및 FESL-s)과 비교해 PUFE는 어떻게 성능을 내는가?

주요 결과

  • 22개의 실험 케이스에서 PUFE는 16개의 케이스에서 모든 베이스라인을 앞서며, 합성 및 실세계 데이터셋 전반에 걸쳐 강력한 일반화 능력을 입증했다.
  • german-P, german-U, RFID-P 3개 케이스에서 PUFE는 95% 신뢰수준에서 최고의 기저 모델을 상당히 뛰어넘었다.
  • PUFE의 평균 누적 손실은 새로운 특성 공간의 초기 단계를 포함해 모든 시간 단계에서 최고의 베이스라인 모델과 일관되게 유사한 수준을 유지했다.
  • PUFE는 예측 가능하고 예측 불가능한 환경 모두에서 강인한 성능를 발휘했으며, 대부분의 케이스에서 FESL-c 및 FESL-s를 뛰어넘었고, 예측 가능한 환경에서도 마찬가지였다.
  • 이론적 분석을 통해 Ω(dr ln r) 관측 항목이 정확한 행렬 복원을 위해 충분함을 확인하여 신뢰할 수 있는 보간 기반의 기초를 마련했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.