Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Neural Linear Bandits: Overcoming Catastrophic Forgetting through Likelihood Matching

Tom Zahavy, Shie Mannor|arXiv (Cornell University)|2019. 01. 24.
Advanced Bandit Algorithms Research참고 문헌 34인용 수 13
한 줄 요약

이 논문은 깊이 있는 신경망 표현 간의 가능도를 일치시키기 위해 준정부형 프로그래밍을 사용하여 사전 분포를 갱신함으로써 치명적인 잊음 문제를 해결하는 메모리 효율적인 신경-선형 문맥 밴디트 알고리즘을 제안한다. 이 방법은 실제 회귀, 분류, 감성 분석 작업에서 제한된 메모리 조건에서도 선형 기반 모델과 전체 메모리 신경-선형 방법보다 뛰어난 성능을 보이며, 여러 경우에서 슈퍼리어한 성능을 달성한다.

ABSTRACT

We study the neural-linear bandit model for solving sequential decision-making problems with high dimensional side information. Neural-linear bandits leverage the representation power of deep neural networks and combine it with efficient exploration mechanisms, designed for linear contextual bandits, on top of the last hidden layer. Since the representation is being optimized during learning, information regarding exploration with "old" features is lost. Here, we propose the first limited memory neural-linear bandit that is resilient to this phenomenon, which we term catastrophic forgetting. We evaluate our method on a variety of real-world data sets, including regression, classification, and sentiment analysis, and observe that our algorithm is resilient to catastrophic forgetting and achieves superior performance.

연구 동기 및 목표

  • 대표 표현 학습 중 제한된 메모리 조건에서 신경-선형 밴디트에서 치명적인 잊음을 해결하기 위해.
  • 동적인 깊이 있는 신경망 특징 조건에서도 정확한 불확실성 추정과 탐색 효율성을 유지할 수 있는 방법을 개발하기 위해.
  • 메모리 제약 조건 하에서 깊이 있는 표현 학습과 선형 밴디트 방법을 융합하여 깊이 있는 강화학습에서 효과적인 탐색을 가능하게 하기 위해.
  • 변경되는 표현 조건에서 사전 분포 갱신을 위한 가능도 일치의 효과성을 입증하기 위해.

제안 방법

  • 심층 신경망의 마지막 은닉층에서 톰슨 샘플링(TS)을 적용하여 문맥 밴디트에서 효율적인 탐색을 수행한다.
  • 새로운 특징 조건 하에서의 보상 추정 가능도를 이전 특징 조건 하에서의 가능도와 일치시키기 위해 준정부형 프로그래밍(SDP)을 적용하여 불확실성 추정을 유지한다.
  • 표현 변화에 따라 일관성을 유지하기 위해 SDP 근사법을 통해 마지막 레이어 가중치와 사전 공분산을 사용해 사전 평균을 조정한다.
  • 전체 재생 버퍼 저장을 피하기 위해 최근 경험만을 저장하는 제한된 메모리 버퍼를 구현한다.
  • 심층 신경망 특징이 갱신될 때마다 가능도 일치를 통해 사전을 재계산하여 잊음에 대한 저항성을 확보한다.
  • 특징 추출을 위해 신경망(MLP 또는 CNN)을 사용하고, 밴디트 의사결정을 위한 선형 레이어를 상단에 배치한다.

실험 결과

연구 질문

  • RQ1표현 네트워크가 지속적으로 갱신되는 상황에서 제한된 메모리 조건에서도 신경-선형 밴디트가 성능을 유지할 수 있는가?
  • RQ2깊이 있는 신경망 특징이 시간이 지남에 따라 변화할 때 사전 분포를 효과적으로 갱신할 수 있는가?
  • RQ3이전 및 새로운 특징 표현 간의 가능도 일치가 신경-선형 밴디트에서 치명적인 잊음을 줄이는가?
  • RQ4이 방법은 비선형적이고 고차원적인 환경에서 전체 메모리 기반 모델과 선형 밴디트를 능가할 수 있는가?

주요 결과

  • 10개 데이터셋 중 8개에서, 사전 계산을 포함한 제한된 메모리 신경-선형 밴디트(알고리즘 3)가 전체 메모리 기반 모델(알고리즘 2)의 성능을 초월하거나 동등하게 유지했다.
  • 버섯(Mushroom), 금융(Financial), Statlog, 간질성(Epileptic) 4개 데이터셋에서 알고리즘 3가 무제한 메모리 기반 모델을 초월하여 잊음에 대한 저항성을 입증했다.
  • 입력 크기 약 8,000인 아마존 리뷰 감성 분석에서 CNN 기반의 제한된 메모리 방법은 누적 보상 3143.9(±33.5)를 기록했으며, 전체 메모리 버전과 거의 동일했고, ε-그리디(2963.9 ±68.5)보다 뚜렷하게 뛰어난 성능을 보였다.
  • 비선형 데이터셋에서 제한된 메모리 신경-선형 밴디트가 5개 중 4개의 경우에서 선형 톰슨 샘플링보다 뛰어난 성능을 보이며, 메모리 제약 조건 하에서도 표현 학습의 이점을 입증했다.
  • 메모리와 계산 복잡도를 O(T)로 줄임으로써 이전의 전체 메모리 접근 방식과 비교해 유사하거나 더 뛰어난 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.