[논문 리뷰] Online Learning with Abstention
이 논문은 시간에 따라 변화하는 피드백 그래프와 역사적 데이터를 활용하여 스 tochastic 환경에서 상당히 향상된 리그레트 보장을 달성하는 새로운 온라인 학습 알고리즘 ucb-gt를 소개한다. ucb-n의 표준 확장보다 뛰어나며, 전체 정보 기반 보조 알고리즘의 성능에 가까워지며, 다양한 데이터셋과 기각 비용에서 강력한 경험적 성과를 보여준다.
We present an extensive study of the key problem of online learning where algorithms are allowed to abstain from making predictions. In the adversarial setting, we show how existing online algorithms and guarantees can be adapted to this problem. In the stochastic setting, we first point out a bias problem that limits the straightforward extension of algorithms such as UCB-N to time-varying feedback graphs, as needed in this context. Next, we give a new algorithm, UCB-GT, that exploits historical data and is adapted to time-varying feedback graphs. We show that this algorithm benefits from more favorable regret guarantees than a possible, but limited, extension of UCB-N. We further report the results of a series of experiments demonstrating that UCB-GT largely outperforms that extension of UCB-N, as well as more standard baselines.
연구 동기 및 목표
- 학습자가 예측을 기각할 수 있는 비용을 지불하는 온라인 학습 문제를 다루며, 기각할 경우 피드백은 부분적임.
- ucb-n과 같은 표준 스 tochastic 밴딧 알고리즘을 기각 설정으로 확장할 때 발생하는 편향 문제를 해결함.
- 시간에 따라 변화하는 피드백 그래프와 역사를 활용하여 리그레트 성능을 향상시키는 새로운 알고리즘 ucb-gt를 설계함.
- 기각 프레임워크 하에서 적대적 및 스 tochastic 설정 모두에 대해 이론적 리그레트 보장을 제공함.
- 다양한 데이터셋과 기각 비용에서 ucb-gt가 ucb-n 및 기타 기준보다 뛰어나다는 경험적 검증을 수행함.
제안 방법
- 역사적 데이터와 시간에 따라 변화하는 전문가 행동에 기반해 동적으로 피드백 그래프를 구성하는 스 tochastic 밴딧 알고리즘인 ucb-gt를 제안함.
- 기각 손실에 맞춰 조정된 서로서트 손실 함수를 사용하여 부분 관찰성을 유지하면서도 효율적인 학습을 가능하게 함.
- 각 전문가가 가설과 기각 임계값으로 정의되는 예측기와 기각 함수의 조합에서 전문가 조언을 통합함.
- 시간에 따라 변화하는 피드백 그래프 구조를 활용하여 활성 전문가와 손실 관찰 방식을 반영함.
- 피드백 그래프를 활용한 온라인 학습 프레임워크를 시간에 따라 변화하는 기각 결정의 특성에 맞게 적응함.
- 서로서트 손실과 부분 피드백을 사용하여 ContextualExp3을 기각 설정으로 확장함으로써 적대적 환경에서 리그레트 한계를 확보함.
실험 결과
연구 질문
- RQ1기존 온라인 학습 알고리즘은 어떻게 부분 피드백을 동반한 기각 옵션을 처리할 수 있는가?
- RQ2기각 설정 하에서 적대적 및 스 tochastic 설정 모두에 대해 온라인 학습의 이론적 리그레트 보장은 무엇인가?
- RQ3ucb-n의 간단한 확장이 스 tochastic 설정에서 실패하는 이유는 무엇이며, 이 편향은 어떻게 수정할 수 있는가?
- RQ4시간에 따라 변화하는 피드백 그래프를 활용하여 기각이 있는 온라인 학습의 성능을 향상시킬 수 있는가?
- RQ5ucb-gt는 다양한 데이터셋과 기각 비용에서 ucb-n 및 기타 기준보다 어떻게 비교되는가?
주요 결과
- ucb-gt는 HIGGS, phishing, ijcnn, covtype, eye, skin, cod-rna, guide, CIFAR 등 모든 테스트 데이터셋에서 ucb-nt와 순수한 ucb보다 뚜렷이 뛰어나다.
- ucb-gt의 리그레트는 항상 전체 정보 기반 보조 알고리즘(fs)에 가까워지며, 실질적으로 최적에 가까운 성능을 보여준다.
- ucb-gt의 피드백 그래프에 포함된 간선 수는 100만에서 300만 사이로, ucb-nt의 약 20만 간선보다 최소 5배 이상 높아 정보 공유가 향상됨.
- 기각 비용이 증가할수록 선택된 전문가가 기각하는 데이터 포인트 비율이 감소하는 경향을 보이며, 이는 모든 데이터셋에서 일관되게 나타남.
- confident 기반 전문가 및 극단적인 기각 비용(c=0.001 및 c=0.9) 설정에서도 ucb-gt는 강력한 성능 유지를 보임.
- 전문가 수와 데이터셋 특성의 변화에 대해 유연하게 대응하며, 추가 실험 전반에서 ucb-nt를 항상 앞서는 성능 유지를 보임.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.