Skip to main content
QUICK REVIEW

[논문 리뷰] Approachability in unknown games: Online learning meets multi-objective optimization

Shie Mannor, Vianney Perchet|arXiv (Cornell University)|2014. 02. 10.
Advanced Bandit Algorithms Research참고 문헌 20인용 수 8
한 줄 요약

이 논문은 게임 구조에 대한 사전 지식 없이 임의의 벡터 값 보상만 관측하는 비알려진 게임에서 접근 가능성에 대한 새로운 프레임워크를 제안한다. 이는 관측된 보상에 기반해 후행적으로 최소한이면서 달성 가능한 목표 집합으로 점차 수렴하는 전략을 제안하며, 투영을 피하고 볼록체 근사화보다 뛰어난 성능을 내기 위해 에피소드 동안 스칼라 위험 최소화를 활용한다.

ABSTRACT

In the standard setting of approachability there are two players and a target set. The players play repeatedly a known vector-valued game where the first player wants to have the average vector-valued payoff converge to the target set which the other player tries to exclude it from this set. We revisit this setting in the spirit of online learning and do not assume that the first player knows the game structure: she receives an arbitrary vector-valued reward vector at every round. She wishes to approach the smallest ("best") possible set given the observed average payoffs in hindsight. This extension of the standard setting has implications even when the original target set is not approachable and when it is not obvious which expansion of it should be approached instead. We show that it is impossible, in general, to approach the best target set in hindsight and propose achievable though ambitious alternative goals. We further propose a concrete strategy to approach these goals. Our method does not require projection onto a target set and amounts to switching between scalar regret minimization algorithms that are performed in episodes. Applications to global cost minimization and to approachability under sample path constraints are considered.

연구 동기 및 목표

  • 게임 구조가 사전에 알려져 있지 않은 비알려진 게임에서 접근 가능성 이론을 수립하는 것.
  • 원래의 목표 집합이 접근 가능하지 않은 경우, 후행적으로 의미 있고 달성 가능한 목표 집합을 정의하는 것.
  • 기존의 접근 가능성과 볼록체 근사화의 한계를 극복하기 위해 더 도전적이지만 실현 가능한 대안 목표를 도입하는 것.
  • 목표 집합에 투영이 필요 없는 실용적인 알고리즘을 설계하여 계산의 가능성을 향상시키는 것.
  • 알려진 게임 역학을 가정하지 않고 글로벌 비용 최소화 및 샘플 경로 제약 문제에 접근 가능성의 적용 범위를 확장하는 것.

제안 방법

  • 이 방법은 보상 함수에 대한 사전 지식이 없는 다중 벡터 보상 밴딧 설정에서 위험 최소화 문제로 문제를 수립한다.
  • 에피소드 동안 스칼라 위험 최소화 알고리즘을 전환하는 전략을 도입하여 관측된 평균 보상에 적응한다.
  • 고정된 집합에 투영하는 대신, 후행적으로 개인의 반응 기반으로 유도된 목표 집합을 직접 최적화함으로써 투영을 피한다.
  • 개인의 반응 기반 함수의 볼록화를 기반으로 하는 새로운 목표 집합 클래스를 정의하며, 이는 달성 가능하다는 게 증명된다.
  • 상대방 행동의 경험 빈도를 사용해 최적의 반응을 추정하고, 관측된 데이터에 기반해 목표 함수를 동적으로 조정한다.
  • 제약 최적화 문제로의 일반화를 위해 제약 집합을 목표 함수 추정의 일부로 간주한다.

실험 결과

연구 질문

  • RQ1게임 구조가 알려져 있지 않고 오직 다중 벡터 보상만 관측되는 경우, 후행적으로 가장 작은 목표 집합으로 접근할 수 있는가?
  • RQ2비알려진 게임에서 최적의 반응 함수의 볼록체보다 더 작은 목표 집합을 달성할 수 있는가?
  • RQ3최적의 후행 목표 집합이 달성 불가능한 경우, 어떤 대안 목표를 달성할 수 있는가?
  • RQ4특히 고차원적이거나 복잡한 설정에서 목표 집합에 투영이 필요 없이 어떻게 접근 가능성을 달성할 수 있는가?
  • RQ5이 프레임워크는 알려진 게임 역학을 가정하지 않고 글로벌 비용 최소화 및 샘플 경로 제약 문제가 있는 문제에 적용 가능한가?

주요 결과

  • 일반적으로 최적의 후행 목표 집합에 접근하는 것은 불가능하며, 이는 가장 바람직한 목표이지만 현실적으로 달성되지 않는다.
  • 최적의 반응 함수의 볼록체는 달성 가능하지만 너무 보수적이며, 적응형 학습의 잠재력을 충분히 반영하지 못한다.
  • 개인의 반응 기반 함수의 볼록화를 기반으로 한 새로운 종류의 달성 가능하고 더 도전적인 목표 집합 클래스를 제안된 전략을 통해 접근할 수 있다.
  • 제안된 알고리즘은 투영을 피함으로써 기존의 접근 가능성 기법보다 계산적으로 더 효율적이다.
  • 기존의 제약 위험 최소화 및 글로벌 비용 최소화 결과를 일반화하며, 비알려진 게임에 대한 통합된 프레임워크를 제공한다.
  • 스칼라 보상 및 제약 조건의 특수 케이스에서는 기존의 알려진 결과를 회복하지만, 이를 초월하지는 않으며 이는 이전 연구와의 일관성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.