[논문 리뷰] Learning What Matters Now: Dynamic Preference Inference under Contextual Shifts
DPI는 변하는 목표 가중치에 대한 확률적 신념을 유지하고 이를 정책 조건화에 사용하여 멀티-목표 강화 학습에서 맥락 변화에 대한 온라인 적응을 가능하게 한다. 동적 큐잉과 미로 과제에서 고정 기반 및 휴리스틱 기준선보다 성능이 우수하다.
Humans often juggle multiple, sometimes conflicting objectives and shift their priorities as circumstances change, rather than following a fixed objective function. In contrast, most computational decision-making and multi-objective RL methods assume static preference weights or a known scalar reward. In this work, we study sequential decision-making problem when these preference weights are unobserved latent variables that drift with context. Specifically, we propose Dynamic Preference Inference (DPI), a cognitively inspired framework in which an agent maintains a probabilistic belief over preference weights, updates this belief from recent interaction, and conditions its policy on inferred preferences. We instantiate DPI as a variational preference inference module trained jointly with a preference-conditioned actor-critic, using vector-valued returns as evidence about latent trade-offs. In queueing, maze, and multi-objective continuous-control environments with event-driven changes in objectives, DPI adapts its inferred preferences to new regimes and achieves higher post-shift performance than fixed-weight and heuristic envelope baselines.
연구 동기 및 목표
- 변하는 상황에서 인간이 선호를 어떻게 적응시키는지 동기를 부여하고 이를 다이나믹한 가치 가중화에 대한 계산 프레임워크로 번역한다.
- 맥락에 따라 변화하는 동적이고 관찰되지 않는 선호 가중치를 맥락과 함께 떠도는 잠재 상태로 형식화한다.
- 히스토리로부터 현재 선호를 추정하는 변분 추론 모듈과 이를 바탕으로 행동하는 선호 조건부 정책을 개발한다.
- 대기열(큐잉) 및 미로 과제와 같은 비정적 환경에서 향상된 적응성과 해석가능성을 입증한다.
제안 방법
- 최근 히스토리로부터 잠재 선호에 대한 분포를 추정하는 가치 평가 모듈을 포함한 두 모듈 에이전트를 도입한다.
- 선호를 z_t라는 잠재 변수로 표현하고 omega_t = softmax(z_t)로 설정하여 선호 공간의 불확실성과 탐색을 모델링한다.
- 샘플링된 K개의 선호 중에서 선택하는 온-policy 엔벨로프 연산자를 가진 선호 조건부 배우-비평가를 학습한다.
- 안정성을 위한 정규화항(KL 사전, 방향 정렬, 자기 일관성)과 보볼리츠만 합리적 가능도를 갖는 ELBO를 통해 최적화한다.
- 벡터 값 보상을 사용하고 벡터 GAE를 통해 차원별 공정 귀속을 계산한 후 정책 업데이트를 위한 스칼라 PPO 목표로 투영한다.
실험 결과
연구 질문
- RQ1온라인 추론으로 동적이고 잠재적인 선호 가중치가 비정상(non-stationary) 다목적 과제에서 성능을 향상시킬 수 있는가?
- RQ2선호를 추론하고 적응하는 에이전트가 맥락 변화하에서 고정 가중치나 수동으로 조정된 기준선보다 더 나은 성능을 보이나?
- RQ3추정된 선호가 해석 가능하고 작업 관련 목표와 일치하는가?
- RQ4제안된 DPI 프레임워크가 다양한 환경에서 안정성을 유지하고 해석 가능한 적응 신호를 제공하는가?
주요 결과
- DPI는 대기열(Queue)과 미로(Maze) 과제에서 평균 에피소드 수익(MER)을 가장 높게 달성하고 맥락 전환 후 회복 속도를 기준선 대비 빠르게 한다.
- 전후 전환 이후 성능은 DPI가 사건 후에 신속히 적응하고 짧은 시점 회복에서 모든 기준선을 능가한다.
- DPI는 성공률에서 현저한 개선을 보여주며 동적 맥락에서 견고한 작업 완수를 입증한다.
- Maze에서 순진한 기준선은 적응에 실패하는 반면 DPI는 추정된 선호와 즉시 보상 구조 사이의 긍정적 정렬을 유지한다.
- KL 정규화, 방향 정렬 또는 자기일관성 제거가 성능 저하를 보이며 각 구성요소의 중요성을 강조한다.
- 해석가능성 분석은 이벤트 이후 DPI의 추정 선호가 작업 요구에 의미적으로 일치함을 보이며(예: 마감기한, 위험, 에너지 부족).
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.