[논문 리뷰] Learning to Influence Human Behavior with Offline Reinforcement Learning
이 논문은 오프라인 강화학습(Reinforcement Learning, RL)을 사용하여, 영향 전략의 명시적 예시가 없더라도 협업 작업에서 열등한 인간 행동을 유도하는 AI 에이전트를 훈련시키는 것을 제안한다. 다양한 인간-인간 상호작용 데이터에서 학습하고 인간의 잠재 전략을 모델링함으로써, 에이전트는 블록된 행동으로 목표 선택을 유도하는 것과 같은 새로운 영향 전략을 유추하고 적용할 수 있다. 이로 인해 인간의 성능이 측정 가능한 수준으로 향상되며, 인간의 전략이 시간이 지남에 따라 변화하더라도 지속적으로 개선된다.
When interacting with people, AI agents do not just influence the state of the world -- they also influence the actions people take in response to the agent, and even their underlying intentions and strategies. Accounting for and leveraging this influence has mostly been studied in settings where it is sufficient to assume that human behavior is near-optimal: competitive games, or general-sum settings like autonomous driving alongside human drivers. Instead, we focus on influence in settings where there is a need to capture human suboptimality. For instance, imagine a collaborative task in which, due either to cognitive biases or lack of information, people do not perform very well -- how could an agent influence them towards more optimal behavior? Assuming near-optimal human behavior will not work here, and so the agent needs to learn from real human data. But experimenting online with humans is potentially unsafe, and creating a high-fidelity simulator of the environment is often impractical. Hence, we focus on learning from an offline dataset of human-human interactions. Our observation is that offline reinforcement learning (RL) can learn to effectively influence suboptimal humans by extending and combining elements of observed human-human behavior. We demonstrate that offline RL can solve two challenges with effective influence. First, we show that by learning from a dataset of suboptimal human-human interaction on a variety of tasks -- none of which contains examples of successful influence -- an agent can learn influence strategies to steer humans towards better performance even on new tasks. Second, we show that by also modeling and conditioning on human behavior, offline RL can learn to affect not just the human's actions but also their underlying strategy, and adapt to changes in their strategy.
연구 동기 및 목표
- 인지 편향이나 정보 부족으로 인해 열등한 인간 행동을 유도하는 현실 세계의 인간 행동을 영향을 주는 데 도전 과제를 해결하기 위해.
- 영향 전략이 명시적으로 제공되지 않은 경우에도 오프라인 데이터셋의 인간-인간 상호작용에서 효과적인 영향 전략을 학습할 수 있도록 AI 에이전트를 가능하게 하기 위해.
- 인간의 잠재 전략 변화를 모델링하고 적응함으로써, 단순한 행동 수정을 넘어서 장기적인 영향력을 제공하기 위해.
- 오프라인 RL이 사전에 성공적인 영향 예시가 없는 새로운 작업에 영향 전략을 일반화할 수 있음을 보여주기 위해.
- 실제 인간-로봇 협업에서의 영향 효과를 평가하여 인간 행동의 측정 가능한 적응을 보여주기 위해.
제안 방법
- 이 방법은 인간-인간 상호작용의 다양한 데이터셋을 기반으로 오프라인 강화학습을 수행하여, 온라인 인간 상호작용이나 환경 시뮬레이터가 필요 없이 영향 정책을 학습한다.
- 이 방법은 인간 파트너의 잠재적 행동 전략을 추정하고 조건화하는 잠재 전략 모델링 구성 요소를 오프라인 RL에 통합한다.
- 에이전트는 관찰된 행동으로부터 인간 전략을 유추하고, 이를 바탕으로 영향 전략을 적응적으로 조정한다. 예를 들어, 목표 선택을 유도하기 위해 특정 물체에 대한 접근을 차단하는 식이다.
- 이 방법은 관찰된 인간 행동의 구성 요소(예: 접시를 떨어뜨리는 것 또는 가까이 있는 접시를 집는 것)를 조합하여, 데이터에 직접적으로 제공되지 않은 효과적인 영향 전략을 유추한다.
- 메모리 증강 오프라인 RL 아키텍처와 잠재 전략 추론 헤드를 활용하여 일반화 능력과 적응 능력을 향상시킨다.
- 이 방법은 오프라인 환경에서 에이전트가 인간의 더 효율적인 작업 협업을 유도하도록 훈련하는 오버쿡드 환경을 사용하여 평가된다.

실험 결과
연구 질문
- RQ1영향 전략이 훈련 데이터에 존재하지 않는 경우에도 오프라인 RL이 열등한 인간 행동에 효과적인 영향 전략을 학습할 수 있는가?
- RQ2오프라인 RL 에이전트는 인간 파트너의 잠재적 행동 전략 변화에 대응하여 영향 전략을 적응적으로 조정할 수 있는가?
- RQ3인간의 잠재 전략을 모델링하면 표준 오프라인 RL이나 행동 클로닝보다 인간 행동 영향력 향상에 더 효과적인가?
- RQ4에이전트의 영향력이 인간 행동의 측정 가능한 장기적 변화(예: 전략 전환)를 유도할 수 있는가, 아니면 단순한 순간적 행동 변화에 그치는가?
- RQ5에이전트의 성공은 인간을 영향을 주기 때문인가, 아니면 임의의 작업 성능 때문인가?
주요 결과
- 제안된 잠재 오프라인 RL 방법은 표준 오프라인 RL과 행동 클로닝보다 인간 행동 영향력에서 뚜렷한 승리를 거두었으며, 인간-로봇 협업에서 더 높은 평균 보상 수준을 기록했다.
- 메모리 증강 오프라인 RL과 잠재 오프라인 RL 모두 단순 행동 클로닝보다 뛰어난 성능을 보였으며, 동일한 정보 입력에도 불구하고 잠재 오프라인 RL이 메모리 오프라인 RL보다 뚜렷한 향상을 보였다.
- 에이전트는 인간의 전략을 변화시켰다: 블록이 제거된 후에도 인간은 블록된 재료를 피하기 위해 행동을 변경했으며, 이는 장기적 영향을 의미한다.
- 상호작용의 마지막 100개 타임스텝 동안 인간 파트너의 성능은 첫 100개 타임스텝 대비 뚜렷한 향상을 보였으며, 이는 인간이 에이전트의 영향에 적응했다는 것을 보여준다.
- 인간을 영향을 줄 수 없는 스크립트 정책과 조합된 경우, 모든 에이전트가 유사한 성능을 보였으며, 이는 에이전트의 성공이 인간 영향 때문이지 고립된 작업 성능 때문임을 배제한다.
- 정성적 분석 결과, 에이전트는 블록된 양파에 접근하는 인간의 행동을 유추한 후 더 이상 양파를 차단하지 않는 등 적응 전략을 학습한 것으로 나타났다. 이는 전략적 인지 능력을 보여준다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.