[논문 리뷰] Teaching Social Behavior through Human Reinforcement for Ad hoc Teamwork -The STAR Framework
STAR 프레임워크는 효과성과 사회적 수용성에 대한 전용 피드백 채널을 사용하여 병렬 강화학습을 통해 임시 팀 구성원인 에이전트들이 인간의 사회적 규범을 준수하도록 가르친다. 결과적으로 이중 피드백을 통한 학습을 통해 에이전트들은 높은 성과와 사회적으로 타당한 행동을 균형 있게 이룹니다. 이는 혼합형 또는 단일 피드백 접근 방식보다 뛰어난 성능을 보입니다.
As AI technology continues to develop, more and more agents will become capable of long term autonomy alongside people. Thus, a recent line of research has studied the problem of teaching autonomous agents the concept of ethics and human social norms. Most existing work considers the case of an individual agent attempting to learn a predefined set of rules. In reality, however, social norms are not always pre-defined and are very difficult to represent algorithmically. Moreover, the basic idea behind the social norms concept is ensuring that one's actions do not negatively influence others' utilities, which is inherently a multiagent concept. Thus, here we investigate a way to teach agents, as a team, how to act according to human social norms. In this research, we introduce the STAR framework used to teach an ad hoc team of agents to act in accordance with human social norms. Using a hybrid team (agents and people), when taking an action considered to be socially unacceptable, the agents receive negative feedback from the human teammate(s) who has(have) an awareness of the team's norms. We view STAR as an important step towards teaching agents to act more consistently with respect to human morality.
연구 동기 및 목표
- 다중 에이전트 및 인간이 개입하는 환경에서 자율 에이전트에게 사회적 규범을 가르치는 데에 미치는 격차를 해소하기 위해.
- 기존 방법들이 단일 에이전트, 사전 정의된 규범, 또는 목표와 제약 조건의 형식을 혼합하는 데에 국한되는 한계를 극복하기 위해.
- 팀 협업 중 실시간 인간 피드백을 통해 문화적·시간적 맥락에 맞는 사회적 규범을 학습할 수 있도록 하기 위해.
- 장기적인 자율성을 유지하면서도 하이브리드 인간-에이전트 팀 내에서 사회적으로 책임감 있는 행동을 보장할 수 있는 프레임워크를 개발하기 위해.
- 효과성과 사회적 규범에 대한 병렬 피드백 채널이 혼합형 또는 단일 채널 피드백보다 더 나은 학습을 이끌어내는지 검증하기 위해.
제안 방법
- 작업의 효과성과 사회적 수용성에 대한 두 개의 병렬 피드백 채널을 사용하는 STAR(강화학습을 통한 사회적 에이전트 훈련) 프레임워크를 도입한다.
- 에이전트가 사회적으로 수용 불가능하다고 간주되는 행동을 수행했을 때, 효과성과는 무관하게 인간 팀원이 실시간으로 전용 피드백을 제공한다.
- 강화학습을 활용하여 에이전트가 작업 성과와 사회적 규범 준수를 동시에 최적화하도록 훈련시킨다.
- 실제 세계의 임시 팀워크 시나리오를 시뮬레이션하기 위해 인간과 에이전트 팀원이 혼합된 환경을 설계한다.
- 사회적 규범과 작업 효과성을 분리하여 피드백 채널을 분리함으로써 학습 과정에서의 간섭을 방지한다.
- 다양한 피드백 설계 방식을 평가한다: 효과성 전용, 사회적 수용성 전용, 혼합형, 그리고 제안된 병렬 STAR 프레임워크.
실험 결과
연구 질문
- RQ1사전에 사회적 규범이 정의되지 않은 상태에서 인간의 피드백을 통해 임시 팀 내의 에이전트가 사회적으로 수용 가능한 행동을 학습할 수 있는가?
- RQ2효과성과 사회적 규범에 대한 피드백을 분리한 방식이 혼합형 피드백과 비교해 학습 성능에 어떤 영향을 미치는가?
- RQ3STAR에서의 병렬 피드백 설계는 높은 성과를 달성하면서도 사회적으로 수용 불가능한 행동을 최소화하는 데에 기여하는가?
- RQ4이 프레임워크를 사용하여 다양한 문화적 또는 시간적 맥락에서 사회적 규범을 일반화할 수 있는가?
- RQ5다중 에이전트 시스템에서 효과성과 사회적 수용성을 동시에 가르치는 데 최적의 피드백 구조는 무엇인가?
주요 결과
- 병렬 STAR 피드백 설계는 효과성과 사회적 수용성 양 측면에서 이론적 상한선에 가장 가까운 성능을 달성했다.
- 사회적 수용성 피드백만을 받은 에이전트는 허용 가능한 행동 비율이 가장 높았지만, 게임에서 클리어한 행의 수가 가장 적어 성과가 열악했다.
- 효과성 전용 피드백은 클리어한 행의 수가 가장 많았지만, 동시에 사회적으로 수용 불가능한 행동의 수가 가장 많았다.
- 혼합형 피드백 설계는 효과성은 높았음에도 불구하고 사회적 수용성 성능 곡선이 낮게 유지되어 사회적 규범을 효과적으로 학습하지 못했다.
- STAR 프레임워크는 효과성과 사회적 수용성을 동시에 학습시켜 높은 성과와 사회적 수용성 간의 균형을 이룩했다.
- 세 번째 게임 이후, STAR 프레임워크의 성능 곡선은 상한선을 거의 정확히 따라가며, 효과성과 사회적 규범의 공동 학습이 효과적으로 이루어졌음을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.