[논문 리뷰] Playing Text-Based Games with Common Sense
이 논문은 부분 관측 가능하고 실제 세계와 유사한 환경에서의 내성적 강건성을 향상시키기 위해 텍스트 기반 게임 에이전트에 일반 지식을 통합하는 방법을 제안한다. COMET 또는 BERT를 통해 누락된 세계 상태 요소를 추론하고 이를 지식 그래프에 통합함으로써, 특히 관측이 불완전하거나 노이즈가 있는 상황에서 도전적인 '일상의 한 순간(9:05)' 게임에서 에이전트의 성능이 크게 향상된다.
Text based games are simulations in which an agent interacts with the world purely through natural language. They typically consist of a number of puzzles interspersed with interactions with common everyday objects and locations. Deep reinforcement learning agents can learn to solve these puzzles. However, the everyday interactions with the environment, while trivial for human players, present as additional puzzles to agents. We explore two techniques for incorporating commonsense knowledge into agents. Inferring possibly hidden aspects of the world state with either a commonsense inference model COMET, or a language model BERT. Biasing an agents exploration according to common patterns recognized by a language model. We test our technique in the 9to05 game, which is an extreme version of a text based game that requires numerous interactions with common, everyday objects in common, everyday scenarios. We conclude that agents that augment their beliefs about the world state with commonsense inferences are more robust to observational errors and omissions of common elements from text descriptions.
연구 동기 및 목표
- 텍스트 기반 게임에서 관측이 부분적으로만 이루어지는 문제, 즉 에이전트가 완전하거나 노이즈가 있는 기술로 인해 핵심 물체를 놓칠 수 있는 상황을 해결하기 위해.
- 일상적인 실생활 상황이 흔한 '일상의 한 순간' 게임에서 일반 지식이 에이전트 성능 향상에 기여할 수 있는지 조사하기 위해.
- 언어 모델 패턴을 통한 탐색 편향보다, 추론된 실체(예: COMET 또는 BERT를 통해)를 세계 상태 믿음에 통합하는 것이 더 효과적인지 평가하기 위해.
- 특히 9:05 게임에서 관측 실패 상황에 대한 에이전트의 강건성을 시험하기 위해, 이는 평범한 실제 세계의 루틴을 시뮬레이션한다.
제안 방법
- 자연어에서 유의미한 세계 상태 관계(예: HasA)를 생성하는 신경망 모델인 COMET을 사용해 지식 그래프에 일반 지식 추론을 통합함으로써 KG-A2C 에이전트 프레임워크를 보완한다.
- BERT의 다음 문장 예측 기능을 활용해 자연어에서 흔한 행동 시퀀스를 식별함으로써 행동 탐색을 유도하고, 언어 모델 패tern을 통한 탐색 편향을 제공한다.
- BERT 기반의 질문-답변 접근법인 Q*BERT를 적용하여 단순한 HasA 관계를 넘어서 다양한 일반 지식적 속성과 관계를 추론함으로써 암시적인 세계 상태 요소의 커버리지 확보를 향상시킨다.
- 실제 세계의 누락을 시뮬레이션하기 위해 물체 참조가 누락된 수정된 관측 조건을 포함한 두 가지 조건(완전한 관측 및 수정된 관측)에서 9:05 게임에서 에이전트를 훈련하고 평가한다.
- 세 가지 변형(기본 KG-A2C, KG-A2C-BERT(탐색 편향), COMET-A2C/Q*BERT(지식 그래프 보강)) 간 성능을 비교한다.
- 복잡한 다단계 작업에서 진전과 수렴 속도를 측정하기 위해 희소 밀도 보상 설계(욕실에 들어가면 2점, 샤워하면 6점)를 사용한다.
실험 결과
연구 질문
- RQ1관측이 불완전할 경우에도 실제 일상적인 상황을 반영한 텍스트 기반 게임에서 일반 지식이 에이전트 성능 향상에 기여할 수 있는가?
- RQ2언어 모델 패턴을 통한 탐색 편향보다 추론된 실체를 세계 상태 믿음에 통합하는 것이 더 효과적인가?
- RQ3다른 일반 지식 소스(COMET 대비 BERT 대비 Q*BERT)는 관측 실패에 대한 강건성 향상에 어떻게 비교되는가?
- RQ4단순한 HasA 관계를 넘어서 다양한 일반 지식 추론을 사용할 경우, 실제 세계와 유사한 환경에서 더 빠른 수렴과 더 나은 작업 완료 성능을 달성할 수 있는가?
주요 결과
- 물체 참조가 방 설명에서 누락된 상황에서 COMET-A2C와 Q*BERT는 KG-A2C와 KG-A2C-BERT보다 유의미하게 뛰어난 성능을 보이며, 욕실에서 전체 작업 완료를 달성한다.
- 키 샤워기, 화장실, 샤워기 등의 핵심 물체가 생략된 경우 KG-A2C는 보상 2점(욕실에 들어감)을 넘어서지 못해 관측 갭에 취약함을 보여준다.
- 물체가 누락된 조건에서 KG-A2C-BERT는 기본 KG-A2C와 성능이 동일하여, 탐색 편향만으로는 누락된 세계 상태 지식을 보완할 수 없음을 시사한다.
- 물체가 누락된 조건에서 Q*BERT는 COMET-A2C보다 더 빠르게 수렴함을 확인하여, 질문-답변 기반의 다양한 일반 지식 추론이 더 효과적인 세계 상태 모델링을 가능하게 함을 시사한다.
- 지식 그래프에 일반 지식 추론을 통합하는 것이 탐색 편향보다 더 강건하고 신뢰할 수 있는 성능 향상 결과를 이끌어내며, 특히 실제 세계와 유사한 관측 노이즈 상황에서 유의미하다.
- 결과는 일반 지식이 실제 세계와 유사한 환경에서 세부 사항이 자주 생략되거나 암시적으로 표현되는 상황에서 에이전트가 이를 처리하기 위해 필수적임을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.