Skip to main content
QUICK REVIEW

[논문 리뷰] An Active Information Seeking Model for Goal-oriented Vision-and-Language Tasks.

Ehsan Abbasnejad, Qi Wu|arXiv (Cornell University)|2018. 12. 16.
Multimodal Machine Learning Applications참고 문헌 39인용 수 8
한 줄 요약

이 논문은 시각-언어 작업에서 불확실한 지식에 대한 내부 신뢰도 분포를 유지함으로써 능동적으로 정보를 탐색하는 강화학습 모델을 제안한다. 이 분포에서 샘플링한 동작을 선택하고 정보 수확량을 최대화하는 방식으로, 모델은 시각 대화 및 시각 질의 생성에서 기준 모델보다 불확실성을 더 효과적으로 줄여 성능을 높인다.

ABSTRACT

As Computer Vision algorithms move from passive analysis of pixels to active reasoning over semantics, the breadth of information algorithms need to reason over has expanded significantly. One of the key challenges in this vein is the ability to identify the information required to make a decision, and select an action that will recover this information. We propose an reinforcement-learning approach that maintains an distribution over its internal information, thus explicitly representing the ambiguity in what it knows, and needs to know, towards achieving its goal. Potential actions are then generated according to particles sampled from this distribution. For each potential action a distribution of the expected answers is calculated, and the value of the information gained is obtained, as compared to the existing internal information. We demonstrate this approach applied to two vision-language problems that have attracted significant recent interest, visual dialogue and visual query generation. In both cases the method actively selects actions that will best reduce its internal uncertainty, and outperforms its competitors in achieving the goal of the challenge.

연구 동기 및 목표

  • 목표 지향적 시각-언어 작업에서 관련 정보를 식별하고 획득하는 데 도전 과제를 해결하기 위해.
  • 정보 상태에 대한 신뢰도 분포를 사용하여 에이전트의 내부 지식에 대한 불확실성을 명시적으로 모델링하기 위해.
  • 기대 정보 수확량을 최대화하는 동작을 선택하여 능동적 의사결정을 가능하게 하기 위해.
  • 정보 탐색에 기반한 의사결정을 통해 시각 대화 및 질의 생성과 같은 시각-언어 작업의 성능을 향상시키기 위해.
  • 불확실성 인식 기반의 동작 선택이 수동적 또는 히우리스틱 기반 접근 방식보다 더 나은 목표 달성을 이끌 수 있음을 입증하기 위해.

제안 방법

  • 불확실성에 대한 지식과 필요 정보를 표현하기 위해 내부 정보 상태에 대한 신뢰도 분포를 유지한다.
  • 이 신뢰도 분포에서 샘플링한 입자 기반으로 동작를 생성함으로써 잠재적 정보 수집 행동의 탐색을 가능하게 한다.
  • 후보 동작 각각에 대해 기대 답변의 분포를 예측하여 기대 정보 수확량을 추정한다.
  • 기대 답변 분포를 현재 신뢰도와 비교하여 정보 수확량을 계산하며, 불확실성을 가장 크게 줄이는 동작을 선호한다.
  • 시각-언어 작업에서 장기적 목표 달성을 기반으로 동작 선택을 최적화하기 위해 강화학습을 사용한다.
  • 이 프레임워크는 시각 대화 및 시각 질의 생성이라는 두 가지 작업에 적용되며, 여기서 동작는 질문 선택 또는 질의 구성에 해당한다.

실험 결과

연구 질문

  • RQ1에이전트는 어떻게 시각-언어 작업에서 가장 정보적인 정보를 능동적으로 식별하고 탐색할 수 있는가?
  • RQ2내부 지식에 대한 신뢰도 분포를 유지함으로써 불확실한 환경에서의 의사결정에 어떤 정도 향상이 이루어지는가?
  • RQ3정보 수확량 기반의 동작 선택은 시각 대화 및 질의 생성에서 비능동적 또는 히우리스틱 기반 전략보다 뛰어난가?
  • RQ4불확실성 인식 기반의 동작 선택은 모델의 목표 달성 능력에 어떤 영향을 미치는가?

주요 결과

  • 제안된 모델은 기준 모델보다 내부 불확실성을 더 효과적으로 줄이는 동작을 능동적으로 선택한다.
  • 시각 대화 작업에서 기대 정보 수확량을 최대화하는 질문을 선택함으로써 뛰어난 성능을 달성한다.
  • 시각 질의 생성에서, 모델은 이미지의 고불확실성 영역에 집중함으로써 더 정확하고 관련성이 높은 질의를 생성한다.
  • 신뢰도 기반 동작 샘플링을 통한 강화학습 프레임워크는 빠른 수렴과 더 나은 목표 달성을 이끈다.
  • 시각 대화 및 시각 질의 생성 벤치마크에서 경쟁 기준 모델을 모두 능가하는 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.