Skip to main content
QUICK REVIEW

[논문 리뷰] HA-ViD: A Human Assembly Video Dataset for Comprehensive Assembly Knowledge Understanding

Hao Zheng, Regina Lee|arXiv (Cornell University)|2023. 07. 09.
Robot Manipulation and Learning인용 수 6
한 줄 요약

HA-ViD는 일반 장비 상자(GAB)를 사용한 실제 산업 조립 작업의 다중 시점, 다중 모odal 영상으로 구성된 최초의 인간 조립 비디오 데이터셋을 소개한다. 이 데이터셋은 주제, 동작 동사, 제어 대상 물체, 목표 물체, 도구 등에 대한 세분화된 인간-로봇 공유 레이블을 포함하며, 3,222개의 영상, 150만 프레임, 96만 개의 시간 레이블, 200만 개의 공간 레이블을 바탕으로 CC BY-NC 4.0 라이선스 하에 공개되어 있으며, 로봇 공학, 인간-로봇 협업, 품질 보증 분야에서 종합적인 지식 추출 및 기본 영상 이해 작업의 벤치마킹을 가능하게 한다.

ABSTRACT

Understanding comprehensive assembly knowledge from videos is critical for futuristic ultra-intelligent industry. To enable technological breakthrough, we present HA-ViD - the first human assembly video dataset that features representative industrial assembly scenarios, natural procedural knowledge acquisition process, and consistent human-robot shared annotations. Specifically, HA-ViD captures diverse collaboration patterns of real-world assembly, natural human behaviors and learning progression during assembly, and granulate action annotations to subject, action verb, manipulated object, target object, and tool. We provide 3222 multi-view, multi-modality videos (each video contains one assembly task), 1.5M frames, 96K temporal labels and 2M spatial labels. We benchmark four foundational video understanding tasks: action recognition, action segmentation, object detection and multi-object tracking. Importantly, we analyze their performance for comprehending knowledge in assembly progress, process efficiency, task collaboration, skill parameters and human intention. Details of HA-ViD is available at: https://iai-hrc.github.io/ha-vid.

연구 동기 및 목표

  • 절차 지식에 대한 인간과 로봇의 이해를 지원하는 종합적이고 실제 산업 조립 영상 데이터셋의 부족을 해결하기 위해.
  • 복잡한 조립 작업 중 효율성의 다양성, 대체 경로, 정지, 오류 등의 자연스러운 절차적 학습 행동을 캡처하기 위해.
  • 주제, 동작 동사, 제어 대상 물체, 목표 물체, 도구 상호작용을 포괄하는 일관되고 인간-로봇 공유 레이블 프로토콜을 수립하기 위해.
  • 산업 환경에서 행동 인식, 행동 분할, 물체 검출, 다중 물체 추적 등의 기본 영상 이해 작업을 벤치마킹할 수 있도록 하기 위해.
  • 세분화되고 조합적인 레이블을 통해 로봇 스킬 학습, 인간-로봇 협업, 품질 보증 등의 후행 응용을 지원하기 위해.

제안 방법

  • 일반 장비 상자(GAB)를 사용한 3단계 점진적 조립 설정을 통해 데이터를 수집하였으며, GAB는 35개의 부품과 4종의 표준 도구를 포함한 250×250×250mm의 산업 조립 작업이다.
  • 세 가지 플레이트에서 다양한 작업 우선순위와 협업 요구 사항을 가진 3,222개의 별도 조립 작업에 대해 다중 시점, 다중 모달 영상을 기록하였다.
  • 행동을 세분화된 레이블(주제, 동작 동사, 제어 대상 물체, 목표 물체, 도구)로 레이블링하기 위해 계층적 인간-로봇 공유 조립 분류체계(HR-SAT)를 사용하였다.
  • 양손 협업 상태를 명시적으로 레이블링하였으며, 인간의 정지 및 오류도 기록하여 절차적 학습 역학을 캡처하였다.
  • 데이터 전처리 과정으로 개인정보 보호를 위해 얼굴 흐림 처리와 함께, 행동 분할 벤치마킹을 위한 I3D 특징 추출을 수행하였다.
  • 데이터셋은 CC BY-NC 4.0 라이선스 하에 공개되었으며, 향후 업데이트, 오류 보고, 버전 관리를 위한 지원이 제공된다.

실험 결과

연구 질문

  • RQ1기초 영상 이해 모델은 실제 산업 환경에서 복잡한 조립 동작을 인식하고 분할하는 데 얼마나 잘 수행되는가?
  • RQ2행동 인식 및 분할 모델은 조립 중 효율성의 다양성, 대체 경로, 인간의 오류를 포함한 절차적 지식을 어느 정도 정확히 포착할 수 있는가?
  • RQ3다중 물체 추적 및 물체 검출 모델은 복잡하고 동적인 조립 환경에서 모든 관련 부품과 도구를 정확히 국소화하고 추적할 수 있는가?
  • RQ4제안된 인간-로봇 공유 레이블 프로토콜은 로봇 공학 및 산업 응용 분야에서 일관되고 해석 가능하며 재사용 가능한 지식 추출을 얼마나 효과적으로 가능하게 하는가?
  • RQ5세분화되고 조합적인 레이블(주제, 동사, 물체, 도구)은 시각 질문 응답 또는 인간-물체 상호작용 검출과 같은 후행 작업의 성능 향상에 어떤 역할을 하는가?

주요 결과

  • HA-ViD는 3,222개의 다중 시점, 다중 모달 영상, 150만 프레임, 96만 개의 시간 레이블, 200만 개의 공간 레이블을 포함하며, 지금까지 가장 크고 세밀한 인간 조립 비디오 데이터셋이다.
  • 이 데이터셋은 효율성의 다양성, 대체 조립 경로, 정지, 오류 등의 관찰 가능한 행동을 통해 자연스러운 절차적 지식 획득을 캡처하며, 이는 이전 데이터셋에 존재하지 않는 특징이다.
  • 인간-로봇 공유 레이블 프로토콜을 통해 주제, 동작 동사, 제어 대상 물체, 목표 물체, 도구 등의 행동 구성 요소를 세밀하게 레이블링할 수 있으며, 이는 이해 가능하고 조합적인 지식 기반을 제공한다.
  • 행동 인식, 행동 분할, 물체 검출, MOT(Multi-Object Tracking)의 4개 기본 과제에 대한 벤치마킹 결과, 현재 모델들은 더 풍부하고 구조화된 레이블 체계를 통해 향상될 수 있음을 보여주었다.
  • 이 데이터셋은 조합적 행동 인식, 인간-물체 상호작용 검출, 시각 질문 응답 등의 고급 응용을 지원하며, 로봇 학습 및 품질 보증 분야에서의 잠재적 활용 가능성이 있다.
  • 이 데이터셋은 CC BY-NC 4.0 라이선스 하에 공개되었으며, 향후 업데이트, 오류 수정, 버전 관리를 통해 연구 공동체의 장기적 이용 가능성을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.