[논문 리뷰] 3D-POP -- An automated annotation approach to facilitate markerless 2D-3D tracking of freely moving birds with marker-based motion capture
이 논문은 자유롭게 움직이는 새를 대상으로 고해상도 2D 및 3D 관절점(annotation)을 생성하기 위해 마커 기반 운동 캡처를 사용하는 반자동 방법인 3D-POP을 소개한다. 추적된 몸통 마커에 상대적인 형태학적 관절점(예: 부리, 눈)을 추정함으로써, 2D/3D 자세, 신원, 궤적에 대한 참값을 제공하는 대규모 데이터셋(300만 장의 프레임, 400만 개의 인스턴스)을 생성한다. 이는 새에서 정확한 마커 없는 2D-3D 추적 및 자세 추정을 가능하게 한다.
Recent advances in machine learning and computer vision are revolutionizing the field of animal behavior by enabling researchers to track the poses and locations of freely moving animals without any marker attachment. However, large datasets of annotated images of animals for markerless pose tracking, especially high-resolution images taken from multiple angles with accurate 3D annotations, are still scant. Here, we propose a method that uses a motion capture (mo-cap) system to obtain a large amount of annotated data on animal movement and posture (2D and 3D) in a semi-automatic manner. Our method is novel in that it extracts the 3D positions of morphological keypoints (e.g eyes, beak, tail) in reference to the positions of markers attached to the animals. Using this method, we obtained, and offer here, a new dataset - 3D-POP with approximately 300k annotated frames (4 million instances) in the form of videos having groups of one to ten freely moving birds from 4 different camera views in a 3.6m x 4.2m area. 3D-POP is the first dataset of flocking birds with accurate keypoint annotations in 2D and 3D along with bounding box and individual identities and will facilitate the development of solutions for problems of 2D to 3D markerless pose, trajectory tracking, and identification in birds.
연구 동기 및 목표
- 복잡한 사회적 환경에서 자유롭게 움직이는 새를 대상으로 한 대규모, 고해상도, 다중 시점 2D 및 3D annotation 데이터셋의 부족 문제를 해결하기 위해.
- 형태학적 특징를 수동으로 레이블링하지 않고도 정확한 2D 및 3D 관절점 annotation을 생성할 수 있는 확장 가능한 반자동 방법을 개발하기 위해.
- 새에서 마커 없는 2D-3D 자세 추정, 궤적 추적, 개별 식별을 위한 딥러닝 모델의 훈련을 가능하게 하기 위해.
- 접근이 어려운 형태학적 관절점을 보완하기 위해 접근 가능한 몸통 부위에 반사 마커를 부착하여 그들을 대체 지표로 사용함으로써, 어려운 관절점의 레이블링 문제를 해결하기 위해.
- 실제 자연 상태에서의 다수의 새 추적 및 3D 자세 추정 연구를 지원하는 공개 데이터셋(3D-POP)을 구축하기 위해.
제안 방법
- 이 방법은 도마뱀새의 접근 가능한 신체 부위(예: 머리, 배낭)에 부착된 반사 마커를 추적하기 위해 Vicon 운동 캡처 시스템을 사용한다.
- 추적된 마커에 상대적인 형태학적 관절점(예: 눈, 부리, 꼬리 끝)의 3D 좌표를 강체 변환 모델을 통해 추정한다.
- 새의 머리와 몸통이 강체로 행동한다고 가정함으로써, 마커 데이터에서 정확한 3D 관절점 예측이 가능하다.
- 4대의 동기화된 RGB 카메라에서 확보한 영상 데이터를 활용해 3D 관절점의 2D 투영을 생성함으로써 다중 시점 데이터셋을 구성한다.
- 노이즈가 많은 레이블을 식별하고 필터링하기 위해 이상치 탐지 알고리즘을 적용하여 데이터 품질을 향상시킨다.
- 최종적으로 생성된 데이터셋인 3D-POP은 3.6m × 4.2m의 영역에서 최대 10只의 새가 존재하는 상황에서 30만 장의 프레임을 포함하며, 2D/3D 관절점 좌표, 경계 상자, 개인 식별 정보를 제공한다.
실험 결과
연구 질문
- RQ1운동 캡처 시스템을 활용해 형태학적 특징를 수동으로 레이블링하지 않고도 반자동으로 정확한 2D 및 3D 관절점 annotation을 생성할 수 있는가?
- RQ2자유롭게 움직이는 새에서 마커 기반 강체 변환 가정을 사용할 경우 형태학적 관절점의 추정 정확도는 어느 정도인가?
- RQ33D-POP에서 훈련된 딥러닝 모델이 실제 환경의 새 추적 시나리오에서 마커 없는 자세 추정으로 일반화될 수 있는가?
- RQ4이 데이터셋은 복잡하고 자연스러운 무리에서 다수의 새에 대한 2D-3D 추적 및 신원 추적에 어느 정도 기여하는가?
- RQ5마커 기반 대체 레이블링이 마커 없는 자세 추정 모델의 성능에 어떤 영향을 미치는가?
주요 결과
- 자동으로 생성된 3D-POP 관절점가 수동 레이블링과 비교할 때 평균 PCK05는 66%, PCK10은 94%를 기록하여 참값과 강력한 일치를 보였다.
- 관찰된 2.8%의 프레임만이 날개 움직임으로 인해 강체 가정을 위반하여, 대부분의 데이터셋에서 방법의 강건성을 입증했다.
- 3D-POP에서 훈련된 YOLOv5s 및 DeepLabCut 모델이 마커 없는 영상에서 관절점 위치를 성공적으로 예측하여, 마커 없는 추론으로의 일반화 능력을 입증했다.
- 3D-POP 데이터셋은 네 대의 카메라 시점에서 약 30만 장의 프레임(400만 개의 관절점 인스턴스)을 포함하며, 한 번의 시험에서 최대 10명의 개체를 수용한다.
- 이 데이터셋은 신원, 자세, 궤적에 대한 참값을 제공함으로써 다중 시점, 다중 개체의 2D-3D 추적을 지원하며, 마커 없는 추적 시스템의 벤치마킹을 가능하게 한다.
- 이 방법은 최소한의 인간 노동으로 대규모 데이터 정제를 가능하게 하여, 동물 행동의 3D 레이블링에 소요되는 시간과 노력을 크게 감소시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.