[논문 리뷰] Pedestrian crossing decisions can be explained by bounded optimal decision-making under noisy visual perception
이 논문은 소음 있는 시각 인식과 강화 학습을 통합하여 보행자 횡단 행동의 경계 최적 의사결정 모델을 제안한다. 이는 간격 수용과 횡단 시점의 원리를 설명하며, 이전에 인지 편향으로 간주되었던 행동들—예를 들어 속도에 따라 달라지는 간격 수용—이 오히려 인지적 제약 조건에 대한 합리적 적응임을 입증한다. 이는 이전 모델보다도 실제 현상의 재현 능력에서 뛰어나다.
This paper presents a model of pedestrian crossing decisions, based on the theory of computational rationality. It is assumed that crossing decisions are boundedly optimal, with bounds on optimality arising from human cognitive limitations. While previous models of pedestrian behaviour have been either 'black-box' machine learning models or mechanistic models with explicit assumptions about cognitive factors, we combine both approaches. Specifically, we model mechanistically noisy human visual perception and assumed rewards in crossing, but we use reinforcement learning to learn bounded optimal behaviour policy. The model reproduces a larger number of known empirical phenomena than previous models, in particular: (1) the effect of the time to arrival of an approaching vehicle on whether the pedestrian accepts the gap, the effect of the vehicle's speed on both (2) gap acceptance and (3) pedestrian timing of crossing in front of yielding vehicles, and (4) the effect on this crossing timing of the stopping distance of the yielding vehicle. Notably, our findings suggest that behaviours previously framed as 'biases' in decision-making, such as speed-dependent gap acceptance, might instead be a product of rational adaptation to the constraints of visual perception. Our approach also permits fitting the parameters of cognitive constraints and rewards per individual, to better account for individual differences. To conclude, by leveraging both RL and mechanistic modelling, our model offers novel insights about pedestrian behaviour, and may provide a useful foundation for more accurate and scalable pedestrian models.
연구 동기 및 목표
- 인지 제약 조건과 환경 역학을 통합한 계산적으로 합리적인 보행자 횡단 의사결정 모델을 개발하는 것.
- 블랙박스 기계학습 모델과 지나치게 단순한 기계적 모델의 한계를 해결하여 개인 간 변동성과 실제 세계의 복잡성을 잘 반영하는 것.
- 보행자 의사결정에서 전통적으로 '편향'으로 간주되는 행동들이 실제로는 인지적 소음과 제약 조건에 대한 합리적 반응인지 조사하는 것.
- 인지적 모델링과 강화 학습을 조합하여 정책 최적화를 위한 정책 해석 가능성과 확장성 향상.
- 다양한 보행자 행동을 더 잘 표현하기 위해 개인 수준의 모수 피팅을 가능하게 하는 것.
제안 방법
- 모델는 계산적 합리성 원리를 적용하여, 소음 있는 시각 인식과 운동 지연 등의 인지 제약 조건 하에서 보행자가 경계 최적의 결정을 내린다고 가정한다.
- 시각 인식은 시간-충돌 예측(TTA)의 소음 있는 추정치로 모델링되며, 인지 분산(σv)과 가속 감소 경향(c)의 파라미터를 포함한다.
- 강화 학습(RL) 프레임워크는 인지적 추정치와 환경 파라미터에 조건화된 간격 수용 및 횡단 시점에 대한 최적 정책을 학습한다.
- 운동 지연(m)은 정책 외 파라미터로 포함되어 결정과 행동 실행 사이의 시간 지연을 반영한다.
- 다양한 모델 변형을 테스트함: VLM(기준), VLDM(운동 지연 포함), VNM(위험 회피의 다른 공식화), VLM(E)(공통 파라미터), VLM(S)(각 파라미터 조합별 별도 정책).
- 모델 성능 평가에는 인간 행동 데이터 기반 로그우도, AIC, 평균 절대편차(MAD)를 사용하여 일정 속도 및 양보 차량 시나리오에서 평가함.

실험 결과
연구 질문
- RQ1소음 있는 시각 인식 하에서 경계 최적 의사결정으로 보행자 횡단 결정을 설명할 수 있는가?
- RQ2차량 속도와 정지 거리가 보행자 간격 수용과 횡단 시점에 어떤 영향을 미치는가?
- RQ3속도에 따라 달라지는 간격 수용과 같은 행동들이 인지적 소음과 제약 조건에 대한 합리적 적응으로 더 잘 설명되는가?
- RQ4운동 지연과 개인화된 인지 파라미터를 통합할 경우 모델 적합도와 예측 정확도가 어느 정도 향상되는가?
- RQ5통합 모델(VLM)이 개인화된 또는 다른 위험 회피 공식화 모델(VLM(S), VNM)과 비교해 실제 보행자 행동을 얼마나 잘 재현하는가?
주요 결과
- VLM 모델는 적합도와 복잡성의 최적 균형을 달성하여 로그우도 -536, AIC 1192, MAD 0.35초를 기록하며 모든 다른 변형보다 뛰어난 성능을 보였다.
- 운동 지연(VLDM)을 포함시킨 결과 VLM보다 성능 향상이 없었고, 복잡도만 증가하여 유사한 로그우도와 MAD에도 불구하고 더 높은 AIC를 기록했다.
- VLM(E) 모델는 모든 참가자에게 동일한 비정책 파라미터를 사용했지만, VLM보다 더 낮은 AIC(1098)를 기록했으나 로그우도는 열 劣하여 개인화된 파라미터가 모델 적합도를 향상시킨다는 것을 시사한다.
- VLM(S) 모델는 각 파라미터 조합에 대해 별도의 RL 정책을 학습했지만, 원래 VLM보다 성능 향상이 없었으며, 파라미터 조건화 정책 학습이 더 효율적임을 보여주었다.
- VNM 모델는 거리 기반 위험 회피를 사용했으나, MAD(0.99)가 높고 AIC도 열 劣하여, 시간-공간적 신호인 '가속 감소'가 순수한 공간적 거리보다 더 중요하다는 것을 시사한다.
- 모델는 네 가지 주요 경험적 현상을 성공적으로 재현하였다: (1) TTA에 따른 간격 수용 의존성, (2) 속도에 따라 달라지는 간격 수용, (3) 양보 시나리오에서의 횡단 시점, (4) 차량 정지 거리가 횡단 시점에 미치는 영향.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.