완전·장기 가림 대응 추적은 YOLOv11n·칼만 필터·OAMN 재식별을 결합한다
Tracking the Unseen: An Occlusion-Robust Framework for Target Tracking Under Full and Long-Term Occlusion
무엇인가
이 논문이 다루는 문제는 다중 객체 추적(MOT) 시스템이 완전 가림(full occlusion)과 장기 가림(long-term occlusion) 앞에서 무너진다는 점이다. 표적이 건물, 차량, 지형 뒤로 완전히 숨거나 여러 프레임에 걸쳐 계속 보이지 않으면, 기존 추적기는 이를 장면 이탈로 간주하고 궤적을 조기에 종료한다. 그 결과 정체성 상실과 상황 인식 저하가 발생하며, 저자들은 이를 국방·감시 응용의 실제 실패 요인으로 지목한다. YOLO 계열 검출기와 DeepSORT 같은 연관 기법은 연속적인 시각 관측에 의존하기 때문에, 사람이 보이지 않아도 표적이 계속 존재하고 움직인다고 추론하는 능력이 없다는 것이 핵심 진단이다. 논문이 요구하는 능력은 두 가지로 정리된다. 하나는 가려진 표적의 위치를 정확히 예측하는 것, 다른 하나는 표적이 다시 나타났을 때 동일한 정체성과 궤적으로 재결합하는 것이다.
어떻게 동작하나
제안 프레임워크는 세 단계로 구성된다. 첫째는 YOLOv11n을 이용한 객체 검출, 둘째는 가림 구간의 위치 추정으로 칼만 필터가 검출이 없는 프레임에서도 표적의 위치·크기·속도 상태를 예측해 궤적을 잇는다. 셋째는 표적 재등장 이후의 정체성 복구로, 가림에 강인한 외형 기반 재식별(Re-ID)을 수행한다. 저자들은 동일한 추적 파이프라인 안에서 여섯 개의 Re-ID 아키텍처를 같은 조건으로 비교했고, 그중 OAMN(Occlusion-Aware Mask Network)이 종합 성능이 가장 좋아 최종 파이프라인에 채택되었다. OAMN은 두 갈래 구조로, 공간 마스크 예측기가 가시 영역을 먼저 분리한 뒤 전체 이미지 특징과 융합해 가려진 배경이 외형 기술자를 오염시키지 않도록 한다. 비교 대상에는 수평 특징 스트라이프를 가시성으로 가중하는 OccludedReID, 신체 부위 단위로 같은 원리를 적용하는 PGFA, 부위 노드 간 관계를 그래프 합성곱으로 모델링하는 HOReID, 학습 가능한 부위 토큰과 패치 단위 어텐션을 쓰는 PAT와 TransReID가 포함되었다. 연관 단계에서는 IoU 비용과 외형 비용을 각각 0.40과 0.60의 가중치로 결합했고, 장기 가림 임계값은 30프레임, 최대 트랙 수명은 150프레임으로 설정했다.
무엇과 다른가
구성 요소 선택은 별도의 예비 실험으로 뒷받침된다. 검출기는 OVIS의 동일한 50개 영상(총 3,234프레임)에서 YOLOv8n, YOLOv9t, YOLOv10n, YOLOv11n을 비교했는데, YOLOv11n이 프레임당 평균 검출 수 3.12개로 가장 높으면서 15.41 FPS의 실시간 속도를 유지했다. 가장 빠른 것은 YOLOv8n(15.80 FPS)이었고 YOLOv9t는 7.97 FPS, YOLOv10n은 13.84 FPS였다. 부분적으로 가려진 개 세 마리가 나오는 프레임에서 YOLOv8n·YOLOv9t·YOLOv10n은 한 마리만 검출한 반면 YOLOv11n은 처음 두 마리를, 이어 세 마리 모두를 검출했다. 운동 예측기는 표준 칼만 필터, 적응형 프로세스 노이즈를 쓰는 Enhanced Kalman Filter, 300개 입자의 Particle Filter, 200개 학습 영상의 궤적 시퀀스로 15에폭 학습한 LSTM과 Transformer를 비교했다. 학습 기반 예측기가 MOTA는 가장 높았지만 이는 정답 궤적으로 직접 학습한 영향이 컸고 IDF1과 ADE는 뚜렷하게 나빴다. 표준 칼만 필터가 IDF1 0.83, ADE 0.24(263.48px), 정체성 스위치 39개로 가장 안정적이고 기하학적으로 정확한 트랙을 유지해 최종 선택되었다.
어떻게 쓰나
공개 데이터셋 OVIS에서의 벤치마크 결과는 다음과 같다. 제안 파이프라인은 MOTA 0.477로 OccluTrack의 0.404를 상대적으로 18.1% 앞섰고, IDF1은 0.773 대 0.618로 25.1% 상대 향상을 보였다. 정체성 스위치는 34개로 OccluTrack의 39개보다 약 12.8% 적었다. 위치 정확도는 양쪽이 비슷했는데 ADE는 0.249 대 0.248, Raw ADE는 429.49px 대 422.63px였다. 저자들은 Raw ADE가 미세하게 높은 이유를 제안 파이프라인이 가림 구간에서도 추적을 계속하는 반면 OccluTrack은 궤적을 종료하기 때문이라고 설명한다. 즉 더 넓은 추적 커버리지의 부산물이지 위치 추정 자체의 열화가 아니라는 해석이다. OVIS는 901개 영상, 25개 객체 범주, 약 5,223개 어노테이션 인스턴스로 구성되며 5프레임마다 라벨이 제공되고 프레임당 4~5개 객체가 등장한다. 다만 검증·테스트 분할의 어노테이션 파일이 null 항목만 담고 있어, 이 연구는 완전 라벨이 있는 학습 분할 607개 영상만 사용했다.
전제와 한계
군사 도메인 사례 연구는 자체 제작한 데이터셋에서 수행되었다. 공개된 심한 가림 조건의 군사 영상 데이터셋이 없어 Vidu와 Sora 같은 AI 플랫폼으로 합성 시퀀스를 만들고, 웹과 영화 장면에서 수집한 실제 클립을 섞어 병사 클래스 전용 하이브리드 데이터셋을 구축했다. 12개 평가 영상에서 YOLOv11n은 15에폭 미세조정으로 mAP@50 71.1%에 도달했고 OAMN은 조기 종료로 5에폭에서 수렴했다. 결과는 MOTA 0.7340 대 0.6429로 9.11%포인트(상대 14.17%) 향상, IDF1 0.7286 대 0.6887로 5.79% 향상, 정체성 스위치 256개 대 263개로 2.66% 감소였다. ADE는 0.0877(129.37px) 대 0.0872(128.30px)로 거의 동일했는데, 두 시스템이 같은 칼만 필터 설정을 공유하기 때문에 위치 정확도는 외형 모델 선택보다 운동 필터가 지배한다는 점을 보여준다. 저자들은 OAMN의 가림 인식 마스킹이 병사가 재등장할 때 더 안정적인 외형 임베딩을 만들어 잘못된 정체성 인계를 줄인다고 해석한다.
실무 관점에서 이 논문의 쓸모는 파이프라인 조립 순서와 검증 방식에 있다. 검출·운동 예측·재식별을 각각 독립적으로 비교한 뒤 통합하는 절차를 따르고 있어, 비슷한 추적 시스템을 만드는 개발자는 어떤 모듈을 어떤 지표로 골라야 하는지 참고할 수 있다. 특히 MOTA만 보면 학습 기반 운동 예측기가 좋아 보이지만 IDF1과 ADE에서는 칼만 필터가 낫다는 예비 실험 결과는, 단일 지표로 모듈을 선택할 때의 함정을 잘 보여준다. 또한 가림 구간에서도 추적을 유지하면 Raw ADE가 다소 나빠질 수 있다는 해석은, 커버리지와 정밀도 사이의 트레이드오프를 지표로 어떻게 방어할지에 대한 실무적 힌트가 된다. 코드는 공개 GitHub 저장소에, OVIS 데이터셋은 공개 배포 페이지에 있다.
저자들이 명시한 한계와 전제는 세 가지다. 첫째, 외형이 비슷한 표적이 많은 혼잡 장면에서는 재식별 신뢰도가 낮아지므로 향후 개선이 필요하다고 밝힌다. 둘째, 시스템은 지금까지 정적 카메라에서만 검증되었으며 이동 카메라 보정은 향후 과제로 남겨두었다. 셋째, 칼만 필터의 등속 가정이 표적의 급격하거나 비선형적인 운동에서 깨지기 때문에 운동 예측 개선이 필요하다고 인정한다. 여기에 더해 군사 데이터셋이 실제 운용 영상이 아니라 AI 생성 시퀀스와 웹·영화 클립을 섞어 만든 합성 중심 자료라는 점, 그리고 OVIS 실험도 완전 라벨이 있는 학습 분할에만 의존했다는 점은 결과 해석 시 함께 고려해야 할 전제다.