◾Abstract
- 몇 년간 PASCAL VOC 기준으로 객체 탐지 성능이 정체
- 기존 최고 성능 방법들
- 저수준 이미지 특징 (SIFT + HOG 등) + 고수준 문맥 정보
- 복잡한 앙상블 시스템 구조로 성능을 조금 향상시키는 수준이었음
- R-CNN 핵심 아이디어
- Region Proposal + CNN(AlexNet), 객체 탐지에 CNN을 도입하여 Scalable하다는 것을 보여줌
- supervised pre-training + domain-specific fine-tuning으로 데이터 부족 문제 해결
◾Introduction
🔶 R-CNN 등장 배경
- PASCAL VOC 기준, 2010~2012년 동안 객체 탐지 성능이 정체
- 기존 최고 성능 방법
- 저수준 이미지 특징 (SIFT, HOG) + 고수준 문맥 정보 (SPM, DPM) 조합
- 복잡한 앙상블 시스템으로 소폭 성능 향상에 그침
- CNN 활용
- CNN은 계층적이고 풍부한 feature를 학습할 수 있어 더 나은 시각 인식 가능성을 보여줌
- 발전 흐름
- Fukushima의 Neocognitron
- 초기 계층적 신경망 아이디어 제안
- Local feature → Global pattern 인식 구조 확립
- supervised learning을 위한 알고리즘 부재
- LeCun의 CNN
- Neocognitron을 바탕으로 supervised learning을 적용한 첫 CNN
- 작은 문제에만 적용됨
- Krizhevsky의 AlexNet
- ReLU, Dropout, GPU 학습 도입
- 2012 ILSVRC 대회 압도적 우승
- ILSVRC 2012 워크숍 주요 논쟁
- ImageNet 분류 성능이 PASCAL VOC 객체 탐지 성능에 얼마나 일반화될 수 있는가?
🔶 객체 탐지 주요 과제
- Localization
- 객체 탐지는 이미지 분류와 달리 한 이미지 안의 여러 객체를 Localize 해야함
- Sliding window 기반 CNN 접근 방식은 stride가 크고 receptive field가 커서 정밀한 위치 지정이 어려움
- 데이터 부족 문제
- ILSVRC 2013은 객체 탐지용 데이터가 부족
🔶 R-CNN
- 전체 구조
- Region Proposal : Selective Search로 한 이미지당 약 2000개 region proposal 생성
- CNN Feature extraction : 각 proposal을 227x227로 warp하여 CNN 통과
- Classification : CNN feature를 선형 SVM으로 분류
- Bounding Box Regression : region proposal을 더 정확하게 조정
- 핵심 기여
- CNN Feature가 기존 SIFT, HOG 보다 훨씬 우수함을 객체 탐지에도 입증
- supervised pretraining + domin-specific fine-tuning으로 데이터 부족 문제 해결
- Bounding Box Regression으로 localization error를 크게 줄임
- Feature dimension을 크게 줄여 계산 효율성 향상
- 주요 성능 결과
- R-CNN vs OverFeat
- R-CNN : 31.4% mAP(ILSVRC 2013)
- OverFeat : 24.3% mAP
- Sematic segmentation (VOC 2011)
- 기존 O2P 방법보다 높은 정확도 + 학습 시간 대폭 단축
◾Object Detection with R-CNN
🔶 객체 감지 시스템 주요 구성
- Region Proposal 모듈 (Selective Search)
- 역할 : 객체의 존재 여부와 무관하게, region category-independent (객체가 있을 법한 영역) 후보 영역 생성
- 방법 : Selective Search를 사용하여 약 2000개의 후보 영역을 추출
- 이 모듈은 탐지기의 탐색 범위를 정의하는 역할