"YOLO 와 비슷한 모델" 을 찾을 때 기준이 되는 축은 셋이다.
YOLO 는 1단계 CNN 계열의 대표이고, 초기에는 앵커를 썼지만 최근 판들은 앵커 프리로 옮겨 갔다.
YOLO 와 성격이 가장 가깝다. 실시간 처리가 목표다.
| 모델 | 특징 |
|---|---|
| SSD (Single Shot MultiBox Detector) | 초기 YOLO 와 동시대. 여러 스케일의 특징 맵에서 앵커 기반으로 예측한다. 단순하고 빠르지만 작은 객체에 약하다 |
| RetinaNet | Focal Loss 로 배경이 압도적으로 많은 클래스 불균형을 다룬다. 1단계이면서 2단계에 가까운 정확도를 냈다 |
| EfficientDet | EfficientNet 백본에 BiFPN 을 얹어 정확도 대비 연산량을 낮췄다. 계산 예산이 빠듯한 배포 환경에서 후보가 된다 |
| FCOS | 앵커 프리. 픽셀마다 객체 경계까지의 거리를 직접 예측한다. 하이퍼파라미터가 적어 튜닝이 쉽다 |
| YOLOX | YOLO 를 앵커 프리로 바꾸고 SimOTA 라벨 할당을 도입했다 |
Faster R-CNN 계열이다. 영역 제안 네트워크(RPN) 로 후보를 뽑은 뒤 각 후보를 분류·회귀한다. 정확도가 높고 특히 작은 객체에 강하지만 느리다. 실시간이 아니어도 되는 검사·판독 업무에서는 여전히 쓸모가 있다. Mask R-CNN 은 여기에 분할(segmentation) 을 얹은 것이다.
| 모델 | 특징 |
|---|---|
| DETR | 앵커와 NMS 를 모두 없앤 end-to-end 구조. 집합 예측으로 문제를 다시 정의했다. 수렴이 느려 학습에 오래 걸린다 |
| Deformable DETR | 참조점 주변만 보는 어텐션으로 수렴 속도와 작은 객체 성능을 개선했다 |
| DINO · RT-DETR | DETR 계열을 실시간 영역까지 끌어온 후속 연구 |
NMS(Non-Maximum Suppression) 를 없앴다는 점이 실무에서 의미가 있다. NMS 임계값은 손으로 맞춰야 하고 겹친 객체가 많은 장면에서 오작동하기 쉬운데, 그 단계가 사라지면 후처리 파이프라인이 단순해진다.
| 상황 | 후보 |
|---|---|
| 초당 프레임 수가 중요하고 엣지 장비에 올린다 | YOLO 계열, YOLOX, SSD |
| 정확도와 연산량의 균형 | EfficientDet, RetinaNet, FCOS |
| 작은 객체가 많고 속도는 덜 중요하다 | Faster R-CNN 계열 |
| 후처리를 단순하게 가져가고 싶다 | DETR 계열 |
성능 수치보다 먼저 볼 것이 두 가지 있다.