👁️ 주제별 논문
컴퓨터 비전
이미지 분류·객체 검출·영상 분할의 표준 논문 6편. CNN에서 Vision Transformer, 기초모델까지의 흐름을 정리했습니다.
컴퓨터 비전 과제는 대개 세 가지 문제 중 하나를 다룹니다. 이미지가 무엇인지 맞히는 분류, 어디에 있는지 찾는 검출, 픽셀 단위로 경계를 그리는 분할입니다. 각 문제마다 표준 논문이 정해져 있어 인용 선택이 비교적 쉽습니다.
검출에서는 속도를 택한 YOLO와 정확도를 택한 Faster R-CNN을 대비시키는 구성이 발표에서 특히 효과적입니다. 분할에서는 U-Net이 여전히 기본형이며, 최근에는 Segment Anything이 '학습 없이 무엇이든 분할한다'는 새로운 패러다임을 제시했습니다.
ViT와 CLIP은 비전 분야가 자연어처리 기술을 흡수한 사례로, 멀티모달 AI를 설명할 때 반드시 등장합니다.