📑논문노트

👁️ 주제별 논문

컴퓨터 비전

이미지 분류·객체 검출·영상 분할의 표준 논문 6편. CNN에서 Vision Transformer, 기초모델까지의 흐름을 정리했습니다.

컴퓨터 비전 과제는 대개 세 가지 문제 중 하나를 다룹니다. 이미지가 무엇인지 맞히는 분류, 어디에 있는지 찾는 검출, 픽셀 단위로 경계를 그리는 분할입니다. 각 문제마다 표준 논문이 정해져 있어 인용 선택이 비교적 쉽습니다.

검출에서는 속도를 택한 YOLO와 정확도를 택한 Faster R-CNN을 대비시키는 구성이 발표에서 특히 효과적입니다. 분할에서는 U-Net이 여전히 기본형이며, 최근에는 Segment Anything이 '학습 없이 무엇이든 분할한다'는 새로운 패러다임을 제시했습니다.

ViT와 CLIP은 비전 분야가 자연어처리 기술을 흡수한 사례로, 멀티모달 AI를 설명할 때 반드시 등장합니다.

이 주제의 핵심 논문 6편

아래 목록은 제목과 한두 줄 요약으로 먼저 훑어보고, 필요한 자료만 원문으로 넘어가도록 구성했습니다. 상세 정리 보기 표시가 있는 논문은 과제용 정리 페이지가 준비되어 있습니다.

이미지는 16×16 단어의 가치가 있다 (Vision Transformer)

An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

Alexey Dosovitskiy 외 · 2021 · ICLR 2021

이미지를 패치 단위로 잘라 토큰처럼 다루면 합성곱 없이 트랜스포머만으로 최고 수준의 분류 성능을 낼 수 있음을 보였다.

왜 중요한가 비전 분야에 트랜스포머를 도입한 분기점으로, CNN과 비교 서술할 때 필수다.

ViT트랜스포머이미지분류

U-Net: 생의학 영상 분할을 위한 합성곱 신경망

U-Net: Convolutional Networks for Biomedical Image Segmentation

Olaf Ronneberger, Philipp Fischer, Thomas Brox · 2015 · MICCAI 2015

수축 경로와 확장 경로를 대칭으로 연결한 U자형 구조로, 적은 학습 데이터에서도 정밀한 픽셀 단위 분할을 달성했다.

왜 중요한가 의료영상 분할의 사실상 표준이며 확산 모델의 백본으로도 재활용된다.

영상분할의료영상인코더-디코더

한 번만 보면 된다: 통합된 실시간 객체 검출

You Only Look Once: Unified, Real-Time Object Detection

Joseph Redmon, Santosh Divvala, Ross Girshick, Ali Farhadi · 2016 · CVPR 2016

객체 검출을 단일 회귀 문제로 재정의해 한 번의 신경망 통과로 위치와 종류를 동시에 예측, 실시간 처리를 가능하게 했다.

왜 중요한가 실시간 검출 계열(YOLO 시리즈)의 출발점으로 산업 응용 사례에 자주 인용된다.

객체검출실시간

Faster R-CNN: 영역 제안 신경망을 통한 실시간 객체 검출

Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks

Shaoqing Ren, Kaiming He, Ross Girshick, Jian Sun · 2015 · NeurIPS 2015

후보 영역 생성까지 신경망 안으로 통합(RPN)하여 2단계 객체 검출의 속도와 정확도를 함께 끌어올렸다.

왜 중요한가 2단계 검출기의 대표 문헌으로 YOLO와 대비해 설명하기 좋다.

객체검출RPN

자연어 감독으로부터 전이 가능한 시각 모델 학습 (CLIP)

Learning Transferable Visual Models From Natural Language Supervision

Alec Radford 외 (OpenAI) · 2021 · ICML 2021

인터넷의 이미지–문장 쌍 4억 개로 대조 학습을 수행해, 별도 학습 없이 새로운 분류 과제를 수행하는 제로샷 능력을 얻었다.

왜 중요한가 멀티모달 AI와 이미지 생성 모델의 텍스트 이해를 담당하는 핵심 기반 기술이다.

멀티모달제로샷대조학습

무엇이든 분할하기 (Segment Anything)

Segment Anything

Alexander Kirillov 외 (Meta AI) · 2023 · ICCV 2023

1,100만 장 이미지·10억 개 마스크로 학습한 프롬프트 기반 분할 모델로, 학습하지 않은 대상도 클릭 한 번으로 분할한다.

왜 중요한가 비전 분야의 기초모델(foundation model) 사례로 최신 동향 서술에 적합하다.

기초모델영상분할프롬프트

이 주제로 과제를 쓸 때

자주 묻는 질문

CNN과 Transformer 중 무엇을 써야 하나요?

데이터 규모가 결정합니다. 수천 장 이하면 CNN 계열 전이학습이, 수십만 장 이상이면 ViT가 유리하다는 것이 ViT 논문의 결론입니다.

다른 주제 둘러보기

이 주제의 최신 논문을 직접 찾아보세요

아래 검색창은 전 세계 학술 데이터베이스(OpenAlex)에서 실시간으로 논문을 찾습니다.