📑논문노트

💬 주제별 논문

자연어처리와 대규모 언어모델

트랜스포머부터 GPT-3, RLHF, RAG까지 — ChatGPT를 학술적으로 설명하려면 반드시 인용해야 할 논문 9편.

'ChatGPT는 어떻게 작동하는가'를 학술적으로 서술해야 할 때, 뉴스 기사나 기업 블로그를 인용하면 근거로 인정받기 어렵습니다. 다행히 이 질문에 답하는 논문의 계보는 명확합니다.

구조는 트랜스포머(Vaswani 외, 2017), 학습 방식은 사전학습(BERT) 또는 자기회귀 생성(GPT-3), 사람 말을 잘 듣게 만드는 과정은 RLHF(InstructGPT), 사실성을 보강하는 방법은 RAG, 적은 자원으로 맞춤화하는 방법은 LoRA입니다. 이 다섯 편이면 현대 언어모델 설명의 뼈대가 완성됩니다.

word2vec과 GloVe는 트랜스포머 이전 세대이지만, '컴퓨터가 단어의 의미를 숫자로 다룬다'는 개념을 설명하는 데 여전히 가장 직관적인 출발점입니다.

이 주제의 핵심 논문 9편

아래 목록은 제목과 한두 줄 요약으로 먼저 훑어보고, 필요한 자료만 원문으로 넘어가도록 구성했습니다. 상세 정리 보기 표시가 있는 논문은 과제용 정리 페이지가 준비되어 있습니다.

어텐션만으로 충분하다

Attention Is All You Need

Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin · 2017 · NeurIPS 2017

순환·합성곱 구조를 모두 제거하고 self-attention만으로 구성한 트랜스포머(Transformer) 아키텍처를 제안했다. 병렬 학습이 가능해 학습 시간을 크게 줄이면서 기계번역 성능을 끌어올렸다.

왜 중요한가 GPT·BERT를 포함한 현대 언어모델 전부의 뼈대이며, AI 관련 과제라면 사실상 필수 인용 문헌이다.

트랜스포머어텐션기계번역

BERT: 언어 이해를 위한 심층 양방향 트랜스포머 사전학습

BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova · 2019 · NAACL-HLT 2019

문장의 양쪽 문맥을 동시에 보는 마스크 언어모델(MLM)로 사전학습한 뒤 소규모 데이터로 미세조정하는 방식을 제시했다.

왜 중요한가 '사전학습 → 미세조정' 패러다임을 정착시켜 NLP 연구 방식을 바꿨다.

사전학습미세조정언어이해

언어모델은 소수 예시 학습자다 (GPT-3)

Language Models are Few-Shot Learners

Tom B. Brown 외 (OpenAI) · 2020 · NeurIPS 2020

1,750억 파라미터 언어모델이 별도 미세조정 없이 프롬프트에 담긴 몇 개의 예시만으로 다양한 과제를 수행함을 보였다.

왜 중요한가 '프롬프트 엔지니어링'과 거대 언어모델 논의의 출발점 문헌이다.

대규모언어모델few-shot프롬프트

인간 피드백을 통해 지시를 따르도록 언어모델 학습하기

Training Language Models to Follow Instructions with Human Feedback

Long Ouyang 외 (OpenAI) · 2022 · NeurIPS 2022

사람이 매긴 선호 데이터로 보상모델을 만들고 강화학습(RLHF)으로 정렬하여, 더 작은 모델이 GPT-3보다 사용자 지시를 잘 따르게 만들었다.

왜 중요한가 ChatGPT 계열 모델의 학습 방식을 설명할 때 핵심 근거로 인용된다.

RLHF정렬인간피드백

사고 사슬 프롬프팅이 대규모 언어모델의 추론을 이끌어낸다

Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed Chi, Quoc Le, Denny Zhou · 2022 · NeurIPS 2022

정답만 제시하는 대신 중간 추론 과정을 예시로 보여주면 산술·상식 추론 정확도가 크게 오른다는 것을 실험으로 보였다.

왜 중요한가 프롬프트 설계 연구의 대표 문헌으로, 생성형 AI 활용 과제에 바로 쓸 수 있다.

추론프롬프트창발능력

지식 집약적 NLP 과제를 위한 검색 증강 생성(RAG)

Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks

Patrick Lewis 외 · 2020 · NeurIPS 2020

외부 문서를 검색해 생성 모델의 입력에 결합함으로써 사실성을 높이는 구조를 제안했다.

왜 중요한가 환각(hallucination) 완화와 사내 문서 검색 시스템 설계의 기준 문헌이다.

RAG검색환각완화

LoRA: 대규모 언어모델의 저계수 적응

LoRA: Low-Rank Adaptation of Large Language Models

Edward J. Hu 외 · 2021 · ICLR 2022

원 가중치는 고정하고 저계수 행렬만 학습해 학습 파라미터를 수천 분의 일로 줄이면서 성능을 유지했다.

왜 중요한가 적은 자원으로 LLM을 미세조정하는 실무 표준 기법이다.

미세조정효율화PEFT

벡터 공간에서의 단어 표현 효율적 추정 (word2vec)

Efficient Estimation of Word Representations in Vector Space

Tomas Mikolov, Kai Chen, Greg Corrado, Jeffrey Dean · 2013 · ICLR 2013 Workshop

단어를 저차원 밀집 벡터로 학습하는 CBOW·Skip-gram 모델을 제안하여 '왕−남자+여자=여왕' 식의 의미 연산을 가능하게 했다.

왜 중요한가 단어 임베딩 개념을 대중화한 문헌으로 텍스트 마이닝 과제에 자주 인용된다.

임베딩단어벡터

GloVe: 단어 표현을 위한 전역 벡터

GloVe: Global Vectors for Word Representation

Jeffrey Pennington, Richard Socher, Christopher D. Manning · 2014 · EMNLP 2014

전역 동시출현 통계를 행렬 분해 방식으로 학습해 단어 벡터를 만드는 방법을 제안했다.

왜 중요한가 word2vec과 함께 임베딩 방법론을 비교할 때 짝으로 인용된다.

임베딩동시출현

이 주제로 과제를 쓸 때

자주 묻는 질문

ChatGPT 자체의 논문이 있나요?

GPT-4 기술 보고서는 있으나 학습 방법이 공개되어 있지 않습니다. 작동 원리를 설명할 때는 GPT-3과 InstructGPT 논문을 인용하는 것이 표준입니다.

한국어 자연어처리 자료도 필요합니다.

KLUE 벤치마크 논문과 KoBERT 관련 문헌을 함께 찾아보세요. 상단 검색창에 'Korean language model'로 검색하면 실제 논문 목록을 볼 수 있습니다.

다른 주제 둘러보기

이 주제의 최신 논문을 직접 찾아보세요

아래 검색창은 전 세계 학술 데이터베이스(OpenAlex)에서 실시간으로 논문을 찾습니다.