어텐션만으로 충분하다
Attention Is All You Need
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin · 2017 · NeurIPS 2017
순환·합성곱 구조를 모두 제거하고 self-attention만으로 구성한 트랜스포머(Transformer) 아키텍처를 제안했다. 병렬 학습이 가능해 학습 시간을 크게 줄이면서 기계번역 성능을 끌어올렸다.
왜 중요한가 GPT·BERT를 포함한 현대 언어모델 전부의 뼈대이며, AI 관련 과제라면 사실상 필수 인용 문헌이다.
트랜스포머어텐션기계번역
BERT: 언어 이해를 위한 심층 양방향 트랜스포머 사전학습
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova · 2019 · NAACL-HLT 2019
문장의 양쪽 문맥을 동시에 보는 마스크 언어모델(MLM)로 사전학습한 뒤 소규모 데이터로 미세조정하는 방식을 제시했다.
왜 중요한가 '사전학습 → 미세조정' 패러다임을 정착시켜 NLP 연구 방식을 바꿨다.
사전학습미세조정언어이해
언어모델은 소수 예시 학습자다 (GPT-3)
Language Models are Few-Shot Learners
Tom B. Brown 외 (OpenAI) · 2020 · NeurIPS 2020
1,750억 파라미터 언어모델이 별도 미세조정 없이 프롬프트에 담긴 몇 개의 예시만으로 다양한 과제를 수행함을 보였다.
왜 중요한가 '프롬프트 엔지니어링'과 거대 언어모델 논의의 출발점 문헌이다.
대규모언어모델few-shot프롬프트
인간 피드백을 통해 지시를 따르도록 언어모델 학습하기
Training Language Models to Follow Instructions with Human Feedback
Long Ouyang 외 (OpenAI) · 2022 · NeurIPS 2022
사람이 매긴 선호 데이터로 보상모델을 만들고 강화학습(RLHF)으로 정렬하여, 더 작은 모델이 GPT-3보다 사용자 지시를 잘 따르게 만들었다.
왜 중요한가 ChatGPT 계열 모델의 학습 방식을 설명할 때 핵심 근거로 인용된다.
RLHF정렬인간피드백
사고 사슬 프롬프팅이 대규모 언어모델의 추론을 이끌어낸다
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed Chi, Quoc Le, Denny Zhou · 2022 · NeurIPS 2022
정답만 제시하는 대신 중간 추론 과정을 예시로 보여주면 산술·상식 추론 정확도가 크게 오른다는 것을 실험으로 보였다.
왜 중요한가 프롬프트 설계 연구의 대표 문헌으로, 생성형 AI 활용 과제에 바로 쓸 수 있다.
추론프롬프트창발능력
지식 집약적 NLP 과제를 위한 검색 증강 생성(RAG)
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
Patrick Lewis 외 · 2020 · NeurIPS 2020
외부 문서를 검색해 생성 모델의 입력에 결합함으로써 사실성을 높이는 구조를 제안했다.
왜 중요한가 환각(hallucination) 완화와 사내 문서 검색 시스템 설계의 기준 문헌이다.
RAG검색환각완화
LoRA: 대규모 언어모델의 저계수 적응
LoRA: Low-Rank Adaptation of Large Language Models
Edward J. Hu 외 · 2021 · ICLR 2022
원 가중치는 고정하고 저계수 행렬만 학습해 학습 파라미터를 수천 분의 일로 줄이면서 성능을 유지했다.
왜 중요한가 적은 자원으로 LLM을 미세조정하는 실무 표준 기법이다.
미세조정효율화PEFT
벡터 공간에서의 단어 표현 효율적 추정 (word2vec)
Efficient Estimation of Word Representations in Vector Space
Tomas Mikolov, Kai Chen, Greg Corrado, Jeffrey Dean · 2013 · ICLR 2013 Workshop
단어를 저차원 밀집 벡터로 학습하는 CBOW·Skip-gram 모델을 제안하여 '왕−남자+여자=여왕' 식의 의미 연산을 가능하게 했다.
왜 중요한가 단어 임베딩 개념을 대중화한 문헌으로 텍스트 마이닝 과제에 자주 인용된다.
임베딩단어벡터
GloVe: 단어 표현을 위한 전역 벡터
GloVe: Global Vectors for Word Representation
Jeffrey Pennington, Richard Socher, Christopher D. Manning · 2014 · EMNLP 2014
전역 동시출현 통계를 행렬 분해 방식으로 학습해 단어 벡터를 만드는 방법을 제안했다.
왜 중요한가 word2vec과 함께 임베딩 방법론을 비교할 때 짝으로 인용된다.
임베딩동시출현